Текущие бенчмарки часто не способны измерить, как модели ИИ справляются с долгосрочным принятием решений в условиях неопределенности, когда обратная связь задерживается, а информация остается неполной. Изучение практических навыков принятия решений обеспечивает более строгую и честную оценку машинного мышления, чем стандартные тесты «вопрос-ответ».