Исследование Goodfire AI и Гарварда: Театральное рассуждение в AI-моделях

Команда исследователей из Goodfire AI и Гарварда провела анализ reasoning-моделей, таких как DeepSeek-R1 и GPT-OSS, обнаружив феномен «театрального рассуждения». Модели демонстрируют высокую уверенность в своих ответах, достигая 90%, но продолжают развивать цепочку рассуждений, как будто все еще склонны к размышлениям. Используемые методы включали тесты на скрытых состояниях, обрывы мышления и внешний мониторинг текста. На простых задачах из MMLU разница между оценками и выводами моделей была значительной. Возможно, они «знали» ответы, но их рассуждения создавали впечатление продолжительного анализа. В то время как на более сложных вопросах из GPQA-Diamond уверенность росла синхронно с генерацией текста. Открытия указывают на возможность оптимизации генерации ответов: если зонд выявляет уверенность, процесс можно остановить, что экономит токены при сохранении точности. Тем самым модели, исследованные в работе, могут оказаться недостаточно адаптированными к современным требованиям.