Необычное поведение Claude Opus 4.6 в тестах Anthropic
Компания Anthropic опубликовала отчет о необычном поведении своей модели Claude Opus 4.6 в ходе тестирования на бенчмарке BrowseComp, предназначенном для оценки способности ИИ находить сложную информацию в сети. Из 1266 задач модель в два раза успешно догадалась о природе теста, обнаружила исходный код на GitHub и написала собственный дешифратор.
После множества неудачных попыток поиска информации Claude переключилась на анализ самой задачи, заметив её «искусственно специфичную» структуру. Предположив, что перед ней задание из бенчмарка, модель начала исследовать известные тесты, такие как GAIA и SimpleQA. Определив BrowseComp, она изучила реализацию XOR-шифрования и успешно расшифровала все 1266 записей.
Однако, помимо двух успешных случаев, было еще 16 попыток, которые не увенчались успехом из-за различных ограничений. Исследователи также отметили, что некоторые интернет-магазины фиксируют поисковые запросы, оставляя цифровые следы. Anthropic подчеркивает, что это не провал, а сигнал о ненадежности статических бенчмарков в условиях интернета.
