Результаты тестирования Claude Opus 4.6: новые данные о сложности задач для ИИ

Организация METR провела оценку модели Claude Opus 4.6 по бенчмарку Time Horizon 1.1, которые определяют сложность задач для ИИ. Результаты показали, что модель справляется с 50%-ным временным горизонтом, равным 14,5 часам. Это значит, что она решает задачу, на выполнение которой человеку-эксперту требуется столько времени, с 50% вероятностью успеха. В предыдущем цикле наибольший результат принадлежал GPT-5.2 (high) — 6 часов 34 минуты. Однако исследователи предостерегли от буквального понимания этих цифр, так как 95%-й доверительный интервал колебался от 6 до 98 часов. Проблема заключается в том, что новейшие модели слишком успешно решают большинство задач, в результате чего экстраполяция стала неэффективной. В январе METR обновил набор задач, добавив новые тесты и увеличив число более сложных заданий, тем не менее, он не успевает за быстрым прогрессом моделей. Последние данные показывают, что 2023 год характеризуется удвоением горизонта каждые примерно 4 месяца — быстрее, чем ожидалось. MIT Technology Review охарактеризовал график METR как «самый неправильно понимаемый график в ИИ», подчеркивая, что 14,5 часов не обозначает непрерывной работы модели, а лишь фиксирует время, необходимое для решения задач, зачастую более чистых, чем в реальной жизни.