Результаты тестирования Claude Opus 4.5 от METR

Организация METR, специализирующаяся на оценке ИИ, представила результаты тестирования модели Claude Opus 4.5 от компании Anthropic. Эта модель продемонстрировала 50%-горизонт в 4 часа 49 минут, что является наилучшим показателем среди протестированных систем. Это означает, что Opus 4.5 может выполнять задачи длительностью около 4 часов 49 минут с вероятностью 50%. Предыдущий рекорд принадлежал GPT-5.1-Codex-Max от OpenAI с результатом 2 часа 53 минуты.

Методология METR фокусируется на длине задач, выполняемых ИИ без человеческой помощи, и, как показывает практика, этот показатель удваивается примерно каждые 7 месяцев. Однако исследователи предостерегают от чрезмерных оптимистичных выводов, так как доверительный интервал результата колеблется от 1 часа 49 минут до 20 часов 25 минут. При более высоком пороге успеха в 80% горизонт Opus 4.5 снижается до 27 минут, что сопоставимо с другими современными моделями. В будущем METR планирует обновить тестовый набор для более точной оценки прогресса.