Оптимизация ИИ: Бенчмарк ARC теряет свою сложность

Бенчмарк ARC (Abstraction and Reasoning Corpus), ранее считавшийся одним из самых сложных испытаний для оценки абстрактного мышления ИИ, стал ещё одной жертвой оптимизации. Аналитики и стартап Poetiq сообщают, что современные модели, такие как GPT‑5.2 X‑High, достигли до 75% точности на ARC‑AGI‑2, что превосходит уровень человеческой оценки. Первоначально ARC предназначался для измерения истинного интеллекта, требующего абстрактного мышления, однако недавние успехи показывают, как инженерные подходы, включая улучшенные промпты и самокорректирование, трансформируют ARC в цель для оптимизации. Poetiq описывает, как их система генерирует код для решения задач и проверяет результаты, что значительно повышает точность. Однако высокие показатели актуальны только для открытых наборов данных, тогда как на закрытых результаты могут оказаться ниже, что вызывает сомнения в истинных способностях моделей к обобщению, а не простому оптимизации. Эксперты подчеркивают, что основная цель ARC — развитие универсального интеллекта, а не просто достижение рекордов.