Новые бенчмарки для нейросетей: что показывает исследование

Каждую неделю на рынке появляются новые бенчмарки для нейросетей, включая GPQA Diamond, Lexometrica и LLM Persuasion Benchmark. Эти инструменты позволяют определить, как различные модели, такие как GPT-5.4 и Kimi K2.5, показывают свои способности в различных задачах. Мы наблюдаем, что результаты подтверждаются четырьмя независимыми бенчмарками, что увеличивает доверие к полученным данным. Однако важно отметить, что мы не нашли систематического бенчмарка для тестирования российских моделей в сравнении с глобальными.

В нашем исследовании были протестированы 54 модели и 32 сценария на русском языке. Результаты показали, что Orange AI, MiniMax и MiMo V2 демонстрируют высокий уровень, в то время как российские разработки, такие как GigaChat и Яндекс, уступают в рейтинге. Например, GigaChat-Ultra набрала лишь 3.26, тогда как лучшие модели, такие как Claude Sonnet, достигают 4.78.

Китайские модели, такие как Kimi и MiniMax, практически достигли уровня международных аналогов и работают без VPN, что делает их доступными для российских пользователей. Наблюдается сжатие разрыва между глобальными лидерами и доступными в России моделями, это важно для будущего применения ИИ в нашей стране.