Новые модели P1 от PRIME-RL: достижения и перспективы

Команда PRIME-RL анонсировала новые модели P1, разработанные с применением многоступенчатого усиленного обучения и системы агентов PhysicsMinions. Лидером среди них стала модель P1‑235B‑A22B, которая первой из открытых моделей достигла золотого уровня на IPhO 2025, что ранее было возможно только для закрытых решений. На основе HiPhO, объединяющего 13 международных олимпиад по физике, модель набрала в среднем 38.4 балла, обойдя такие аналоги, как Gemini‑2.5‑Pro и GPT‑5. Меньшая версия P1‑30B‑A3B также показала замечательные результаты, завоевав серебро на IPhO с 18.5 баллами из 30, а также 8 золотых и 4 серебряные медали на других конкурсах. Эти успехи подчеркивают высокую эффективность даже компактных моделей P1. Кроме того, P1 демонстрирует выдающуюся генерализацию в математике и программировании, значительно опережая базовые версии Qwen3. Теперь исследователи могут скачивать модели P1 для экспериментов и образовательных проектов. Вопросы о будущем применении этих моделей в научных исследованиях и инженерии остаются открытыми. Делегируйте рутинные задачи с BotHub и получите 100 000 бесплатных токенов для первых задач!