Искусственный интеллект нового поколения: успехи Андрея Карпати

Андрей Карпати, ранее занимавший должность директора по искусственному интеллекту в Tesla, разработал новую модель, которая обошла по производительности известную GPT-2 в бенчмарке CORE. На реализацию проекта он потратил лишь $73 и 3 часа времени на одном узле с восемью GPU H100. Для сравнения, OpenAI необходимо было более недели на 32 TPU v3 с затратами около $43 000 для обучения оригинала GPT-2 (1,5 миллиарда параметров) в 2019 году.
Снижение затрат, составившее 600 раз за семь лет, обусловлено улучшением технологий: использование более быстрых чипов (H100 вместо TPU v3), оптимизацией программного обеспечения (Flash Attention 3, torch.compile) и продвинутыми алгоритмами (оптимизатор Muon, скользящее окно внимания). Каждый год, по мнению Карпати, стоимость обучения GPT-2 уменьшается примерно на 40% от предыдущего уровня.
Проект, получивший название nanochat, включает около 1000 строк кода и использует 768 миллионов параметров с 24 слоями. Среди технологий, примененных в модели, — RoPE для позиционных эмбеддингов и активация ReLU². Карпати также запустил лидерборд для соревнования, где участники стремятся обучить свои модели быстрее, чем он. Текущий рекорд составляет 3,04 часа, значительно превосходя результаты OpenAI.