DeepReinforce представляет CUDA L2 для оптимизации GPU кода

Команда исследователей DeepReinforce анонсировала революционную систему CUDA L2, которая автоматически генерирует код для GPU, ориентируясь на матричное умножение. Результаты показывают, что ядра, созданные с помощью этой системы, работают на 10–30% быстрее, чем традиционные библиотеки cuBLAS и cuBLASLt, что вызывает большой интерес в технологической сфере.

CUDA L2 использует инновационный подход, сочетая языковую модель и обучение с подкреплением. Это позволяет создавать CUDA ядра с нуля под конкретные размеры матриц, а затем оптимизировать их в реальном времени. Генератор DeepSeek 671B, прошедший обучение на большом объёме кода, позволяет системе обрабатывать около тысячи различных конфигураций матриц, обеспечивая высокую производительность в различных сценариях.

Тестирование показало, что CUDA L2 в оффлайн-режиме быстрее torch.matmul и cuBLAS в среднем на 17–22%, а в серверном режиме ускорение достигает 24–29%. Авторы планируют дальнейшую оптимизацию для новых архитектур и увеличение диапазона поддерживаемых конфигураций, что может сделать этот подход новым стандартом в оптимизации производительности.