Создатель Redis выпустил реализацию Voxtral Realtime 4B на чистом C

Сальваторе Санфилиппо, известный как antirez и создатель Redis, опубликовал на GitHub проект под названием voxtral.c. Этот проект представляет собой реализацию модели Voxtral Realtime 4B от Mistral на чистом C. Модель с 4 миллиардами параметров позволяет преобразовывать речь в текст, работая как с микрофонами, так и с аудиофайлами, а сборка осуществляется всего одной командой make без нужды в сторонних библиотеках, таких как Python или PyTorch.

Voxtral Realtime 4B является потоковой моделью speech-to-text от Mistral и основывается на Ministral 3B, использующем аудиоэнкодер Whisper large-v3. Она работает с аудио длительностью до 30 минут и управляет контекстным окном на 32 000 токенов. Размеры весов модели составляют около 8,9 ГБ и она доступна под лицензией Apache 2.0. Mistral рекомендует запускать модель через vLLM, однако реализация antirez обходит эту необходимость.

Проект поддерживает ускорение на Apple Silicon через Metal Performance Shaders и на Linux с OpenBLAS. Voxtral.c также позволяет захватывать звук в реальном времени на macOS и принимать аудио через stdin, поддерживая любые форматы через ffmpeg. В репозитории доступна простой референсный Python-код для изучения архитектуры модели. Это уже третий проект antirez в линейке «ИИ на чистом C», и он подчеркивает возможность работы с нейросетями без громоздких ML-стеков.