Alibaba Cloud представила новую мультимодальную модель Qwen3.5-Omni

Команда Alibaba Cloud представила Qwen3.5-Omni, революционную мультимодальную модель, которая принимает текст, изображения, аудио и видео, а возвращает текст и речь в реальном времени. Новинка доступна в трех версиях — Plus, Flash и Light, через Offline API и Realtime API. Главное обновление заключается в увеличенном контекстном окне до 256 тысяч токенов, что позволяет обрабатывать более 10 часов аудио и 400 секунд видео 720p за один запрос. Распознавание речи теперь охватывает 113 языков, а синтез — 36 языков. При тестировании версия Plus показала выдающиеся результаты на 36 аудио- и аудио-видео бенчмарках, обойдя конкурентов в области генерации речи и понимания контента. Новые функции включают семантическое прерывание, клонирование голоса и адаптивное выравнивание текстовых токенов, что улучшает качество общения. Неожиданным эффектом стало также создание кода при просмотре видео с инструкциями, что компания не планировала изначально.