Новая коллекция моделей Qwen3-VL от Alibaba

Недавно Alibaba анонсировала новую коллекцию моделей Qwen3-VL, доступную по ссылке. В своем блоге они продемонстрировали впечатляющие функции этих моделей. Qwen3-VL поддерживает работу с 32 языками и позволяет пользователям отправлять изображения для анализа, генерировать HTML-страницы по рисункам и распознавать текст на фотографиях. Модели способны объяснять математические формулы и предметы, такие как математика и химия, используя контекст до 256k.

В последние недели автор обзора использовал модель GPT-OSS-120B, но теперь переключился на Qwen3-VL-30B-A3B-Thinking-FP8. Несмотря на небольшие различия в производительности, Qwen3-VL-30B имеет уникальную возможность обработки изображений, в то время как GPT-OSS более строго цензурирован.

Скорость генерации токенов у обеих моделей сопоставима. Для запуска Qwen3-VL требуется система с Ubuntu и NVIDIA GPU. Подробная инструкция по запуску доступна здесь. Модели удобны и многофункциональны, и пользователи могут взаимодействовать с ними через API или использовать интерфейсы, такие как OpenWebUI.