Google представила обновлённую модель Gemini 2.5 Flash Native Audio

Компания Google выпустила новую модель Gemini 2.5 Flash Native Audio, которая демонстрирует превосходство над OpenAI gpt-realtime в тестах ComplexFuncBench Audio. В этом тесте модель набрала 71,5%, в то время как gpt-realtime показал 66,5%. Google утверждает, что точность следования инструкциям разработчиков возросла до 90%, что значительно выше предыдущих 84%. Также улучшено удержание контекста в многоходовых диалогах. Модель уже интегрирована в голосовой режим приложений Gemini и Search Live, заменив каскадную архитектуру на нативное аудио. Разработчики могут использовать Gemini 2.5 Flash Native Audio через Google AI Studio и Vertex AI, а также в Gemini API в режиме предварительного просмотра. Первые клиенты, такие как United Wholesale Mortgage, сообщают о значительных успехах с использованием голосового ассистента Mia. В дополнение к этому, Google запустила бета-версию функции синхронного перевода речи в Google Translate, доступную на Android для пользователей в США, Мексике и Индии.