Google представила голосовые модели Gemini 3.8 Live и Extended Thinking

Google представила две новые диалоговые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они рассчитаны на разговорное взаимодействие в реальном времени и поддерживают параллельное выполнение фоновых задач во время диалога.
Базовая Gemini 3.8 Live предназначена для масштабного внедрения и отличается высокой энергоэффективностью. Модель умеет почти без задержки обрабатывать видеопоток с камеры, переключаться между 97 языками прямо во время фразы и обращаться к внешним инструментам через API, не прерывая разговор паузами.
Рассуждение без «мёртвой тишины»
Gemini 3.8 Live Extended Thinking создана для сложных многоэтапных сценариев. Её ключевая особенность — способность одновременно рассуждать и поддерживать голосовой диалог. Модель может использовать естественные речевые связки вроде «Дай-ка я проверю», объяснять ход своих действий и координировать фоновые процессы, пока продолжает общение с пользователем.
В бенчмарке качества голосового взаимодействия Speech to Speech Quality Index от Artificial Analysis версия Extended Thinking заняла первое место с результатом 82,6%. Для сравнения, GPT-Live-1 Astra от OpenAI набрала 81,5%, а Grok Voice Think Fast 2.0 от xAI — 81,3%. Базовая Gemini 3.8 Live получила 76,0%.
В тесте агентных сценариев τ-Voice результат модели Extended Thinking составил 68,6% против 67,9% у GPT-Live-1 Astra и 56,5% у Grok Voice. В финансовом бенчмарке τ³-Banking от Sierra Google также оказалась впереди: 35,1% против 32,0% у OpenAI и 16,5% у xAI. В логическом тесте Big Bench Audio новинка показала точность 97,7%.
Стоимость и защита голосового контента
По данным Artificial Analysis, час входящего аудио для Gemini 3.8 Live стоит разработчикам $0,84, а для Extended Thinking — $3,50. У Grok Voice Think Fast 2.0 аналогичный объём обходится в $4,80, у GPT-Live-1 Astra — в $5,83. Таким образом, обе модели Google дешевле сопоставимых решений конкурентов, хотя Extended Thinking заметно дороже базовой версии.
Сгенерированные голосовые ответы Gemini маркируются невидимым цифровым водяным знаком SynthID. Google связывает эту функцию с защитой от распространения дезинформации и возможностью отличать синтетический голосовой контент.
Обе модели уже доступны разработчикам в Google AI Studio и через Gemini Live API. Базовая версия также появилась в сервисе Search Live. Gemini 3.8 Live Extended Thinking постепенно разворачивается в приложении Gemini Live и корпоративных сервисах Google Workspace — Docs Live, Gmail Live и Keep Live — для подписчиков тарифов Google AI.


