Gemini 3.8 Live: как голосовой ИИ-агент работает без пауз

Gemini 3.8 Live позволяет голосовому ИИ-агенту говорить во время фоновых вызовов инструментов. Разбираем сценарии, риски и стоимость завершённой задачи.

Wednesday, September 16, 2026Omid Saffari
Gemini 3.8 Live: как голосовой ИИ-агент работает без пауз

15 сентября 2026 года Google открыла общий доступ к Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Главное практическое изменение легко сформулировать: теперь голосовой ИИ-агент может поддерживать разговор с клиентом, пока календарь, система заказов или API бронирования выполняет долгую операцию в фоне.

Как Gemini 3.8 Live поддерживает разговор во время запроса

Обычно голосовой агент решает две задачи одновременно: ведёт естественный диалог и выполняет реальные действия в другой системе.

Именно вторая задача часто делает разговор неловким. Агент запрашивает свободное время через API бронирования, ждёт ответа — и оставляет клиента в тишине. Тот повторяет просьбу, спрашивает, на связи ли оператор, или кладёт трубку. А если приложение принимает повтор за новую команду, одна и та же операция может запуститься дважды.

Gemini 3.8 Live меняет этот сценарий благодаря асинхронному вызову функций. Инструмент продолжает работать, не замораживая всю сессию. Пока запрос выполняется, клиент может дополнить вводные, исправить деталь или услышать, как продвигается процесс.

Gemini 3.8 Live Extended Thinking идёт дальше: модель разбирает многошаговую задачу и кратко сообщает о ходе работы, пока инструменты выполняют запросы. В примере самой Google это сценарий бронирования поездки с проверкой сразу нескольких систем без прерывания разговора.

Это не значит, что Gemini самостоятельно оформляет бронирование. Приложение по-прежнему получает вызов функции, обращается к календарю или системе заказов и возвращает результат. Модель отвечает за диалог вокруг этой операции.

Что выбратьКогда использоватьКак работает инструментСигнал завершения
gemini-3.8-liveЗадача простая, а инструмент отвечает быстроАсинхронный режим включён по умолчанию, но блокирующий тоже доступенturnComplete: true завершает ход
gemini-3.8-live-extended-thinkingНужны несколько шагов или инструмент отвечает несколько секундТолько асинхронный режим с уровнем рассуждения low, medium или highДождитесь interaction_status: "IDLE"

Последний столбец — источник опасной ошибки в продакшене. В Extended Thinking значение turnComplete: true может означать лишь, что модель закончила промежуточное голосовое сообщение. Сам запрос при этом ещё выполняется. Если в этот момент закрыть сессию, активировать кнопку бронирования или пометить задачу выполненной, система зафиксирует ложное завершение.

Учебная сцена из пластилина: клиент, фоновый запрос, сообщение о ходе работы и журнал подтверждённого завершения
Рабочая схема объединяет один живой разговор, одну фоновую задачу и одну подтверждённую запись о завершении.

Главная бизнес-метрика — стоимость завершённой задачи

Фоновая речь сама по себе не гарантирует экономии. Пока работает инструмент, модель генерирует дополнительные реплики, а в длинном диалоге на следующих ходах может повторно обрабатываться всё больше накопленного контекста. Функция оправдывает себя, только если непрерывный разговор приносит больше завершённых бронирований, снижает число брошенных звонков или сокращает объём ручной доработки.

Для обеих новых моделей Google указывает одинаковые стандартные тарифы: минута входящего аудио стоит $0.005, а исходящего — $0.018. Текстовый ввод стоит $0.75 за 1 млн токенов, текстовый вывод, включая токены рассуждения, — $4.50 за 1 млн токенов.

Возьмём пятиминутный звонок для бронирования, в котором модель говорит две минуты. Поскольку проактивное аудио включено постоянно, простая арифметика для нового аудиопотока выглядит так: $0.025 за пять минут входящего аудио плюс $0.036 за две минуты исходящего. Итого — $0.061 только за аудио.

Но это не полная стоимость звонка.

В руководстве по тарификации Live API сказано, что постоянная сессия может заново обрабатывать накопленный контекст на следующих ходах. Транскрипции добавляют расходы на текстовые токены, а Extended Thinking — на токены рассуждения. Календарь, CRM, телефония, хостинг, повторные попытки и перевод на человека в промежуточную сумму Google за аудио не входят.

Поэтому считайте иначе:

Стоимость завершённой задачи = все расходы на модель, инструменты, телефонию, инфраструктуру, повторные попытки и эскалации, разделённые на число подтверждённых завершённых задач.

Приятная расшифровка разговора ещё не означает, что задача выполнена. Для линии записи на приём результатом будет единожды созданный идентификатор бронирования, который правильно озвучен и подтверждён клиентом. Для поддержки по заказам — верное действие с нужным заказом в нужном аккаунте. Для перевода звонка — соединение с нужной очередью без потери контекста.

Google периодически возвращает суммарное потребление токенов в usageMetadata. Свяжите эту запись с идентификатором вызова инструмента, сессией оператора связи, итоговым бизнес-результатом и любой ручной работой. Так получится проверяемый журнал затрат по каждому звонку, а не приблизительная поминутная оценка, которую остаётся принимать на веру.

Заявленные при запуске показатели не заменяют такой пилот. Для Extended Thinking Google сообщает 68.6% в бенчмарке голосовых задач tau-Voice и 35.1% в его банковском варианте. Эти значения показывают, что модель можно тестировать в голосовых сценариях с ИИ-агентами. Но они не говорят, какая доля ваших клиентов завершит бронирование именно в вашем календаре, по вашим правилам и через вашу телефонную линию.

Четыре сценария, в которых ожидание действительно важно

Запись на приём в стоматологию

Операционный руководитель может поручить агенту уточнить желаемый день, проверить свободное время и сообщать, что поиск продолжается, пока календарь готовит ответ. Ценность не только в том, что пауза становится короче. Главное — больше подтверждённых записей и меньше обратных звонков от сотрудников.

Правило безопасности здесь жёсткое: сообщение о ходе поиска ещё не является записью на приём. Система должна создать бронирование только после того, как клиент выберет один из предложенных вариантов, а при повторных попытках необходимо использовать тот же ключ идемпотентности, чтобы один звонок не создал одинаковую запись дважды.

Проверка заказа в интернет-магазине

Руководитель поддержки может оставить клиента в том же диалоге, пока агент обращается к системе заказов. Если запрос меняется с «где моя посылка» на «измените адрес доставки», приложение должно считать новую просьбу актуальной, а прежнюю операцию — отменить или проигнорировать.

Плюс — меньше переводов на сотрудника в типовых ситуациях. Риск — дать правильный ответ на уже неактуальный вопрос, когда клиент успел перейти к другому.

Переоформление поездки

Поиск рейса, проверка правил, наличие мест в отелях и сравнение тарифов делают этот сценарий более подходящим для Extended Thinking. Пока работает несколько неблокирующих функций, модель может рассказывать о ходе процесса.

Оплату и изменение билетов нужно выполнять только после подтверждения. Естественный голос не снижает требования к согласованию необратимого действия.

Диагностика проблемы с аккаунтом в техподдержке

Быструю проверку аккаунта стоит направить в Gemini 3.8 Live. Для диагностики, где нужно собрать несколько логов и проверить конфигурацию, может быть оправдан Extended Thinking.

Такое разделение важно, потому что более глубокое рассуждение стоит дополнительных денег. Маршрутизируйте обращения по сложности, а затем сравнивайте долю решённых случаев и эскалаций. Не отправляйте каждый сброс пароля по более тяжёлому пути лишь потому, что название модели звучит надёжнее.

Сначала настройте жизненный цикл фоновой задачи, затем подключайте телефонию

Начните с сессии, которая запускается текстом, и инструмента-заглушки. Так проще изолировать асинхронную логику до того, как оператор связи, микрофон, аудиомост и рабочий календарь добавят ещё четыре места для отладки.

Пример ниже использует актуальные возможности Python SDK от Google: конфигурацию Extended Thinking, объявление неблокирующей функции, схему ответа инструмента, поля interaction_status и usageMetadata. Полученное аудио с частотой 24 кГц записывается в response.wav. Результат инструмента задаёт локальная заглушка, поэтому настоящий календарь не затрагивается.

Bash
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"
Python
import asyncio
import wave

from google import genai
from google.genai import types

client = genai.Client()
model = "gemini-3.8-live-extended-thinking"

check_availability = types.FunctionDeclaration(
    name="check_availability",
    description="Checks the calendar for the next available appointment.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {},
    },
)

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(thinking_level="low"),
    tools=[types.Tool(function_declarations=[check_availability])],
)


async def main():
    async with client.aio.live.connect(model=model, config=config) as session:
        await session.send_client_content(
            turns={
                "parts": [
                    {"text": "Find the next available appointment and keep me updated."}
                ]
            }
        )

        with wave.open("response.wav", "wb") as audio:
            audio.setnchannels(1)
            audio.setsampwidth(2)
            audio.setframerate(24000)

            async for message in session.receive():
                status = getattr(message, "interaction_status", None)

                if message.data is not None:
                    audio.writeframes(message.data)

                if message.usage_metadata:
                    print("Tokens:", message.usage_metadata.total_token_count)

                if message.tool_call:
                    replies = []
                    for call in message.tool_call.function_calls:
                        replies.append(
                            types.FunctionResponse(
                                id=call.id,
                                name=call.name,
                                response={"result": "Tuesday morning is available."},
                            )
                        )
                    await session.send_tool_response(function_responses=replies)

                if status == "IDLE":
                    print("Interaction complete")
                    break


if __name__ == "__main__":
    asyncio.run(main())

Чаще всего ошибку допустят здесь: остановят цикл при первом turnComplete. Extended Thinking может уже произнести «Я проверяю», но всё ещё ждать ответ инструмента. Продолжайте слушать, пока interaction_status не примет значение IDLE, и сохраняйте связь идентификатора вызова инструмента с итоговым бизнес-результатом.

В рабочем телефонном агенте добавляйте аудиомост только после того, как этот цикл заработает корректно. Более широкий обзор стоимости голосовых агентов поможет выбрать оператора связи и слой оркестрации вокруг модели. А если вы сравниваете учёт токенов у Google с более простым поминутным тарифом голосового интерфейса, расчёт стоимости звонка с GPT-Live-1 показывает, почему в обоих случаях важно делить расходы именно на завершённые задачи.

Стройте пилот вокруг журнала результатов, а не эффектной демонстрации

  1. Выберите одно событие завершения

    Возьмите один узкий сценарий — например, подтверждённую запись на приём. Зафиксируйте точное событие в базе данных, которое доказывает завершение, и перечислите все состояния, считающиеся сбоем, отказом клиента, дублированием операции или эскалацией на сотрудника.

  2. Записывайте весь жизненный цикл сессии

    Сохраняйте идентификатор сессии, каждый идентификатор вызова инструмента, изменения interaction_status, время начала и окончания работы инструмента, а также usageMetadata. Промежуточная голосовая реплика означает прогресс, но не завершение.

  3. Объедините все оплачиваемые компоненты

    Привяжите расходы на Gemini, платежи за календарь или CRM, связь, инфраструктуру, повторные попытки и рабочее время сотрудников к одной записи о звонке. Не сравнивайте примерные $0.061 за аудио у Google с полной стоимостью действующего решения.

  4. Проверьте сценарии сбоев

    Перебейте агента, измените запрошенную дату во время поиска, заставьте инструмент превысить время ожидания, верните отсутствие свободных вариантов и завершите звонок до получения результата. Убедитесь, что устаревшие вызовы не могут создать бронирование.

  5. Сравните завершённые задачи

    Проведите звонки одинаковых типов через текущий и новый процессы. Сравните долю подтверждённо выполненных задач, отказы клиентов, объём эскалаций, дублирующие операции и полную стоимость завершённой задачи. Говорить об экономии можно только после сверки всех этих записей.

Честные ограничения

Модель может заполнить паузу, но не ускорит медленный календарь, не исправит плохую телефонную связь и не решит за бизнес, какой результат считать завершённым.

Без дополнительных методов управления сессиями аудиосессии ограничены 15 минутами. Лимит контекста для нативного аудио составляет 128,000 токенов. Длинные звонки с большим числом реплик также стоят не так, как подсказывает простая оценка по длительности, поскольку старый контекст может обрабатываться повторно.

Безопасность по-прежнему остаётся задачей приложения. Для прямого подключения из браузера нужны временные токены, а не стандартный ключ API. Бронирование, возврат средств или изменение аккаунта всё так же требуют аутентификации, проверки, идемпотентности и аудиторского следа.

Асинхронный режим создаёт ещё один продакшен-риск — устаревшую операцию. Если клиент меняет запрос, пока инструмент работает, прежний результат может прийти позже. Явно отслеживайте состояние задачи и отклоняйте результаты, которые больше не соответствуют текущему намерению.

Что сделать в понедельник: настроить метрики для одной узкой очереди

Действуйте на этой неделе, если из-за пауз при ожидании инструментов клиенты повторяют просьбу, прерывают бронирование или создают дополнительную работу сотрудникам. Используйте Gemini 3.8 Live для прямых запросов, а Extended Thinking — для одного действительно многошагового сценария. В обоих случаях ведите единый журнал завершений.

Подождите, если пока невозможно доказать завершение в собственной системе, канал оператора связи ещё не отлажен или процесс содержит необратимое действие без этапа подтверждения. Сначала нужна надёжная запись о результате, а уже затем — новая модель.

Этот релиз несущественен для продуктов без голосового интерфейса, для голосовых сценариев, где инструменты и так отвечают мгновенно, и для действующего телефонного агента, который уже достигает целевых показателей завершения, эскалаций и стоимости. Само появление новой модели — не повод заменять систему с уже измеренными результатами.

Другие понятные разборы изменений, которые влияют на операционные расходы и процессы, — в рассылке.

Последнее обновление
16 сент. 2026 г.
Категория
Explained

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Похожие статьи
Права доступа Cloudflare Workers: безопасный деплой для клиента

Права доступа Cloudflare Workers: безопасный деплой для клиента

Cloudflare позволяет выдать права только на один Worker. Разбираем, как разделить отладку, ревью кода и деплой между клиентскими проектами без лишнего доступа.15 сент. 2026 г.Explained
Доступ Claude Code к сети теперь выдаётся на одну команду

Доступ Claude Code к сети теперь выдаётся на одну команду

Claude Code 2.1.271 открывает нужный домен только на время одной команды: установка зависимостей получает сеть, а следующие шаги не наследуют доступ.15 сент. 2026 г.Explained
Vercel AI SDK: как оплачивать агентов действующей подпиской

Vercel AI SDK: как оплачивать агентов действующей подпиской

Vercel AI SDK теперь использует подписки Claude Code, Codex и других агентов. Объясняем приоритет учётных данных, общие лимиты и расходы Sandbox.15 сент. 2026 г.Explained
Автоматизация браузера в Cloudflare: контроль хостов

Автоматизация браузера в Cloudflare: контроль хостов

Как ограничить автоматизацию браузера в Cloudflare списком разрешённых хостов, открыть Live View только для просмотра и учесть стоимость Browser Sessions.14 сент. 2026 г.Explained
Стоимость голосового ИИ-агента на GPT-Live-1: полный расчет

Стоимость голосового ИИ-агента на GPT-Live-1: полный расчет

Разбираем стоимость голосового ИИ-агента на GPT-Live-1: $0.05 за минуту голосовой сессии, расходы на бэкенд, инструменты и телефонный трафик.14 сент. 2026 г.Explained
ChatGPT Appshots в Windows: контекст без ручного копирования

ChatGPT Appshots в Windows: контекст без ручного копирования

Разбираемся, как ChatGPT Appshots в Windows передаёт окно приложения в чат, экономит время на сборе контекста и какие данные важно проверить.14 сент. 2026 г.Explained
FastAPI на Vercel: когда статика больше не вызывает Functions

FastAPI на Vercel: когда статика больше не вызывает Functions

FastAPI на Vercel теперь отдаёт подходящую статику через CDN без вызова Functions. Разбираем экономию, правила маршрутов и риски обхода защиты.13 сент. 2026 г.Explained
Ротация API-ключей OpenAI: план без простоя

Ротация API-ключей OpenAI: план без простоя

OpenAI разрешила задавать срок действия проектных API-ключей. Разбираем, как заранее заменить ключ, проверить рабочие процессы и не остановить агентов.13 сент. 2026 г.Explained
Рассылка

Одно письмо, каждое воскресенье.Работающие системы, а не горячие мнения.

Еженедельно. Без спама. Отписка в любой момент.