Нейросеть для анализа видео: когда агентный режим Gemini экономит до 88% токенов

Нейросеть для анализа видео в Gemini сама выбирает нужные фрагменты. Разбираем агентный режим, его стоимость и случаи, когда статический режим лучше.

Wednesday, September 2, 2026Omid Saffari
Tools
Нейросеть для анализа видео: когда агентный режим Gemini экономит до 88% токенов

Нейросеть для анализа видео в Gemini API с 1 сентября 2026 года работает по-новому: вместо загрузки всей временной шкалы с фиксированной частотой модель может обращаться только к тем фрагментам расшифровки, кадрам или аудио, которые нужны для ответа. По данным Google, на длинных видео расход токенов сокращается вплоть до 88%, однако это предельный результат, а не гарантированная скидка на каждый запрос.

Как работает нейросеть для анализа видео в агентном режиме

Прежний вариант по умолчанию — статическая обработка. Gemini извлекает один кадр в секунду, обрабатывает аудио, помещает весь этот материал в контекстное окно и формирует ответ за один проход. Такой подход предсказуем: модель просматривает временную шкалу с фиксированной частотой независимо от того, требуется ли для ответа весь ролик.

Новая возможность — агентная обработка. Сначала модель определяет, какие данные ей понадобятся. Затем она может запросить фрагмент расшифровки, загрузить кадры из нужного момента, изучить аудио и при необходимости повторить цикл — и только после этого дать ответ. Проще говоря, теперь Gemini сначала ищет информацию внутри видео, а уже потом отвечает на вопрос о нём.

Представьте исследователя в видеоархиве. В статическом режиме перед его столом прокручивают все плёнки подряд. В агентном он сначала изучает каталог, берёт наиболее подходящую плёнку, проверяет конкретную сцену и возвращается за следующим фрагментом, только если первого оказалось недостаточно.

Функция появилась в gemini-3.7-flash, gemini-3.6-flash и gemini-3.5-flash-lite. Она доступна как через Interactions API, так и через GenerateContent API. Google рекомендует использовать Interactions API. Ниже используется именно он, поскольку в ответе этого API видны этапы обработки модели.

КритерийСтатический режимАгентный режим
Как читает видеоОдин кадр в секунду плюс аудио за один проходЗагружает расшифровку, кадры или аудио по мере необходимости
Для каких задач подходитКороткие ролики, низкая задержка при запуске, точный просмотр всей временной шкалыДлинные видео и вопросы о конкретных моментах
Расход токеновОколо 100 токенов в секунду при низком разрешении медиаданныхЗависит от задачи; на длинных видео токенов может быть на 88% меньше
Дополнительные настройкиОбрезка по интервалам и пользовательская частота кадровДинамическая навигация под управлением модели
Режим по умолчаниюДаНет, нужно указать processing: "agentic"
Глиняная композиция с видеоархивом: статический режим загружает каждый кадр, а агентный выбирает расшифровку, кадры и аудио
Статический режим загружает всю временную шкалу. Агентный возвращается только за теми данными, которые нужны для ответа.

За этим циклом стоят два новых типа этапов ответа. processing_call означает, что модель запросила ещё один фрагмент видео или расшифровки. Соответствующий processing_result содержит полученный результат. Если эти типы этапов появились в interaction.steps, значит, агентная навигация действительно выполнялась. Приложение может показывать их как индикатор прогресса, но отвечать на них, как на вызов пользовательской функции, не требуется.

Важно понимать границу возможностей: речь идёт о понимании видео, а не о его генерации. Эти три модели принимают видео и возвращают текст. Для создания или редактирования роликов предназначен отдельный процесс Gemini Omni Flash.

Почему экономия 88% токенов имеет значение

Стоимость статической обработки видео растёт по простой формуле. При низком разрешении медиаданных руководство оценивает расход примерно в 100 токенов на каждую секунду. Поэтому часовое видео занимает около 360,000 входных токенов ещё до формирования ответа. По действующему до 31 декабря 2026 года тарифу Standard для Gemini 3.7 Flash или 3.6 Flash — $0.75 за 1 миллион входных токенов — такой ввод стоит примерно $0.27.

Если применить к этому объёму максимальное сокращение на 88%, получится 43,200 токенов, или около $0.0324 по тому же тарифу. В наиболее выгодном сценарии узкий вопрос о длинной записи больше не требует помещать в контекст каждый выбранный кадр.

Но это ещё не весь счёт. Во время агентного поиска появляются токены рассуждений, которые оплачиваются по тарифу вывода, а также токены использования инструментов для загруженных фрагментов расшифровки, аудио и кадров. Если вопрос сформулирован широко или видео насыщено визуальными деталями, модель может изучить больше материала. Google также заявляет о повышении качества на длинном контенте примерно на 7%, однако в общедоступном руководстве нет описания теста, на котором основана эта цифра.

Цена зависит и от модели. На тарифе Standard 1 миллион входных токенов Gemini 3.5 Flash-Lite стоит $0.30, а 1 миллион выходных — $2.50. У Gemini 3.7 Flash и 3.6 Flash до конца 2026 года вход стоит $0.75, а выход — $3.75; 1 января 2027 года обе плановые ставки удвоятся.

Таким образом, агентная обработка даёт преимущество сразу по двум направлениям. Она позволяет уложить более длинный исходник в доступный контекст и уменьшает объём платного материала, который приходится изучать модели. Максимальная выгода достигается, когда источник длинный, а вопрос узкий.

Кому это почти ничего не меняет? Команда, которая обрабатывает тридцатисекундные ролики о продуктах, вряд ли получит сопоставимую экономию. Если процессу заранее известен точный пятиминутный фрагмент, проще обрезать его и применить статический режим. У пользователя обычного приложения Gemini новый переключатель тоже не появится: Google выпустила параметр обработки для API, а не пользовательскую настройку.

Кому пригодится агентный анализ видео с помощью ИИ уже завтра

Руководителю L&D с часовыми учебными записями

Руководитель направления обучения и развития в крупной компании может загрузить запись семинара и попросить выделить основные процедуры и примеры к каждой из них, а затем составить проверочный тест. Агентный режим начнёт с расшифровки, обратится к кадрам там, где важны слайд или физическая демонстрация, и пропустит посторонние фрагменты.

Преимущество не сводится к более дешёвому резюме. По той же записи можно задавать точечные вопросы — например: «Что докладчик сказал об эскалации?» — не заполняя предварительно контекстное окно каждым кадром.

Руководителю SaaS-исследований, который изучает интервью с клиентами

Руководитель продуктовых исследований может попросить найти в часовом интервью все моменты, где клиент говорит о сложностях с онбордингом, непонятных ценах или отсутствующем сценарии работы. В ответ можно включить временные метки, чтобы исследователь вернулся к исходной записи, прежде чем превращать вывод модели в продуктовое решение.

Результат — более быстрый разбор с возможностью проверить источник. Gemini сужает объём записи, а исследователь всё равно просматривает фрагмент, подтверждающий вывод.

Команде медиапроизводства, которая ищет материалы в архиве

Медиакоманда может передать Gemini длинный вебинар, общую встречу или интервью и попросить найти момент, где возникает заданная тема. Именно под такую задачу и создан агентный режим: большая временная шкала и конкретный поисковый запрос.

Результат — более быстрая передача материала в работу. Редактор получает вероятные эпизоды и временные метки, а не приблизительное резюме всей программы.

QA-инженеру на производстве, который разбирает запись инспекции

QA-инженер может поручить агентному режиму найти в длинной записи с камеры заданное событие — например, открытие защитного ограждения или изменение состояния сигнальной лампы. Обнаружив подозрительный интервал, инженер может обработать этот короткий отрезок в статическом режиме.

Второй шаг принципиален. Когда важен каждый кадр из выборки, статический режим остаётся правильным инструментом, а Google предупреждает, что обработка одного кадра в секунду способна пропустить быстрое действие. В такой схеме агентный режим находит нужную область, а статический режим или специализированная система компьютерного зрения подтверждает событие.

Образовательному продукту с продолжительным диалогом о лекции

Разработчик образовательного продукта может создать одно взаимодействие для лекции, а затем принимать уточняющие вопросы учащегося через previous_interaction_id. Сервер сохраняет контекст видео, поэтому продукту не приходится заново собирать весь диалог на каждом шаге.

В результате получается полноценная учебная сессия, а не одноразовое резюме. Но нужно учитывать состояние: при работе без сохранения состояния продукт обязан повторно передавать каждый возвращённый этап обработки, иначе следующий ответ потеряет контекст видео.

Как запустить агентный режим через Interactions API

Кратчайший путь, близкий к реальному рабочему сценарию, опирается на официальный Google Gen AI Python SDK и Files API. Используйте Files API для видео заметной продолжительности, для файлов, к которым планируете обращаться больше одного раза, и для любого запроса общим объёмом свыше 20 MB.

  1. Задайте API-ключ и установите SDK

    Создайте ключ Gemini API в Google AI Studio, сохраните его в GEMINI_API_KEY, затем установите актуальную версию SDK:

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. Загрузите видео и включите агентную обработку

    Укажите путь к локальному видео. Ниже приведён пример на Python из руководства Google по агентному анализу видео:

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. Проверьте режим, прежде чем доверять тесту

    Изучите interaction.steps. Записи processing_call и processing_result должны появиться перед итоговым model_output. Без них нельзя считать доказанным, что запрос действительно использовал динамическую навигацию.

  4. Сравнивайте правильные показатели

    Запустите один и тот же набор репрезентативных видео и вопросов в статическом и агентном режимах. Сопоставьте общее количество входных токенов, токены рассуждений, токены использования инструментов, время до первого токена, качество ответа и итоговую стоимость. 88% — это максимум, заявленный поставщиком. Сохранится ли он в рабочей среде, зависит от набора ваших промптов.

Самая простая ошибка — указать processing на уровне запроса, а не объекта видео. Параметр должен находиться внутри входного объекта видео. Если один запрос содержит несколько роликов, для каждого можно выбрать свой режим: длинная лекция обрабатывается агентно, а короткая запись эксперимента — статически.

Порядок в промпте тоже имеет значение. Для одного видео и текста Google рекомендует сначала передавать видео, а следом — текстовый запрос, как в примере выше.

Что важно учитывать

Агентный режим заменяет фиксированный просмотр поисковым циклом. На роликах короче пяти минут этот цикл способен немного увеличить время до первого токена: модель рассуждает, запрашивает материал и ждёт результатов внутренних инструментов, прежде чем начать итоговый ответ. Если видео короткое, а приложение чувствительно к задержке, статический режим будет более простым вариантом по умолчанию.

Пользовательская обрезка и настройка частоты кадров — ещё одно жёсткое ограничение. start_offset, end_offset и пользовательский fps работают только при статической обработке. Если точный интервал уже известен, обрезать видео для статического запроса может быть проще и предсказуемее, чем просить модель снова искать тот же фрагмент.

С лимитами ввода следует быть особенно внимательными: актуальное руководство Google противоречит само себе. В сравнительной таблице для встроенных данных указан предел менее 100 MB, но подробный раздел требует удерживать общий объём запроса ниже 20 MB и прямо рекомендует переходить на Files API после 20 MB. Пока Google не устранит расхождение, ориентируйтесь на консервативный порог 20 MB.

Сам File API допускает файлы размером до 20 GB на платных аккаунтах и до 2 GB на бесплатных. Модели с контекстным окном в 1,048,576 токенов способны обработать до трёх часов видео в низком разрешении или один час в высоком. Общедоступные URL YouTube поддерживаются, а закрытые видео и ролики с доступом по ссылке — нет. Кроме того, на бесплатном тарифе ввод с YouTube ограничен восемью часами в день.

В многошаговых диалогах есть ловушка, связанная с состоянием. Запросы с сохранением состояния через previous_interaction_id держат контекст видео на сервере. Запросы без сохранения состояния должны повторно передавать каждый этап processing_call и processing_result. Если пропустить эти этапы, ошибки пока не возникает, однако, по словам Google, контекст видео исчезает, а качество последующих ответов резко падает. Повторная передача этапов также добавляет входные токены.

Наконец, поиск данных не равен их проверке. В собственном руководстве по безопасности Google предупреждает, что ответы модели могут быть неточными, и называет постобработку и оценку человеком обязательными. В медицинских, юридических и связанных с безопасностью или соблюдением требований задачах, а также там, где важна точность до кадра, используйте Gemini для поиска подтверждений, но оставляйте окончательное решение за человеком или детерминированной системой.

Что делать сейчас

Используйте агентный режим уже на этой неделе, если продукт отправляет в Gemini длинные записи и задаёт узкие вопросы о моментах, темах или аргументах. Начните с Gemini 3.7 Flash, когда приоритетом является качество ответа, и протестируйте Gemini 3.5 Flash-Lite, когда важнее объём и стоимость.

Сохраните статический режим, если ролики короткие, важна задержка при запуске, нужны обрезка или пользовательская частота кадров либо задача требует равномерного просмотра всей временной шкалы. Новая возможность не отменяет прежнюю — она добавляет второй способ чтения видео.

Подождите с внедрением, если продукт пока не умеет собирать раздельную статистику использования или сопоставлять ответы с временными метками исходника. Без этих данных невозможно понять, сэкономила ли агентная навигация деньги или лишь перераспределила токены между категориями.

Изменение вас не касается, если вам нужна генерация видео, функция в пользовательском приложении Gemini или детерминированный покадровый анализ. Это другие продукты и другие технические задачи.

Если хотите получать разбор следующего изменения платформы в виде готового практического решения, подпишитесь на рассылку.

Последнее обновление

2 сент. 2026 г.

КатегорияExplained

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Ещё из Explained

Все статьи Explained
Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.