Gemini 에이전틱 AI 영상 분석: 토큰 88% 절감이 실제가 되는 조건

Gemini의 에이전틱 AI 영상 분석은 필요한 자막·프레임·오디오만 찾아 장시간 동영상의 토큰을 최대 88% 줄입니다. 적용 모델과 API 사용법, 실제 비용 구조, 정적 처리와의 선택 기준, 운영 환경에서 반드시 검증할 항목까지 한 번에 정리했습니다.

Wednesday, September 2, 2026Omid Saffari
Tools
Gemini 에이전틱 AI 영상 분석: 토큰 88% 절감이 실제가 되는 조건

2026년 9월 1일, Google은 Gemini API에 긴 동영상을 읽는 새로운 에이전틱 AI 방식을 도입했습니다. 전체 타임라인을 고정된 속도로 불러오는 대신, 이제 모델이 질문에 답하는 데 필요한 자막·프레임·오디오만 골라 확인할 수 있습니다. Google은 장시간 동영상에서 토큰을 최대 88% 줄일 수 있다고 설명하지만, 이 수치는 모든 청구액에 일괄 적용되는 할인율이 아니라 가능한 최대치입니다.

Gemini 에이전틱 AI 영상 분석이란 무엇인가

기존 기본값은 정적 처리입니다. Gemini는 초당 프레임 1장을 추출하고 오디오를 처리한 뒤, 이 자료를 컨텍스트 창에 넣어 한 번에 답합니다. 질문에 전체 영상이 필요하지 않더라도 고정된 샘플링 속도로 타임라인을 읽기 때문에 동작을 예측하기 쉽습니다.

새로 추가된 선택지는 에이전틱 처리입니다. 모델이 먼저 어떤 근거가 필요한지 판단합니다. 관련 자막 구간을 요청하거나 필요한 시점의 프레임과 오디오를 확인하고, 답을 쓰기 전까지 이 과정을 반복할 수 있습니다. 쉽게 말해 Gemini가 이제 영상에 관해 답하기 전에 영상 내부부터 검색하는 방식입니다.

영상 아카이브를 조사하는 연구원을 떠올리면 이해하기 쉽습니다. 정적 모드는 모든 필름을 책상 앞에서 처음부터 끝까지 재생합니다. 에이전틱 모드는 목록을 먼저 살핀 뒤 가능성이 높은 필름과 정확한 장면을 확인하고, 근거가 부족할 때만 다른 자료를 다시 찾습니다.

이 기능은 gemini-3.7-flash, gemini-3.6-flash, gemini-3.5-flash-lite에 적용됐습니다. Interactions API와 GenerateContent API에서 모두 사용할 수 있습니다. Google은 Interactions API 사용을 권장하며, 아래 예제도 이 경로를 사용합니다. 응답에서 모델의 처리 단계를 직접 확인할 수 있기 때문입니다.

판단 기준정적 모드에이전틱 모드
영상을 읽는 방식초당 프레임 1장과 오디오를 한 번에 처리필요할 때 자막, 프레임 또는 오디오를 불러옴
적합한 작업짧은 클립, 빠른 첫 응답, 전체 타임라인의 정밀한 확인긴 동영상과 특정 시점을 겨냥한 질문
토큰 사용 패턴낮은 미디어 해상도에서 초당 약 100토큰가변적이며, 장시간 동영상에서 최대 88% 절감
추가 제어 기능구간 자르기와 사용자 지정 프레임 속도모델이 제어하는 동적 탐색
기본값아니요. processing: "agentic" 설정 필요
정적 모드는 모든 프레임을 불러오고 에이전틱 모드는 자막, 프레임, 오디오를 선별하는 점토 질감의 영상 아카이브
정적 모드는 타임라인 전체를 불러옵니다. 에이전틱 모드는 질문에 필요한 근거를 찾아 다시 탐색합니다.

이 탐색 루프의 내부에는 두 가지 새로운 응답 단계가 있습니다. processing_call은 모델이 다른 영상 구간이나 자막을 요청했다는 뜻이고, 그에 대응하는 processing_result에는 가져온 결과가 담깁니다. interaction.steps에 이 두 단계가 나타나면 에이전틱 탐색이 실행된 것입니다. 애플리케이션에서 진행 상황으로 보여줄 수는 있지만, 사용자 정의 함수 호출처럼 직접 응답할 필요는 없습니다.

분명히 구분해야 할 점도 있습니다. 이 기능은 동영상 이해이지 동영상 생성이 아닙니다. 세 모델은 동영상을 입력받아 텍스트를 반환합니다. 영상을 만들거나 편집하려면 별도의 Gemini Omni Flash 워크플로를 사용해야 합니다.

에이전틱 AI에서 88% 절감이 중요한 이유

정적 영상 처리 비용은 매우 단순한 방식으로 늘어납니다. 가이드에 따르면 낮은 미디어 해상도에서는 영상 1초마다 약 100토큰을 사용합니다. 따라서 1시간짜리 영상을 답변 전에 입력하는 데만 약 360,000토큰이 듭니다. 2026년 12월 31일까지 적용되는 Gemini 3.7 Flash 또는 3.6 Flash Standard의 입력 토큰 100만 개당 $0.75 요금으로 계산하면 약 $0.27입니다.

이 입력 토큰에서 최대치인 88%를 모두 줄인다면 43,200토큰, 같은 요율로 약 $0.0324가 됩니다. 긴 녹화물에서 특정 내용만 묻는다면 샘플링된 모든 프레임을 컨텍스트에 넣지 않아도 된다는 점이 가장 매력적입니다.

다만 이것이 청구액 전부는 아닙니다. 에이전틱 탐색 과정에서는 출력 요율로 과금되는 추론 토큰과, 자막·오디오·프레임을 불러올 때 쓰는 툴 사용 토큰이 생깁니다. 질문의 범위가 넓거나 영상의 시각 정보가 빽빽하면 모델이 더 많은 자료를 확인할 수도 있습니다. Google은 장시간 콘텐츠에서 품질이 약 7% 향상된다고 밝혔지만, 공개 가이드에는 이 수치의 근거가 된 벤치마크가 제시돼 있지 않습니다.

모델에 따라서도 단가가 달라집니다. Gemini 3.5 Flash-Lite의 Standard 요금은 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $2.50입니다. Gemini 3.7 Flash와 3.6 Flash는 2026년 말까지 입력 $0.75, 출력 $3.75이며, 예정대로라면 두 모델의 요금은 2027년 1월 1일에 2배로 오릅니다.

결국 에이전틱 영상 처리는 두 측면에서 동시에 이점이 있습니다. 더 긴 원본을 컨텍스트 예산 안에 담을 수 있고, 모델이 확인하는 과금 대상 자료의 양도 줄일 수 있습니다. 원본이 길고 질문 범위가 좁을수록 효과가 큽니다.

반대로 영향을 거의 받지 않는 경우도 있습니다. 30초짜리 제품 영상을 처리하는 팀이라면 같은 수준의 이점을 얻기 어렵습니다. 필요한 구간이 정확히 5분이라는 사실을 이미 아는 워크플로라면 그 부분만 잘라 정적 모드로 처리하는 편이 나을 수 있습니다. Gemini 앱 사용자에게도 새로운 설정이 생기는 것은 아닙니다. Google이 출시한 것은 소비자용 제어 기능이 아니라 API 처리 매개변수입니다.

당장 활용할 수 있는 업무

1시간짜리 교육 녹화물을 다루는 L&D 책임자

대기업의 학습·개발 책임자는 녹화된 워크숍을 업로드한 뒤 핵심 절차와 각 절차에 딸린 사례, 퀴즈를 요청할 수 있습니다. 에이전틱 모드는 자막부터 살펴보고, 슬라이드나 실물 시연이 중요할 때만 프레임을 가져오며, 관계없는 구간은 건너뜁니다.

단순히 더 저렴한 요약만 얻는 것은 아닙니다. 같은 원본을 두고 “발표자는 에스컬레이션에 관해 뭐라고 설명했나요?”처럼 구체적인 후속 질문을 해도 모든 프레임으로 컨텍스트 창을 먼저 채울 필요가 없습니다.

고객 인터뷰를 검토하는 SaaS 리서치 책임자

제품 리서치 책임자는 1시간짜리 인터뷰에서 고객이 온보딩 과정의 불편, 이해하기 어려운 가격 정책 또는 빠진 워크플로를 언급한 모든 순간을 찾아 달라고 요청할 수 있습니다. 답변에 타임스탬프를 포함하면 모델 출력을 제품 의사결정에 반영하기 전에 연구자가 원본 녹화물을 다시 확인할 수 있습니다.

핵심 이점은 검토 속도를 높이면서도 확인 경로를 남길 수 있다는 데 있습니다. Gemini가 후보 장면을 좁혀 주더라도, 주장을 뒷받침하는 클립은 연구자가 직접 확인해야 합니다.

아카이브를 검색하는 미디어 운영팀

미디어팀은 긴 웨비나, 타운홀 또는 인터뷰를 Gemini에 제공하고 특정 주제가 등장하는 순간을 찾아 달라고 할 수 있습니다. 긴 타임라인에서 구체적인 대상을 검색하는 작업이야말로 에이전틱 모드가 설계된 목적에 잘 맞습니다.

후속 작업도 빨라집니다. 편집자는 프로그램 전체에 대한 두루뭉술한 요약 대신 가능성이 높은 장면과 타임스탬프를 전달받습니다.

검사 영상을 선별하는 제조 QA 엔지니어

QA 엔지니어는 에이전틱 모드로 긴 카메라 녹화물에서 안전 가드가 열리거나 경고등이 바뀌는 등 지정한 사건을 검색할 수 있습니다. Gemini가 의심스러운 구간을 찾으면 해당 부분만 정적 모드로 다시 처리할 수 있습니다.

두 번째 단계가 중요합니다. 샘플링된 모든 프레임이 중요한 작업에는 여전히 정적 모드가 적합하며, Google은 초당 프레임 1장을 처리하는 방식으로는 빠른 움직임을 놓칠 수 있다고 경고합니다. 에이전틱 모드로 대략적인 위치를 찾은 다음, 정적 모드나 전용 비전 시스템으로 사건을 검증하는 워크플로입니다.

강의 대화를 이어 가는 교육 제품

교육 제품 개발자는 강의 하나를 중심으로 interaction을 만든 뒤, 학생이 previous_interaction_id를 이용해 후속 질문을 이어 가도록 할 수 있습니다. 서버가 영상 컨텍스트를 보관하므로 제품에서 질문할 때마다 대화 전체를 다시 구성할 필요가 없습니다.

일회성 요약이 아니라 실제 학습 세션을 만들 수 있다는 점이 장점입니다. 단, 상태 관리에 주의해야 합니다. 제품이 stateless 방식으로 동작한다면 반환된 처리 단계를 매번 다시 보내야 하며, 그렇지 않으면 다음 답변에서 영상 컨텍스트가 사라집니다.

Interactions API로 에이전틱 모드 사용하는 법

실제 서비스에 적용할 수 있는 가장 짧은 경로는 Google 공식 Gen AI Python SDK와 Files API를 이용하는 것입니다. 재생 시간이 긴 영상, 두 번 이상 질문할 영상, 전체 요청 크기가 20 MB를 넘는 경우에는 Files API를 사용합니다.

  1. API 키 설정 및 SDK 설치

    Google AI Studio에서 Gemini API 키를 만들고 GEMINI_API_KEY에 저장한 다음 최신 SDK를 설치합니다.

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. 영상 업로드 및 에이전틱 처리 요청

    경로를 로컬 영상 파일에 맞게 바꿉니다. 아래는 Google의 에이전틱 영상 가이드에 나온 Python 흐름입니다.

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. 테스트 결과를 믿기 전에 모드 확인

    interaction.steps를 살펴봅니다. 최종 model_output 전에 processing_callprocessing_result 항목이 보여야 합니다. 이 항목이 없다면 요청이 동적 탐색을 사용했다는 사실이 입증되지 않은 것입니다.

  4. 올바른 비교 지표 측정

    대표 영상과 질문을 동일하게 구성해 정적 모드와 에이전틱 모드에서 각각 실행합니다. 전체 입력 토큰, 추론 토큰, 툴 사용 토큰, 첫 토큰까지 걸린 시간, 답변 품질, 최종 비용을 비교합니다. 88%는 공급업체가 제시한 최대치이므로 실제 운영에서 유지되는지는 프롬프트 구성에 달려 있습니다.

가장 흔한 실수는 processing을 영상 객체가 아닌 요청 자체에 넣는 것입니다. 이 값은 영상 입력 내부에 있어야 합니다. 요청 하나에 영상이 여러 개라면 각 영상마다 처리 모드를 따로 선택할 수 있습니다. 긴 강의는 에이전틱 모드로 처리하고 짧은 실험 클립은 정적 모드로 유지하는 식입니다.

프롬프트 순서도 중요합니다. 영상 1개와 텍스트를 함께 보낼 때 Google은 예제처럼 영상을 먼저, 텍스트 프롬프트를 그 뒤에 배치할 것을 권장합니다.

도입 전에 알아야 할 한계

에이전틱 모드는 고정 스캔을 검색 루프로 바꾸는 방식입니다. 5분 미만의 클립에서는 모델이 추론하고 자료를 요청한 뒤 내부 툴의 결과를 기다려야 하므로 최종 답변을 시작하기까지 걸리는 시간이 조금 늘 수 있습니다. 영상이 짧고 애플리케이션에서 지연 시간이 중요하다면 정적 모드를 기본값으로 두는 편이 더 깔끔합니다.

사용자 지정 구간 자르기와 프레임 속도 제어도 명확한 경계입니다. start_offset, end_offset, 사용자 지정 fps는 정적 처리에서만 작동합니다. 필요한 구간을 정확히 알고 있다면 모델에게 다시 찾게 하는 것보다 정적 요청에서 해당 부분을 잘라 보내는 방식이 더 단순하고 예측하기 쉽습니다.

Google의 현재 가이드가 서로 모순된다는 점 때문에 입력 제한도 주의해서 봐야 합니다. 비교표에는 인라인 데이터가 100 MB 미만이라고 적혀 있지만, 자세한 인라인 설명에서는 전체 요청을 20 MB 미만으로 유지하라고 안내하며 20 MB를 넘으면 Files API를 사용하라고 명시합니다. Google이 문서를 정리할 때까지는 보수적인 20 MB 기준을 따르는 편이 안전합니다.

File API 자체의 파일 한도는 유료 계정 20 GB, 무료 계정 2 GB입니다. 컨텍스트 창이 1,048,576토큰인 모델은 저해상도 영상은 최대 3시간, 고해상도 영상은 1시간까지 처리할 수 있습니다. 공개 YouTube URL은 사용할 수 있지만 비공개 또는 일부 공개 영상은 지원되지 않습니다. 무료 등급의 YouTube 입력도 하루 8시간으로 제한됩니다.

멀티턴 상태 관리에는 운영 환경에서 놓치기 쉬운 함정이 있습니다. previous_interaction_id를 사용하는 stateful 요청은 서버에 영상 컨텍스트를 유지합니다. 반면 stateless 요청은 모든 processing_callprocessing_result 단계를 다시 보내야 합니다. 이 단계를 빼도 현재 오류가 발생하지는 않지만, Google에 따르면 영상 컨텍스트가 사라져 후속 답변 품질이 크게 떨어집니다. 단계를 재전송하면 입력 토큰도 추가됩니다.

마지막으로 검색은 검증이 아닙니다. Google의 안전 가이드에서도 모델 출력이 부정확할 수 있다고 밝히며, 후처리와 사람의 평가가 반드시 필요하다고 설명합니다. 의료·법률·안전·컴플라이언스 또는 프레임 단위의 정밀한 판단이 필요한 업무에서는 Gemini로 근거 위치를 찾되 승인 과정에는 사람이나 결정론적 시스템을 남겨 둬야 합니다.

지금 어떤 모드를 선택해야 하나

제품에서 긴 녹화물을 Gemini로 보내 특정 순간, 주제 또는 논점을 묻는다면 이번 주부터 에이전틱 모드를 사용해 볼 만합니다. 답변 품질이 우선이라면 Gemini 3.7 Flash로 시작하고, 처리량과 비용이 더 중요하다면 Gemini 3.5 Flash-Lite를 테스트합니다.

클립이 짧거나 첫 응답 속도가 중요할 때, 구간 자르기나 사용자 지정 프레임 속도가 필요할 때, 또는 전체 타임라인을 일관되게 훑어야 할 때는 정적 모드를 유지합니다. 새로운 기능이 기존 방식을 대체하는 것은 아닙니다. 영상을 읽는 두 번째 전략이 생긴 것입니다.

아직 사용량 필드를 각각 수집할 수 없거나 답변을 원본 타임스탬프와 비교할 수 없다면 도입을 미루는 편이 좋습니다. 이런 근거가 없으면 에이전틱 탐색이 실제로 비용을 아낀 것인지, 단지 토큰을 다른 범주로 옮긴 것인지 판단할 수 없습니다.

동영상 생성, 소비자용 Gemini 기능 또는 결정론적인 프레임별 분석이 목적이라면 이번 변화의 적용 대상이 아닙니다. 각각 다른 제품이며 해결해야 할 기술 문제도 다릅니다.

다음 플랫폼 변화를 실제 업무에 적용할 판단 기준까지 받아보고 싶다면 뉴스레터를 구독하세요.

마지막 업데이트

2026년 9월 2일

카테고리Explained

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

Explained의 다른 글

Explained 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.