AI 영상 생성기 Gemini Omni Flash, 이제 대화로 편집한다
AI 영상 생성기 Gemini Omni Flash의 작동 방식과 요금, 한계, 활용 사례를 한눈에 정리했습니다. 이미지로 영상을 만들고 후속 프롬프트로 장면을 고치는 대화형 편집이 광고, 이커머스, 교육 제작에 어떤 기회를 여는지 실무 관점에서 살펴봅니다.

AI 영상 생성기는 이제 슬롯머신처럼 결과가 나오기만 기다리는 도구가 아니라 실제 편집 세션에 가까워졌습니다. 클립을 만들고, 참조 이미지를 건네고, 한 가지 수정을 요청한 뒤 잘 나온 부분은 그대로 유지할 수 있습니다.
이것이 Gemini API용 Google 프리뷰 영상 모델 Gemini Omni Flash의 핵심입니다. Interactions API를 통해 텍스트-투-비디오, 이미지-투-비디오, 참조 기반 생성, 후속 편집을 지원합니다. 시장 수요도 이미 큽니다. DFS에 따르면 Google 월간 검색량은 ai video generator 246,000건, image to video ai 40,500건, ai video editor 27,100건입니다.
AI 영상 생성기 Gemini Omni Flash란?
Gemini Omni Flash는 빠른 영상 생성과 대화형 편집을 위한 Google의 프리뷰 모델입니다. 모델 ID는 gemini-omni-flash-preview이며, Google은 네이티브 멀티모달리티, 대화형 편집, 세계 지식이라는 세 가지 축으로 이 모델을 설명합니다.
가장 이해하기 쉬운 비유는 ‘기억력을 갖춘 촬영 현장’입니다. 일반적인 영상 생성기는 제작진에게 기획안을 건넨 뒤 첫 촬영이 잘 나오기를 바라는 방식에 가깝습니다. Gemini Omni Flash는 제작진을 계속 현장에 두는 쪽에 가깝습니다. “조명을 더 극적으로 바꿔줘” 또는 “휴대폰이 보이지 않게 해줘”라고 말하면 전체 장면을 처음부터 다시 설명하지 않고도 새 테이크를 요청할 수 있습니다.
이 기억을 가능하게 하는 것이 Interactions API입니다. Interaction은 하나의 작업에서 이루어지는 완결된 한 차례의 상호작용입니다. previous_interaction_id를 전달하면 서버가 생성된 영상 상태를 포함한 이전 대화 기록을 불러와 다음 요청에 이어 쓸 수 있습니다. Omni 영상 워크플로에서는 후속 편집을 요청할 때마다 새 영상이 생성됩니다.

이 모델은 텍스트 프롬프트와 참조 이미지, 업로드한 영상을 활용하는 워크플로를 지원합니다. Google은 텍스트, 이미지, 오디오, 비디오를 아우르는 네이티브 멀티모달 모델이라고 설명하지만, 프리뷰 단계에는 분명한 실무적 한계가 있습니다. 현재 API 버전에서는 업로드한 오디오를 참조로 사용할 수 없고 음성 편집도 지원하지 않습니다.
출력 화면비인 aspect_ratio는 16:9와 9:16을 지원하며 기본값은 가로형입니다. 작업 목적을 지정하는 generation_config.video_config.task에는 text_to_video, image_to_video, reference_to_video, edit를 사용할 수 있습니다. 작업을 지정하지 않으면 모델이 프롬프트를 바탕으로 의도를 추론합니다.
가격은 취미용 수준이 아닙니다. Gemini API에서 Gemini Omni Flash Preview는 유료 등급 전용입니다. Google이 제시한 텍스트·이미지·비디오·오디오 입력 요금은 1M 토큰당 $1.50입니다. 출력은 텍스트가 1M 토큰당 $9.00, 비디오가 1M 토큰당 $17.50입니다. Google에 따르면 720p 영상은 초당 5,792 출력 토큰으로 과금되며, Standard 요금 기준 약 초당 $0.10입니다.
Gemini 영상 생성과 이미지 영상 변환은 어떻게 작동하나?
작업 흐름은 간단합니다. 장면을 설명하고, 필요하면 시각 자료를 첨부하고, 영상 화면비를 고른 뒤 수정 범위를 좁혀 나가면 됩니다.
새 영상을 만들 때는 텍스트 프롬프트를 보냅니다. Google은 장면, 카메라 움직임, 조명, 분위기를 함께 적으라고 권합니다. 하나로 이어지는 장면을 원한다면 명시해야 합니다. Google이 권하는 표현은 “single unbroken shot”, “single continuous shot”, “no scene cuts” 같은 문구입니다.
이미지-투-비디오 작업에서는 이미지를 첨부하고 원하는 움직임을 설명합니다. 제품 사진은 천천히 회전하는 히어로 영상으로, 스케치는 실사 영상으로 바꿀 수 있습니다. Google은 “make it move”처럼 모호한 프롬프트를 피하라고 구체적으로 경고합니다. 더 좋은 프롬프트는 피사체의 움직임과 카메라 이동, 주변 환경의 효과까지 설명합니다.
참조 기반 작업에는 여러 이미지를 전달할 수 있습니다. Google의 예시는 고양이와 털실이라는 두 개의 이미지 입력을 사용한 뒤, 고양이가 털실을 가지고 노는 클립을 요청합니다. 프롬프트 가이드는 역할 태그도 지원합니다. 시작 프레임은 <FIRST_FRAME>, 참조 이미지는 <IMAGE_REF_N>으로 표시할 수 있으며 이미지 참조 번호는 0부터 시작합니다.
편집 프롬프트는 대체로 짧을수록 좋습니다. “Change the lighting to be more dramatic. Keep everything else the same.”처럼 요청할 수 있습니다. 특히 마지막 문장이 중요합니다. 그렇지 않으면 영상 모델이 편집 요청을 장면 전체를 과도하게 재구성해도 된다는 뜻으로 받아들일 수 있기 때문입니다.
출력 파일이 큰 경우 Google은 4 MB를 넘는 생성 영상에 response_format.delivery="uri"를 권장합니다. 그러면 Google이 호스팅하는 URI가 반환되고, 앱은 파일 상태가 ACTIVE가 될 때까지 폴링한 뒤 내려받습니다. 업로드 미디어의 경우 Files API는 프로젝트당 최대 20 GB, 파일당 2 GB를 지원하며 파일을 48시간 보관합니다. 전체 요청이 100 MB보다 크면 Files API를 사용하라는 것이 Google의 안내입니다.
누가 먼저 효과를 얻는가: 활용 사례 순위
1. 영상 버전을 빠르게 만드는 퍼포먼스 광고 팀
퍼포먼스 마케터는 성과가 검증된 제품 이미지와 짧은 기획안, 9:16 같은 플랫폼 규격으로 시작할 수 있습니다. Gemini Omni Flash로 사운드가 포함된 영상을 만든 뒤 프레이밍을 더 타이트하게 바꾸기, 조명 교체하기, 대화 없애기, 도입부 움직임 빠르게 하기, 단어를 한 번에 하나씩 표시하기 같은 작은 수정을 요청할 수 있습니다.
가장 큰 이점은 반복 제작 속도입니다. 유료 소셜 광고에서 비용이 많이 드는 부분은 완성도 높은 영상 한 편이 아닙니다. 투입한 광고비 이상의 성과를 내는 버전을 찾기까지 만들어야 하는 수십 개의 아쉬운 시안입니다. 대화형 편집은 기본 장면을 유지한 채 변수 하나씩만 바꿀 수 있어 이 반복 과정에 잘 맞습니다.
2. 제품 이미지를 움직이는 영상으로 바꾸는 이커머스 팀
수백 개의 SKU를 다루는 Shopify 스토어에는 보통 정지 사진은 있어도 영상 제작 파이프라인은 없습니다. 여기서는 제품 이미지를 업로드하고, 짧은 히어로 모션을 요청하고, 배경과 카메라 경로, 제품의 움직임을 지정한 뒤 16:9와 9:16으로 플랫폼별 버전을 만들면 됩니다.
정지 이미지만으로 제품을 이해하기 어려울 때 특히 효과적입니다. 신발, 가방, 생활용품, 뷰티 도구, 책상 액세서리, 소형 가전은 움직임으로 크기와 질감, 사용 맥락을 보여줄 때 효과가 큽니다.

3. 본 제작 전에 러프컷을 만드는 에이전시
에이전시는 Gemini Omni Flash를 프리프로덕션 도구로 활용할 수 있습니다. 스토리보드를 정지 프레임으로 제안하는 대신, 안정적인 제품 매크로 촬영과 핸드헬드 라이프스타일 장면, 빠른 소셜 몽타주라는 세 가지 움직임 방향을 보여줄 수 있습니다. 실제 촬영을 예약하기 전에 고객이 움직임과 속도감, 분위기를 보고 의견을 줄 수 있습니다.
이점은 의사결정의 질입니다. 고객은 문서로 된 콘셉트에는 동의했다가 실제로 움직이는 결과물을 보고 마음에 들어 하지 않는 경우가 많습니다. AI 러프 영상은 이런 이견을 더 일찍 드러냅니다.
4. 매물 소개용 티저를 만드는 부동산 팀
중개사는 부동산 사진을 참조로 사용해 외관 진입 장면, 거실 패닝, 주방 디테일, 해 질 녘의 파티오로 구성된 짧은 매물 티저를 요청할 수 있습니다. 핵심은 절제입니다. 매물의 분위기를 홍보하는 데 그쳐야 하며, 실제 동선을 가짜로 만들거나 존재하지 않는 특징을 지어내서는 안 됩니다.
이점은 주목도입니다. 사진만 있는 매물 페이지는 소셜 피드에서 경쟁력이 떨어집니다. AI의 도움을 받았음을 명확히 밝힌 짧은 티저는 중개사가 Instagram, YouTube Shorts, 지역 광고용으로 매물을 더 빠르게 패키징할 방법이 될 수 있습니다.
5. 지루한 절차를 장면으로 바꾸는 교육 팀
운영 팀은 문서로 된 프로세스를 물류 창고 입고 단계, 안전 점검표, 고객 인계, 매장 개점 루틴 같은 시각적 시퀀스로 바꿀 수 있습니다. Omni는 이벤트 발생 시점을 프롬프트로 지정할 수 있으므로, 교육 담당자는 각 단계가 특정 시점에 진행되는 세 단계 시퀀스를 요청할 수 있습니다.
이점은 이해도입니다. 신입 직원은 PDF를 지나칠 수 있지만, 명확한 시각 영상은 실제 업무에 들어가기 전에 올바른 수행 방식이 어떤 모습인지 보여줄 수 있습니다.
6. 반복 포맷 영상을 만드는 크리에이터
크리에이터는 끊김 없는 단일 숏, 대화 없음, 매초 화면에 단어 하나 표시, 특정 음악 스타일, 일관된 시각적 리듬처럼 반복 가능한 포맷을 정할 수 있습니다. 그런 다음 포맷의 인지도는 유지하면서 주제만 바꿀 수 있습니다.
이점은 제작 리듬입니다. 여전히 크리에이터의 감각이 필요하지만, 모델은 아이디어를 게시 가능한 초안으로 옮기는 과정의 마찰을 줄일 수 있습니다.
7. 제품 내 영상 경험을 프로토타이핑하는 제품 팀
제품 팀은 디자인·모션 팀이 본격적으로 투입되기 전에 기능 출시 영상, 온보딩 애니메이션, 앱 내 성공 순간을 시안으로 만들 수 있습니다. Gemini Omni Flash는 영상 속 텍스트도 지원하므로, 간단한 시각 라벨이나 표지판이 메시지를 더 분명하게 만드는지도 시험할 수 있습니다.
이점은 팀 간 정렬입니다. 제품, 그로스, 디자인 팀이 정지 목업을 두고 각자 추측하는 대신 같은 움직이는 결과물을 보며 의견을 나눌 수 있습니다.
이 기술로 무엇을 만들 가치가 있는가?
가장 유망한 기회는 광고 팀을 위한 프롬프트 기반 영상 버전 편집기입니다. 범용 영상 생성기와 종합 크리에이티브 제품군의 중간에 놓이는 제품입니다. 소스 에셋을 업로드해 기본 클립을 만든 뒤, 장면은 유지하면서 통제된 변형을 계속 만드는 방식입니다.
수요는 이미 숫자로 드러납니다. DFS에서 ai video editor의 Google 월간 검색량은 27,100건이며 거래 의도가 있습니다. 같은 데이터에서 ai powered video ads는 월간 검색량 320건, 낮은 키워드 난이도, 매우 높은 $97.83 CPC를 기록합니다. 검색량은 적지만 구매 신호는 강합니다. 검색 결과에 나타나는 질문도 제품 요구에 가깝습니다. “Is there an AI that can edit my video?”, “Can ChatGPT do video editing?”, “Which AI is best to edit videos?” 같은 질문입니다.
MVP의 범위는 좁게 잡을 수 있습니다. 제품 이미지와 브랜드 규칙, 승인된 프롬프트 프리셋을 연결해 첫 9:16 클립을 만들고, 조명·배경·속도·텍스트·사운드·클릭 유도 문구를 바꾸는 편집 버튼을 제공하는 것입니다. 문제는 결과물의 획일화입니다. 모든 고객이 같은 템플릿을 받는다면 제품은 단순한 래퍼에 그칩니다. 방어력은 브랜드 기억, 성과 피드백, 다음 클립을 더 유용하게 만드는 통제형 편집 프리셋에서 나옵니다.
두 번째 기회는 이커머스 카탈로그용 이미지-투-비디오 제품 스튜디오입니다. DFS에서 image to video ai의 Google 월간 검색량은 40,500건이며, 관련 검색에는 “without login”, “free without watermark”, “free unlimited”, “with prompt online free”처럼 사용자의 불편이 고스란히 담긴 표현이 많습니다. 모두 구매 의도가 높은 트래픽은 아니지만, 상단 퍼널이 거대하다는 점은 분명합니다.
MVP는 SKU 중심 워크플로입니다. 제품 이미지를 업로드하고, 장면 유형과 마켓플레이스 또는 광고 규격을 고르고, 클립을 생성한 다음 여러 크기로 일괄 조정해 내보냅니다. 문제는 마진입니다. 범용 이미지-투-비디오 시장의 상위 검색 결과에는 Canva, Adobe, VEED, Pixlr와 소규모 생성 도구가 빽빽하게 자리 잡고 있습니다. 판매 가능한 제품이 되려면 뷰티 제품 시연, Etsy 상품 페이지, Amazon 히어로 영상처럼 명확한 업종 특화 영역이 필요합니다.
세 번째 기회는 실제 운영에 안전하게 적용할 수 있는 사내 교육용 AI 영상 편집기입니다. 관리자가 SOP를 짧은 클립으로 만들고, 일상 언어로 편집하고, 역할이나 지점별로 라이브러리를 관리하는 제품입니다. 검색량만 보면 수요가 뚜렷하지 않지만 구매자의 문제는 현실적입니다. 교육 팀에 필요한 것은 바이럴 콘텐츠가 아니라 일관된 시각적 설명입니다.
MVP는 승인된 스타일을 적용하고, 공유 기본값을 비공개로 두며, 파일 보존 규칙과 검토 대기열을 갖춘 통제형 생성기입니다. 문제는 컴플라이언스입니다. 이 분야에서는 원시 모델 성능보다 콘텐츠 안전, 데이터 보존, 감사 추적이 더 중요합니다. Google은 store=false로 설정하지 않는 한 유료 등급의 Interactions를 기본 55일 동안 보관합니다. 하지만 store=false를 사용하면 previous_interaction_id를 통한 후속 편집이 불가능해지므로, 제품 설계 단계에서 개인정보 보호와 편집 가능성 중 무엇을 우선할지 결정해야 합니다.

Gemini Omni Flash가 해결하지 못하는 것
Gemini Omni Flash가 감각까지 대신해 주지는 않습니다. 시도할 수 있는 영상 수를 늘려 주는 만큼, 팀에는 느슨한 기준이 아니라 더 강한 선별 기준이 필요합니다.
모든 영상 도구를 대체하지도 않습니다. Google에 따르면 영상 확장과 보간은 지원하지 않습니다. 음성 편집도 지원하지 않습니다. 현재 API 버전에서는 업로드한 오디오를 참조로 사용할 수 없습니다. YouTube 영상을 미디어 소스로 쓰는 것도 지원하지 않습니다. 여러 영상을 함께 추론할 수 없으며, Google은 다중 영상 프롬프팅을 시도하면 성능이 저하될 수 있다고 설명합니다.
지역 제한도 있습니다. EEA, 스위스, 영국 사용자는 현재 업로드한 영상을 편집할 수 없습니다. 단, 모델이 생성한 영상의 편집은 지원됩니다. 같은 지역에서는 미성년자가 포함된 이미지를 업로드하거나 편집할 수 없고, 특정 식별 가능한 인물이 포함된 이미지의 업로드 또는 편집도 지원되지 않습니다.
제품 차원의 절충점도 있습니다. 가장 빠른 동기식 생성을 원한다면 Google은 background=false, store=false, stream=false를 권장합니다. 하지만 store=false로 설정하면 후속 편집에 previous_interaction_id를 사용할 수 없습니다. 결국 핵심 제품 결정은 속도와 저장 축소를 택할지, 상태를 유지하는 편집을 택할지입니다.
제 판단은 이렇습니다. 핵심 가치가 통제된 반복 수정에 있다면 Gemini Omni Flash를 사용할 만합니다. 정확한 프레임 단위 연속성, 장편 편집, 음성 교체, 다중 영상 추론, 완전히 결정론적인 브랜드 에셋이 필요하다면 적합하지 않습니다. 사용자가 “거의 됐으니 장면은 유지하고 이것 하나만 바꿔줘”라고 말할 수 있는 상황에서 이 모델의 강점이 가장 잘 드러납니다.
현재 AI 영상 편집 시장과 비교하면?
시장은 이미 AI 영상 도구에 비용을 지불하고 있습니다. Runway의 유료 플랜은 엔터프라이즈 이전 구간에서 월 $15부터 $95까지입니다. Kapwing은 Pro를 월 결제 $24 또는 연간 결제 $16, Business를 월 결제 $64 또는 연간 결제 $50에 제공합니다. Adobe Firefly의 플랜은 월 $9.99부터 $199.99까지입니다.
이 가격이 중요한 이유는 Gemini Omni Flash가 다른 모델과만 경쟁하는 것이 아니기 때문입니다. 더 나은 워크플로 제품을 만드는 원재료가 되고 있습니다. 승자는 빈 프롬프트 입력창만 내놓는 팀이 아닐 것입니다. 광고 편집하기, 제품에 움직임 더하기, 교육 영상 만들기, 나머지는 그대로 유지하기처럼 프롬프트 입력창을 반복 가능한 업무로 설계하는 팀이 앞서게 됩니다.
더 폭넓은 도구 비교가 필요하다면 별도로 정리한 최고의 AI 영상 생성기와 최고의 이미지-투-비디오 AI 생성기 목록을 참고할 수 있습니다. Google의 인접 이미지 모델까지 맥락을 넓히려면 가장 가까운 형제 모델인 Nano Banana를 살펴볼 만합니다. Nano Banana는 전통적인 도구 패널 대신 프롬프트로 시각물을 편집하는 경험을 사용자에게 익숙하게 만들었기 때문입니다.
내 영상을 편집할 수 있는 AI가 있나요?
있습니다. Gemini Omni Flash는 후속 프롬프트와 previous_interaction_id를 이용해 앞서 생성한 영상에 이어 작업하는 상태 유지형 영상 편집을 지원합니다. 제공되는 지역에서는 Files API를 통해 업로드한 영상도 편집할 수 있지만, Google이 명시한 지역 제한과 여러 편집 한계가 적용됩니다.
ChatGPT로 영상 편집을 할 수 있나요?
이 질문은 ai video editor 검색 결과에도 등장하지만, 여기서 다루는 Gemini Omni Flash는 이 특정 워크플로를 위한 Google의 API 모델입니다. 유용한 비교 기준은 브랜드 이름이 아닙니다. 영상 상태를 보존하고, 참조 미디어를 받아들이고, 장면 전체를 처음부터 다시 만들지 않은 채 제한된 수정을 적용할 수 있는지가 핵심입니다.
영상 편집에는 어떤 AI가 가장 좋은가요?
일반적인 브라우저 편집 용도라면 Kapwing, Adobe, Canva, InVideo 같은 도구가 이미 상위에 노출됩니다. Gemini Omni Flash는 완성된 소비자용 앱에 그치지 않고 프롬프트 기반 생성과 후속 편집을 구현할 API를 제공한다는 점에서 제품 개발자에게 더 흥미롭습니다.
이미지 영상 변환 AI와 관련해 사람들은 무엇을 검색하나요?
DFS에서 image to video ai의 관련 검색에는 프롬프트 기반, 무료, 로그인 불필요, 워터마크 없음 같은 변형이 포함됩니다. 시장의 호기심층은 거대하지만, 유료 제품이 되려면 “어떤 이미지든 영상으로 바꿔준다”보다 더 명확한 구매자를 겨냥해야 한다는 뜻입니다.
비즈니스에 맞춘 영상 워크플로를 구축하고 싶다면 AI 프로덕션 시스템 서비스부터 시작해 보세요.
2026년 9월 3일







