Grok Voice Transcribe 2.0 전환: 음성 텍스트 변환 비용과 기본 모델 점검법

Grok Voice Transcribe 2.0은 배치 시간당 $0.10, 스트리밍 시간당 $0.20을 유지합니다. 기본 모델 변경은 같은 API 호출의 음성 텍스트 변환 결과와 후속 업무를 바꿀 수 있습니다. 모델 고정과 실제 오디오 검증 절차를 정리했습니다.

Sunday, September 20, 2026Omid Saffari
Tools
Grok Voice Transcribe 2.0 전환: 음성 텍스트 변환 비용과 기본 모델 점검법

Grok Voice Transcribe 2.0의 음성 텍스트 변환 요금은 배치 시간당 $0.10, 스트리밍 시간당 $0.20으로 그대로입니다. 문제는 공개 문서에서 기본 모델이 이미 바뀌었다는 점입니다. 모델을 지정하지 않은 같은 API 호출이라도 변환 문구가 달라지고, 그 결과를 이어받는 후속 업무까지 바뀔 수 있습니다.

실제로 무엇이 달라졌나

xAI는 2026년 9월 18일 Grok Voice Transcribe 2.0을 출시했습니다. 녹음 음성이나 실시간 음성을 다른 제품 또는 워크플로에서 활용할 수 있는 텍스트로 바꾸는 현행 음성 인식 모델로, Grok Voice Transcribe 1.0을 대체합니다.

작동 방식은 명확하게 두 가지입니다. 배치는 녹음이 끝난 뒤 파일이나 오디오 URL을 REST 엔드포인트로 보냅니다. 스트리밍은 사용자가 말하는 동안 WebSocket으로 오디오를 전송합니다. 통화가 끝나기 전에도 자막, 에이전트 응답, 실시간 지원 기능이 반응할 수 있는 방식입니다.

출시 안내에 따르면 기존 연동도 코드 변경 없이 2.0 모델을 받을 수 있습니다. 간편해 보이지만, 바로 이 점 때문에 운영팀의 확인이 필요합니다. 요청에 모델을 명시하지 않으면 출력이 바뀌는 시점을 공급자가 결정하게 됩니다.

요금표는 달라지지 않았습니다. 배치는 오디오 시간당 $0.10, 스트리밍은 오디오 시간당 $0.20입니다. 발화자를 구분해 단어를 배정하는 화자 분리, 단어 단위 타임스탬프, 핵심 용어 편향 설정도 이 요금에 포함됩니다.

음성 텍스트 변환 API 비용은 그대로지만 워크플로 비용은 달라질 수 있습니다

API 비용만 놓고 보면 계산은 간단합니다.

방식오디오 시간당 요금오디오 1,000시간 비용적합한 상황
배치$0.10$100녹음이 이미 완료된 경우
스트리밍$0.20$200대화 중에 변환 결과가 필요한 경우

스트리밍 요금은 배치의 두 배입니다. 오디오 1,000시간을 처리하면 추가 비용은 $100입니다. 실시간 자막, 통화 중 지원, 다음 발화를 결정하는 음성 에이전트처럼 완성된 녹음을 기다리는 순간 제품이 제대로 작동하지 않는다면 이 추가 비용은 타당합니다.

오디오가 이미 저장돼 있다면 스트리밍을 쓴다고 변환 결과 자체가 더 유용해지는 것은 아닙니다. 미디어 아카이브, 밀린 팟캐스트, 녹화 인터뷰, 야간 통화 검토 작업이라면 보통 배치를 유지해 더 낮은 요금을 적용하는 편이 맞습니다.

API 항목은 전체 예산의 일부일 뿐입니다. 실제 운영에 유용한 계산식은 다음과 같습니다.

총 음성 변환 비용 = 오디오 API 비용 + 사람의 교정 비용 + 후속 재작업 비용

첫 번째 항목은 요금표로 알 수 있습니다. 두 번째는 검수 시간과 검수 담당자의 제반 비용을 반영한 시간당 인건비에 따라 달라집니다. 세 번째는 달라진 단어, 화자 라벨, 타임스탬프, 숫자 표기 때문에 자막 파일, 품질 점수, CRM 메모, 검색 인덱스, 자동화 작업을 다시 손봐야 할 때 발생합니다.

이번 출시가 비즈니스에 미치는 핵심 영향이 여기에 있습니다. 오디오 지출은 정확히 같아도, 실제로 쓸 수 있는 변환 결과를 만드는 총비용은 오르거나 내릴 수 있습니다. 대표 오디오로 테스트하기 전까지 교정 시간 단축은 가능성일 뿐, 예측치에 반영할 수 있는 절감액이 아닙니다.

누가 쓸 수 있으며 무엇이 달라지나

저장된 상담 통화를 처리하는 고객 지원 운영 책임자

고객 지원팀은 녹음 통화를 오디오 시간당 $0.10인 배치로 보내고, 화자 분리를 켠 뒤 제품명을 핵심 용어로 전달할 수 있습니다. 직접적인 API 비용은 예측 가능한 수준으로 유지됩니다. 전환 여부를 판단할 때는 2.0이 이름, 계정 정보, 화자 배정을 고치는 검수 시간을 줄이는지 늘리는지 확인해야 합니다.

성과는 추상적인 정확도 점수가 아닙니다. 후속 단계의 오류를 늘리지 않으면서 교정 대기열을 줄이는 것이 목표입니다. 프로덕션 모델 고정을 바꾸기 전에 두 항목을 모두 측정해야 합니다.

실시간 음성 에이전트를 운영하는 제품팀

음성 에이전트는 통화가 끝날 때까지 기다리면 제품의 목적을 달성할 수 없습니다. 변환 결과가 실시간 제어 루프의 일부이므로 오디오 시간당 $0.20인 스트리밍의 높은 요금도 가치가 있습니다. 두 모델이 침묵 구간, 숫자, 말 끊김, 핵심 용어를 어떻게 처리하는지 비교한 다음, 해당 변환 결과로 실행된 작업까지 살펴봐야 합니다.

사람이 보기에는 더 깔끔한 텍스트도, 표기 형식이 달라진 값 하나가 조회를 바꾸거나 발화 경계 하나 때문에 에이전트가 너무 일찍 답하면 워크플로를 망가뜨릴 수 있습니다. 인수 테스트는 텍스트에 그치지 않고 후속 작업까지 포함해야 합니다.

자막을 납품하는 미디어 운영 책임자

인터뷰나 고객 영상을 처리하는 에이전시는 배치를 사용하고, 비교 대상에 타임스탬프 출력도 포함해야 합니다. 두 모델을 각각 명시한 상태에서 발음하기 어려운 같은 이름과 화자가 겹치는 같은 구간을 비교하십시오. 성과는 공급자가 제시한 종합 벤치마크가 아니라 교정 시간과 자막 전달 품질로 측정해야 합니다.

API는 하나의 구성 요소일 뿐 편집 작업 공간은 아닙니다. 브라우저 편집기, 회의 봇, 자막 워크플로, 사람에게 넘기는 에스컬레이션 경로가 필요하다면 완성형 음성 변환 툴 비교를 참고하십시오.

다국어 SaaS 고객 지원팀

xAI는 2.0이 자체 평가 전반에서 1.0보다 정확도가 두 배 높다고 밝힙니다. 자체 다국어 짧은 문구 데이터세트의 단어 오류율도 20.6%에서 6.8%로 낮아졌다고 보고했습니다. 이는 이 글을 위해 수행한 테스트가 아니라 공급자가 진행한 비교입니다.

다국어 고객 지원팀이라면 실제 언어 구성, 억양, 전화 회선, 이름, 코드 스위칭을 표본으로 삼아야 합니다. 종합 수치가 좋아졌다고 해서 티켓 비중이 큰 언어도 개선됐다고 단정할 수 없고, 인력 배치를 바꿀 만큼 교정 시간이 줄었는지도 알 수 없습니다.

모델을 명시한 뒤 출력 결과를 테스트하십시오

최소한의 배치 호출은 간단합니다. 아래 cURL 예시는 2.0 모델을 명시한 xAI 공식 요청 형식입니다.

Bash
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F file=@audio.mp3

핵심은 모델 필드입니다. grok-voice-transcribe-2.0을 명시적으로 고정하면 선택권을 직접 가질 수 있습니다. 임시 기준선이 필요하다면 현재 문서상 grok-voice-transcribe-1.0도 여전히 사용할 수 있습니다. xAI는 뒤에 오는 옵션 필드가 무시될 수 있다고 경고하므로 멀티파트 요청에서는 파일 필드를 마지막에 두십시오.

전환을 점검할 때는 두 모델에 같은 요청 설정을 적용해야 합니다. 모델, 화자 분리, 서식, 간투사 처리, 핵심 용어를 한꺼번에 바꾸면 어떤 변경이 출력 차이를 만들었는지 설명할 수 없습니다.

  1. 모델을 지정하지 않은 모든 요청 찾기

    배치와 스트리밍 코드 경로에서 model을 생략한 호출을 찾으십시오. 엔드포인트를 감싼 백그라운드 작업, 내부 툴, 스테이징, 외부 공급자 연동도 포함해야 합니다. 현재 공개 문서는 모델을 생략한 요청을 2.0으로 보냅니다.

  2. 대표 오디오 세트 만들기

    시스템이 실제로 접하는 조건을 골라야 합니다. 깨끗한 녹음, 소음이 있는 통화, 겹치는 발화, 억양, 제품명, 이메일 주소, 계정 코드, 실제 사용량이 있는 언어를 포함하십시오. 민감한 데이터는 기존 정책에 따라 제거하거나 보호해야 합니다.

  3. 같은 설정으로 1.0과 2.0 실행하기

    각 모델을 명시적으로 고정하고 나머지 옵션은 모두 동일하게 유지하십시오. 변환 텍스트, 타임스탬프, 화자 배정뿐 아니라 이를 사용하는 요약, 검색, 점수, 자동화 작업의 출력도 저장해야 합니다.

  4. 사람과 시스템의 차이 측정하기

    오디오 시간당 검수자의 교정 시간을 추적하십시오. 이름, 숫자, 화자 배정, 타임스탬프 오류를 표시합니다. 그런 다음 후속 결과도 비교해야 합니다. 변환 결과의 차이는 본래 수행하려던 작업에 도움이 되거나 해가 될 때만 의미가 있기 때문입니다.

  5. 프로덕션에 고정할 모델 선택하기

    2.0이 인수 기준을 통과하면 해당 모델을 명시적으로 고정하십시오. 1.0은 제공되는 동안 문서화된 임시 대안으로만 유지하고, 공개되지 않은 종료일을 전제로 장기 계획을 세우지 마십시오.

과장 없이 봐야 할 부분

요금은 검증됐지만 인건비 절감 효과는 검증되지 않았습니다.

xAI의 정확도 주장은 테스트를 시작할 타당한 근거지만 인력 계획의 근거는 아닙니다. 오디오 구성에 따라 결과가 달라질 수 있고, 단어 오류율이 낮아졌다고 해서 검수 시간이 자동으로 줄거나 자동화가 더 안전해지는 것은 아닙니다.

전환 안내 문구도 발표보다 빠르게 달라졌습니다. 9월 18일자 페이지에는 기본값 전환이 곧 이뤄진다고 적혀 있지만, 현재 문서에는 모델을 생략할 때 이미 2.0이 기본값으로 표시됩니다. 이 불일치 때문에라도 프로덕션에서 계속 바뀌는 별칭에 기대지 말고 모델을 명시해야 합니다.

마지막으로 $0.10과 $0.20은 오디오 처리 요금입니다. 검수 대기열, 연동 작업, 저장 공간, 재시도, 잘못된 후속 작업의 비용은 포함하지 않습니다. 저렴한 API가 비싼 워크플로를 가리지 않도록 각 비용 항목을 분리하십시오.

지금 무엇을 해야 하나

xAI Speech-to-Text 요청에서 모델을 생략했거나 프로덕션이 1.0에 고정돼 있다면 이번 주에 조치하십시오. 호출 목록을 정리하고, 대표 오디오 세트를 실행한 뒤, 프로덕션 모델을 명시적으로 선택해야 합니다.

대화 중 도착한 변환 결과가 제품의 결과를 바꿀 때만 스트리밍을 사용하십시오. 기다릴 수 있는 녹음은 배치를 쓰는 편이 맞습니다. 포함된 화자 분리, 타임스탬프, 핵심 용어 옵션을 오디오 처리 단계에서 절반의 비용으로 이용할 수 있기 때문입니다.

공급자를 검토하는 단계이고 xAI 변환 결과를 실시간 워크플로에 연결하지 않았다면 기다려도 됩니다. 2.0을 후보 목록에는 남겨두되, 전환하기 전에 자체 오디오로 총 교정 비용과 후속 비용을 비교하십시오.

xAI Speech-to-Text를 쓰지 않거나, 이미 2.0을 명시적으로 고정하고 출력을 검증했다면 영향이 없습니다. 1.0을 명시한 연동은 현재로서는 안정적이지만, xAI가 이미 지원 중단 계획을 밝혔으므로 전환 테스트를 미룰 근거는 되지 않습니다.

월요일에 할 일은 간단합니다. 대표 오디오를 준비하고 같은 설정으로 1.0과 2.0을 실행한 뒤, 교정 시간과 후속 결과의 차이를 측정하고 기준을 통과한 모델을 명시적으로 고정하십시오. 요금표가 그대로라 API 예산은 계산하기 쉽습니다. 변환 결과 검증은 그 주변의 워크플로를 지켜줍니다.

AI 가격이나 워크플로가 실제로 달라질 때 무엇을 확인해야 하는지 더 실용적인 분석을 받아보려면 뉴스레터를 구독하십시오.

마지막 업데이트
2026년 9월 20일
카테고리
Explained

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

Cloudflare Browser Run 실패, HAR 파일로 재실행 전에 진단하기

Cloudflare Browser Run 실패, HAR 파일로 재실행 전에 진단하기

Cloudflare Browser Run의 새 Inspect 패널에서 HAR 파일, 콘솔 로그, 네트워크 요청, 최종 DOM을 확인해 실패 원인을 찾는 방법을 정리합니다. 기록을 언제 켜야 하는지, 재실행 전에 무엇을 점검해야 하는지, 비용과 기록의 한계까지 알아봅니다.2026년 9월 19일Explained
v0에서 사내 디자인 시스템을 그대로 재사용하는 법

v0에서 사내 디자인 시스템을 그대로 재사용하는 법

디자인 시스템의 비공개 npm 패키지를 Vercel v0에 안전하게 연결하는 방법을 정리합니다. NPM_TOKEN과 NPM_RC의 차이, 최소 권한 설정, 요금, 한계, 프로토타입을 실제 저장소로 넘길 때 확인할 항목까지 실무 기준으로 함께 살펴봅니다.2026년 9월 19일Explained
Claude Code 비용, 자동 모드 분류기 과금이 사라지는 조건

Claude Code 비용, 자동 모드 분류기 과금이 사라지는 조건

Claude Code 2.1.278은 서버가 자동 모드 검사를 처리할 때 별도 분류기 요청 비용을 없앱니다. API·Enterprise·게이트웨이 환경에서 /status로 실제 과금 경로를 확인하고, 비용 예측 전에 점검해야 할 호환 조건과 폴백 신호를 정리했습니다.2026년 9월 19일Explained
Vercel 배포 한 번에만 Turbo를 적용하는 방법과 비용

Vercel 배포 한 번에만 Turbo를 적용하는 방법과 비용

Vercel 배포마다 프로젝트의 빌드 머신 설정을 바꿀 필요가 없습니다. Pro와 Enterprise에서 긴급한 배포 한 번에만 Turbo를 적용하는 3가지 방법과 분당 비용을 살펴보고, Basic과 비교해 실제로 아낀 시간과 추가 비용을 검증하는 절차까지 정리했습니다.2026년 9월 18일Explained
워드 AI 실전 가이드: ChatGPT로 Word 문서 작성부터 수정까지

워드 AI 실전 가이드: ChatGPT로 Word 문서 작성부터 수정까지

Word 안에서 ChatGPT로 초안을 만들고 열린 문서를 요약·수정하는 방법을 정리했습니다. 애드인 설치 조건, 공유 사용량과 토큰 요율, 데이터 경계, 검토 절차를 확인하고 앱 사이 복사·붙여넣기를 줄이는 워드 AI 업무 흐름을 안전하게 시작해 보세요.2026년 9월 18일Explained
AI 에이전트 운영자를 위한 Google Antigravity 마이그레이션 가이드

AI 에이전트 운영자를 위한 Google Antigravity 마이그레이션 가이드

Google Antigravity의 5월 에이전트가 2026년 10월 5일 종료됩니다. AI 에이전트 작업의 출력 전용·로컬 툴 경로별 마이그레이션 범위와 새 파일 툴 계약, 안전한 어댑터 테스트, 예약 작업 점검 순서를 실무 기준으로 한눈에 정리했습니다.2026년 9월 18일Explained
Cloudflare Workers RPC 추적, 느린 고객 요청의 병목을 드러내다

Cloudflare Workers RPC 추적, 느린 고객 요청의 병목을 드러내다

Cloudflare Workers의 JavaScript RPC 추적이 Worker와 Durable Object 사이의 호출을 하나의 트레이스로 잇는 방식을 살펴봅니다. 느린 고객 요청의 병목을 찾는 법부터 샘플링, 보존 기간, 2026년 10월 1일 이후 과금까지 정리합니다.2026년 9월 17일Explained
Vercel Hobby 배포 기록, 30일 전에 사라질 수 있습니다

Vercel Hobby 배포 기록, 30일 전에 사라질 수 있습니다

Vercel Hobby 팀이 Deployment Storage 10GB를 넘으면 보호되지 않은 프리뷰와 롤백 대상이 30일 전에도 삭제될 수 있습니다. 계속 보호되는 배포 조건부터 저장 공간 점검 순서, 월 $20부터 시작하는 Pro 전환 비용까지 한 번에 정리합니다.2026년 9월 17일Explained
뉴스레터

매주 일요일, 한 통의 편지.뜨거운 의견이 아닌, 돌아가는 시스템.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.