Grok Voice Transcribe 2.0 전환: 음성 텍스트 변환 비용과 기본 모델 점검법
Grok Voice Transcribe 2.0은 배치 시간당 $0.10, 스트리밍 시간당 $0.20을 유지합니다. 기본 모델 변경은 같은 API 호출의 음성 텍스트 변환 결과와 후속 업무를 바꿀 수 있습니다. 모델 고정과 실제 오디오 검증 절차를 정리했습니다.

Grok Voice Transcribe 2.0의 음성 텍스트 변환 요금은 배치 시간당 $0.10, 스트리밍 시간당 $0.20으로 그대로입니다. 문제는 공개 문서에서 기본 모델이 이미 바뀌었다는 점입니다. 모델을 지정하지 않은 같은 API 호출이라도 변환 문구가 달라지고, 그 결과를 이어받는 후속 업무까지 바뀔 수 있습니다.
실제로 무엇이 달라졌나
xAI는 2026년 9월 18일 Grok Voice Transcribe 2.0을 출시했습니다. 녹음 음성이나 실시간 음성을 다른 제품 또는 워크플로에서 활용할 수 있는 텍스트로 바꾸는 현행 음성 인식 모델로, Grok Voice Transcribe 1.0을 대체합니다.
작동 방식은 명확하게 두 가지입니다. 배치는 녹음이 끝난 뒤 파일이나 오디오 URL을 REST 엔드포인트로 보냅니다. 스트리밍은 사용자가 말하는 동안 WebSocket으로 오디오를 전송합니다. 통화가 끝나기 전에도 자막, 에이전트 응답, 실시간 지원 기능이 반응할 수 있는 방식입니다.
출시 안내에 따르면 기존 연동도 코드 변경 없이 2.0 모델을 받을 수 있습니다. 간편해 보이지만, 바로 이 점 때문에 운영팀의 확인이 필요합니다. 요청에 모델을 명시하지 않으면 출력이 바뀌는 시점을 공급자가 결정하게 됩니다.
요금표는 달라지지 않았습니다. 배치는 오디오 시간당 $0.10, 스트리밍은 오디오 시간당 $0.20입니다. 발화자를 구분해 단어를 배정하는 화자 분리, 단어 단위 타임스탬프, 핵심 용어 편향 설정도 이 요금에 포함됩니다.
음성 텍스트 변환 API 비용은 그대로지만 워크플로 비용은 달라질 수 있습니다
API 비용만 놓고 보면 계산은 간단합니다.
스트리밍 요금은 배치의 두 배입니다. 오디오 1,000시간을 처리하면 추가 비용은 $100입니다. 실시간 자막, 통화 중 지원, 다음 발화를 결정하는 음성 에이전트처럼 완성된 녹음을 기다리는 순간 제품이 제대로 작동하지 않는다면 이 추가 비용은 타당합니다.
오디오가 이미 저장돼 있다면 스트리밍을 쓴다고 변환 결과 자체가 더 유용해지는 것은 아닙니다. 미디어 아카이브, 밀린 팟캐스트, 녹화 인터뷰, 야간 통화 검토 작업이라면 보통 배치를 유지해 더 낮은 요금을 적용하는 편이 맞습니다.
API 항목은 전체 예산의 일부일 뿐입니다. 실제 운영에 유용한 계산식은 다음과 같습니다.
총 음성 변환 비용 = 오디오 API 비용 + 사람의 교정 비용 + 후속 재작업 비용
첫 번째 항목은 요금표로 알 수 있습니다. 두 번째는 검수 시간과 검수 담당자의 제반 비용을 반영한 시간당 인건비에 따라 달라집니다. 세 번째는 달라진 단어, 화자 라벨, 타임스탬프, 숫자 표기 때문에 자막 파일, 품질 점수, CRM 메모, 검색 인덱스, 자동화 작업을 다시 손봐야 할 때 발생합니다.
이번 출시가 비즈니스에 미치는 핵심 영향이 여기에 있습니다. 오디오 지출은 정확히 같아도, 실제로 쓸 수 있는 변환 결과를 만드는 총비용은 오르거나 내릴 수 있습니다. 대표 오디오로 테스트하기 전까지 교정 시간 단축은 가능성일 뿐, 예측치에 반영할 수 있는 절감액이 아닙니다.
누가 쓸 수 있으며 무엇이 달라지나
저장된 상담 통화를 처리하는 고객 지원 운영 책임자
고객 지원팀은 녹음 통화를 오디오 시간당 $0.10인 배치로 보내고, 화자 분리를 켠 뒤 제품명을 핵심 용어로 전달할 수 있습니다. 직접적인 API 비용은 예측 가능한 수준으로 유지됩니다. 전환 여부를 판단할 때는 2.0이 이름, 계정 정보, 화자 배정을 고치는 검수 시간을 줄이는지 늘리는지 확인해야 합니다.
성과는 추상적인 정확도 점수가 아닙니다. 후속 단계의 오류를 늘리지 않으면서 교정 대기열을 줄이는 것이 목표입니다. 프로덕션 모델 고정을 바꾸기 전에 두 항목을 모두 측정해야 합니다.
실시간 음성 에이전트를 운영하는 제품팀
음성 에이전트는 통화가 끝날 때까지 기다리면 제품의 목적을 달성할 수 없습니다. 변환 결과가 실시간 제어 루프의 일부이므로 오디오 시간당 $0.20인 스트리밍의 높은 요금도 가치가 있습니다. 두 모델이 침묵 구간, 숫자, 말 끊김, 핵심 용어를 어떻게 처리하는지 비교한 다음, 해당 변환 결과로 실행된 작업까지 살펴봐야 합니다.
사람이 보기에는 더 깔끔한 텍스트도, 표기 형식이 달라진 값 하나가 조회를 바꾸거나 발화 경계 하나 때문에 에이전트가 너무 일찍 답하면 워크플로를 망가뜨릴 수 있습니다. 인수 테스트는 텍스트에 그치지 않고 후속 작업까지 포함해야 합니다.
자막을 납품하는 미디어 운영 책임자
인터뷰나 고객 영상을 처리하는 에이전시는 배치를 사용하고, 비교 대상에 타임스탬프 출력도 포함해야 합니다. 두 모델을 각각 명시한 상태에서 발음하기 어려운 같은 이름과 화자가 겹치는 같은 구간을 비교하십시오. 성과는 공급자가 제시한 종합 벤치마크가 아니라 교정 시간과 자막 전달 품질로 측정해야 합니다.
API는 하나의 구성 요소일 뿐 편집 작업 공간은 아닙니다. 브라우저 편집기, 회의 봇, 자막 워크플로, 사람에게 넘기는 에스컬레이션 경로가 필요하다면 완성형 음성 변환 툴 비교를 참고하십시오.
다국어 SaaS 고객 지원팀
xAI는 2.0이 자체 평가 전반에서 1.0보다 정확도가 두 배 높다고 밝힙니다. 자체 다국어 짧은 문구 데이터세트의 단어 오류율도 20.6%에서 6.8%로 낮아졌다고 보고했습니다. 이는 이 글을 위해 수행한 테스트가 아니라 공급자가 진행한 비교입니다.
다국어 고객 지원팀이라면 실제 언어 구성, 억양, 전화 회선, 이름, 코드 스위칭을 표본으로 삼아야 합니다. 종합 수치가 좋아졌다고 해서 티켓 비중이 큰 언어도 개선됐다고 단정할 수 없고, 인력 배치를 바꿀 만큼 교정 시간이 줄었는지도 알 수 없습니다.
모델을 명시한 뒤 출력 결과를 테스트하십시오
최소한의 배치 호출은 간단합니다. 아래 cURL 예시는 2.0 모델을 명시한 xAI 공식 요청 형식입니다.
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F file=@audio.mp3핵심은 모델 필드입니다. grok-voice-transcribe-2.0을 명시적으로 고정하면 선택권을 직접 가질 수 있습니다. 임시 기준선이 필요하다면 현재 문서상 grok-voice-transcribe-1.0도 여전히 사용할 수 있습니다. xAI는 뒤에 오는 옵션 필드가 무시될 수 있다고 경고하므로 멀티파트 요청에서는 파일 필드를 마지막에 두십시오.
전환을 점검할 때는 두 모델에 같은 요청 설정을 적용해야 합니다. 모델, 화자 분리, 서식, 간투사 처리, 핵심 용어를 한꺼번에 바꾸면 어떤 변경이 출력 차이를 만들었는지 설명할 수 없습니다.
모델을 지정하지 않은 모든 요청 찾기
배치와 스트리밍 코드 경로에서
model을 생략한 호출을 찾으십시오. 엔드포인트를 감싼 백그라운드 작업, 내부 툴, 스테이징, 외부 공급자 연동도 포함해야 합니다. 현재 공개 문서는 모델을 생략한 요청을 2.0으로 보냅니다.대표 오디오 세트 만들기
시스템이 실제로 접하는 조건을 골라야 합니다. 깨끗한 녹음, 소음이 있는 통화, 겹치는 발화, 억양, 제품명, 이메일 주소, 계정 코드, 실제 사용량이 있는 언어를 포함하십시오. 민감한 데이터는 기존 정책에 따라 제거하거나 보호해야 합니다.
같은 설정으로 1.0과 2.0 실행하기
각 모델을 명시적으로 고정하고 나머지 옵션은 모두 동일하게 유지하십시오. 변환 텍스트, 타임스탬프, 화자 배정뿐 아니라 이를 사용하는 요약, 검색, 점수, 자동화 작업의 출력도 저장해야 합니다.
사람과 시스템의 차이 측정하기
오디오 시간당 검수자의 교정 시간을 추적하십시오. 이름, 숫자, 화자 배정, 타임스탬프 오류를 표시합니다. 그런 다음 후속 결과도 비교해야 합니다. 변환 결과의 차이는 본래 수행하려던 작업에 도움이 되거나 해가 될 때만 의미가 있기 때문입니다.
프로덕션에 고정할 모델 선택하기
2.0이 인수 기준을 통과하면 해당 모델을 명시적으로 고정하십시오. 1.0은 제공되는 동안 문서화된 임시 대안으로만 유지하고, 공개되지 않은 종료일을 전제로 장기 계획을 세우지 마십시오.
과장 없이 봐야 할 부분
요금은 검증됐지만 인건비 절감 효과는 검증되지 않았습니다.
xAI의 정확도 주장은 테스트를 시작할 타당한 근거지만 인력 계획의 근거는 아닙니다. 오디오 구성에 따라 결과가 달라질 수 있고, 단어 오류율이 낮아졌다고 해서 검수 시간이 자동으로 줄거나 자동화가 더 안전해지는 것은 아닙니다.
전환 안내 문구도 발표보다 빠르게 달라졌습니다. 9월 18일자 페이지에는 기본값 전환이 곧 이뤄진다고 적혀 있지만, 현재 문서에는 모델을 생략할 때 이미 2.0이 기본값으로 표시됩니다. 이 불일치 때문에라도 프로덕션에서 계속 바뀌는 별칭에 기대지 말고 모델을 명시해야 합니다.
마지막으로 $0.10과 $0.20은 오디오 처리 요금입니다. 검수 대기열, 연동 작업, 저장 공간, 재시도, 잘못된 후속 작업의 비용은 포함하지 않습니다. 저렴한 API가 비싼 워크플로를 가리지 않도록 각 비용 항목을 분리하십시오.
지금 무엇을 해야 하나
xAI Speech-to-Text 요청에서 모델을 생략했거나 프로덕션이 1.0에 고정돼 있다면 이번 주에 조치하십시오. 호출 목록을 정리하고, 대표 오디오 세트를 실행한 뒤, 프로덕션 모델을 명시적으로 선택해야 합니다.
대화 중 도착한 변환 결과가 제품의 결과를 바꿀 때만 스트리밍을 사용하십시오. 기다릴 수 있는 녹음은 배치를 쓰는 편이 맞습니다. 포함된 화자 분리, 타임스탬프, 핵심 용어 옵션을 오디오 처리 단계에서 절반의 비용으로 이용할 수 있기 때문입니다.
공급자를 검토하는 단계이고 xAI 변환 결과를 실시간 워크플로에 연결하지 않았다면 기다려도 됩니다. 2.0을 후보 목록에는 남겨두되, 전환하기 전에 자체 오디오로 총 교정 비용과 후속 비용을 비교하십시오.
xAI Speech-to-Text를 쓰지 않거나, 이미 2.0을 명시적으로 고정하고 출력을 검증했다면 영향이 없습니다. 1.0을 명시한 연동은 현재로서는 안정적이지만, xAI가 이미 지원 중단 계획을 밝혔으므로 전환 테스트를 미룰 근거는 되지 않습니다.
월요일에 할 일은 간단합니다. 대표 오디오를 준비하고 같은 설정으로 1.0과 2.0을 실행한 뒤, 교정 시간과 후속 결과의 차이를 측정하고 기준을 통과한 모델을 명시적으로 고정하십시오. 요금표가 그대로라 API 예산은 계산하기 쉽습니다. 변환 결과 검증은 그 주변의 워크플로를 지켜줍니다.
AI 가격이나 워크플로가 실제로 달라질 때 무엇을 확인해야 하는지 더 실용적인 분석을 받아보려면 뉴스레터를 구독하십시오.
- 마지막 업데이트
- 2026년 9월 20일
- 카테고리
- Explained







