음성 AI 통화 비용, GPT-Live-1의 $0.05가 전부는 아닙니다
음성 AI 모델 GPT-Live-1의 분당 $0.05 요금만 보면 실제 통화 비용을 놓치기 쉽습니다. 음성 세션, 백엔드 추론과 툴, 통신사 비용을 합쳐 처리가 완료된 통화 한 건의 총비용을 계산하는 법과 90초 예약 전화 사례, 도입 전 점검할 기준을 정리했습니다.

GPT-Live-1의 등장으로 음성 AI 전화 비용의 한 축은 계산이 쉬워졌습니다. 음성 세션 요금은 분당 $0.05입니다. 2026년 9월 10일부터 음성 입출력 흐름을 단순화할 수 있게 됐지만, 예산에서 정말 봐야 할 숫자는 여전히 백엔드 추론, 툴, 통신사 통화료까지 포함해 처리가 완료된 통화 한 건의 총비용입니다.
음성 AI에서 5센트는 음성 레이어 비용입니다
GPT-Live-1은 풀듀플렉스 음성 모델입니다. 풀듀플렉스는 말하는 동안에도 들을 수 있다는 뜻입니다. 발신자는 정해진 차례가 끝날 때까지 기다리지 않고 말을 끊거나, 잠시 멈추거나, 내용을 바로잡거나, 짧게 맞장구칠 수 있습니다.
이 특성은 시스템 구성을 바꿉니다. 기존 음성 에이전트는 흔히 음성 인식, 언어 모델, 음성 합성을 차례로 연결합니다. 애플리케이션은 단계가 바뀔 때마다 정보를 전달해야 하고, 양쪽이 동시에 말하면 어떻게 처리할지도 결정해야 합니다.
GPT-Live-1은 실시간 대화를 하나의 음성 레이어에서 처리합니다. 듣고 말하면서 타이밍을 추적하고, 더 깊은 처리가 필요한 작업을 언제 백엔드로 넘길지 판단합니다. 백엔드는 예약 가능 여부를 확인하거나, 계정 기록을 읽거나, 툴을 호출하거나, 정책을 검토할 수 있습니다.
백엔드는 의도적으로 분리돼 있습니다. Responses 위임을 사용하면 GPT-Live-1이 사용자가 설정한 OpenAI 텍스트 모델로 작업을 보냅니다. 클라이언트 위임을 택하면 자체 애플리케이션이 원하는 모델, 에이전트 또는 서비스를 실행한 뒤 결과를 돌려줍니다. 같은 음성을 유지하면서 작업에 따라 더 저렴하거나 더 깊이 추론하는 두뇌를 고를 수 있습니다.
전화 연결도 별도입니다. 수신 전화는 통신 사업자가 제공하는 인터넷 연결인 SIP 트렁크를 거치거나, 오디오를 중계하는 애플리케이션을 통해 GPT-Live-1에 도달할 수 있습니다. Live 세션은 OpenAI가 처리하지만, 전화번호와 통화 연결은 여전히 통신사가 담당합니다.
예산 관점에서 달라지는 핵심은 이것입니다. 이제 이 경로에서는 음성 인식과 음성 생성을 OpenAI 모델의 서로 다른 두 단계로 나눠 계산할 필요가 없습니다. 대신 세 가지 비용 장부는 정확히 구분해야 합니다.
청구 비용은 세 갈래로 나뉩니다
첫 번째 함정은 시간입니다. GPT-Live-1 과금은 세션이 시작해 종료될 때까지 활성 상태로 열린 시간을 따릅니다. 침묵도, 툴을 기다리는 시간도 요금에 포함됩니다. 마이크를 음소거해도 과금은 멈추지 않습니다.
두 번째 함정은 대화 뒤에서 실행된다는 이유로 백엔드를 무료라고 보는 것입니다. 백엔드에도 비용이 듭니다. GPT-5.6 Luna의 표준 짧은 컨텍스트 요금은 입력 토큰 백만 개당 $0.20, 출력 토큰 백만 개당 $1.20입니다. GPT-5.6 Terra는 각각 $2.00와 $12.00, GPT-6 Astra는 $10.00와 $50.00입니다. 단순히 토큰 요금이 가장 낮은 모델을 찾는 것은 올바른 비교가 아닙니다. 총 통화 시간과 재작업을 최소화하면서 업무를 안정적으로 끝내는 조합을 찾아야 합니다.

예약 전화로 계산해 보면 실제 비용이 보입니다
식당으로 걸려 온 90초짜리 예약 전화를 예로 들어보겠습니다. OpenAI가 제시한 비용 예시를 출발점으로 삼으면 계산은 명확합니다.
- 음성: 90초를 60으로 나눈 뒤 $0.05를 곱하면 $0.075입니다.
- 백엔드: 이 예시에서 측정된 모델 및 툴 사용료의 합계를 $0.02로 가정합니다.
- 음성과 백엔드 소계: $0.095입니다.
- 통신사 통화료: 해당 통화에 실제로 부과된 통신사 요금을 더합니다.
따라서 이 통화의 비용은 $0.075가 아닙니다. 이 예시에서는 $0.095에 통신사 통화료를 더한 금액입니다. 예약이 확정됐다면 이것이 해결된 예약 한 건의 직접 실행 비용입니다. 에이전트가 실패해 사람이 같은 일을 다시 처리해야 한다면, 해결 건당 비용을 계산할 때 실패한 통화 비용도 분자에 남습니다.
총액에 임의의 시장 요금을 끼워 넣기보다 통신사 비용을 미정 항목으로 남겨 두는 편이 더 정직합니다. OpenAI가 이 요금을 정하는 것이 아니므로 실제 통신사 청구서에서 통화료를 가져와야 합니다.
계산에는 또 하나의 상호작용이 있습니다. 토큰 요금이 더 비싸더라도 Live 세션을 더 빨리 끝내는 백엔드라면 그 값을 할 수 있습니다. 열린 시간이 1분 줄면 음성 요금에서 $0.05를 아낍니다. 반대로 저렴한 백엔드가 발신자에게 같은 내용을 되풀이하게 하거나, 툴 응답을 오래 기다리게 하거나, 예약에 실패한다면 총비용은 오히려 커질 수 있습니다.
실제 통화 흐름에는 어떻게 적용할 수 있을까요?
식당 운영자는 수신 예약 전화번호에 GPT-Live-1을 연결하고 역할을 좁게 설정할 수 있습니다. 음성 레이어는 대화를 맡고, 저비용 백엔드는 예약 가능 여부를 확인해 예약안을 준비합니다. 애플리케이션은 최종 시간을 확인하고 예약을 기록하며, 늦게 도착한 결과가 잘못된 시간으로 예약되지 않도록 막습니다.
고객 지원 책임자는 같은 프런트엔드에 서로 다른 백엔드 정책을 적용할 수 있습니다. 일반적인 주문 조회는 비용 효율적인 모델로 보내고, 결제 이의 제기나 정책 예외는 더 깊이 추론하는 모델 또는 사람에게 넘깁니다. 모든 일을 음성 모델 하나에 맡기는 것이 핵심은 아닙니다. 하나의 일관된 음성 경험을 유지하면서 업무별로 추론 비용을 선택하는 데 가치가 있습니다.
이미 음성 인식, 모델, 음성 합성 체인을 운영하는 제품 팀은 판단 기준이 다릅니다. GPT-Live-1은 단계 사이의 연결 코드를 줄이고 동시 발화를 더 쉽게 처리할 수 있지만, 새 시스템의 업무 완료율이나 유지보수 개선 효과가 전환 작업을 감당할 만큼 커야 마이그레이션이 의미가 있습니다. 구축과 구매 중 무엇을 택할지 고민한다면 더 폭넓은 AI 음성 에이전트 비용 비교도 참고할 만합니다.
브라우저 앱 팀은 WebRTC로 연결해 통신사 비용 항목을 완전히 없앨 수 있습니다. 그래도 Live 사용 시간과 백엔드 작업 비용은 지불해야 합니다. 음성이 필요 없는 텍스트 전용 에이전트, 배치 워크플로, 애플리케이션은 이번 출시에 영향을 받지 않습니다.
가장 작지만 유효한 전화 파일럿
직접 SIP 경로는 통신사가 OpenAI로 수신 전화를 보내고 웹훅이 Live 세션 ID를 받으면서 시작됩니다. 문서에 나온 세션 수락 요청의 형태는 다음과 같습니다.
curl -X POST "https://api.openai.com/v1/live/sessions/$SESSION_ID/accept" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"session": {
"type": "live",
"model": "gpt-live-1",
"instructions": "You are answering an inbound support call.",
"audio": { "output": { "voice": "marin" } },
"delegation": { "type": "client" }
}
}'API 키는 신뢰할 수 있는 백엔드에 보관합니다. SIP가 오디오 형식을 협상하므로 audio.format은 넣지 않습니다. 클라이언트 위임을 설정하면 백엔드 모델, 툴, 권한, 사용량 기록은 자체 애플리케이션이 관리합니다.
수신 예약 전화 파일럿은 범위가 좁아 측정 기준을 깔끔하게 유지하기 좋습니다.
한 가지 성과 기준을 정합니다
기분 좋은 대화가 아니라 예약 확정을 성공으로 정의합니다. 고객이 요청한 시간, 최종 예약 시간, 사람이 넘겨받았는지를 저장합니다.
모든 비용 항목을 기록합니다
통화 중에는 가장 최근의 누적 음성 사용 시간(초)을 보관합니다. 정상적으로 종료되면 그 값을 최종
session.closed사용량으로 대체합니다. 각 백엔드 응답 ID와 토큰 및 툴 사용량은 한 번만 저장하고, 해당 기록을 통신사의 통화 상세 내역과 연결합니다.실제 통화 방식으로 끼어들기를 테스트합니다
실제 발신자가 사용하는 침묵, 정정, 배경 음성, 짧은 맞장구를 재현합니다. 대화 기록, 백엔드가 실행한 작업, 발신자가 실제로 들은 오디오를 확인합니다. 백엔드 응답이 완료됐다는 사실만으로 그 결과가 음성으로 전달됐다고 볼 수는 없습니다.
완료된 업무 한 건당 비용을 비교합니다
파일럿의 음성, 백엔드, 통신사 비용을 모두 더한 뒤 확정된 예약 건수로 나눕니다. 실패한 통화, 재시도, 사람에게 넘긴 건도 비용에 포함합니다. 같은 통화 스크립트로 현재 시스템과 결과를 비교합니다.
끼어들기 성능은 자체 데이터로 검증해야 합니다
GPT-Live-1은 겹치는 발화를 처리하도록 설계됐지만, 출시 사례가 곧 서비스 수준 협약이 되는 것은 아닙니다. Speak의 공동 창업자이자 CTO인 Andrew Hsu는 초기 평가에서 생각하느라 잠시 멈춘 구간의 끼어들기가 기존 턴 기반 시스템보다 거의 80% 줄었다고 말합니다. 이는 Speak의 언어 학습 서비스 환경에서 나온 결과입니다.
소음이 많은 식당 전화, 주문 번호를 읽는 고객 지원 발신자, 날짜를 말하기 전에 잠시 멈추는 환자는 모두 다른 워크로드입니다. 프롬프트, 전화 코덱, 통신사 지터, 툴 지연 시간, 자체 재생 제어가 발신자의 경험에 모두 영향을 줍니다. 모든 환경에 그대로 적용할 수 있는 보편적인 끼어들기 또는 지연 시간 개선 수치는 없습니다.
프로덕션의 예외 상황도 중요합니다. 발신자가 끼어들어 금요일을 목요일로 바꿨다고 해서, 말로 정정한 내용이 금요일에 대한 백엔드 작업을 자동으로 취소하지는 않습니다. 애플리케이션이 기존 작업을 수정하거나 취소하고, 늦게 도착한 결과를 무시하며, 재시도로 두 번째 예약이 생기지 않도록 해야 합니다.
현재 GPT-Live의 직접 SIP 연결은 수신 전화만 지원합니다. Live 세션 생성 엔드포인트에서 발신 SIP 전화를 시작할 수 없으므로 아웃바운드 캠페인에는 여전히 통신사가 보유한 파트너 경로가 필요합니다. 아웃바운드가 우선인 팀은 마이그레이션을 계획하기 전에 해당 경로를 확인해야 합니다.
월요일에 바로 할 일
수신 예약이나 고객 지원 대기열을 운영한다면 범위를 좁힌 파일럿 하나부터 계측하십시오. 음성 사용 초, 백엔드 사용량, 통신사 요금, 완료된 업무, 사람에게 넘긴 건, 끼어들기 실패를 같은 기록에 담습니다. 비용 효율적인 백엔드와 실제로 필요하다고 보는 더 깊은 모델을 비교합니다.
해결된 통화 한 건의 총비용이 현재 스택보다 낮고, 고객이 에이전트의 잘못을 바로잡아도 이미 무효가 된 작업이 실행되지 않을 때 도입을 진행하면 됩니다. 이점이 $0.05라는 표면적인 요금뿐이거나 통신사와 아웃바운드 경로가 정리되지 않았다면 기다리는 편이 낫습니다. 텍스트 전용 업무와 이미 비용 및 완료율 목표를 충족하는 음성 경험에는 이번 출시를 적용할 필요가 없습니다.
운영 비용을 바꾸는 기술 변화가 궁금하다면 쉬운 설명으로 정리해 드리는 뉴스레터에 가입하세요.
- 마지막 업데이트
- 2026년 9월 14일
- 카테고리
- Explained







