2026년 컴퓨터 사용 AI 에이전트용 멀티모달 AI 모델 4선

2026년 컴퓨터 사용 AI 에이전트에 맞는 모델을 비교했습니다. GPT-5.6 Sol, Claude Opus 5, Gemini 3.7 Flash, DeepSeek의 성능·가격·안전 제어를 검토하고, 검수 통과 작업당 비용으로 고르는 기준과 240회 실전 평가법을 제시합니다.

Wednesday, September 2, 2026Omid Saffari
2026년 컴퓨터 사용 AI 에이전트용 멀티모달 AI 모델 4선

2026년 컴퓨터 사용 AI 에이전트에 가장 뛰어난 종합 모델은 GPT-5.6 Sol입니다. 다만 입력 토큰 50,000개와 출력 토큰 5,000개가 계측되는 작업을 기준으로 정규화한 모델 비용은 $0.40입니다. 같은 토큰 구성에서 Gemini 3.7 Flash는 $0.05625, DeepSeek V4-Flash-Vision-Exp는 $0.0143~$0.0286입니다. 토큰 단가가 가장 낮은 모델이 아니라, 검수를 통과한 완료 건당 비용이 가장 낮아지는 경로를 선택해야 합니다.

AI 에이전트용 모델 4종 한눈에 보기

아래 네 가지 경로는 서로 다른 방식으로 컴퓨터 사용을 구현합니다. GPT-5.6 Sol, Claude Opus 5, Gemini 3.7 Flash에는 액션 루프가 정의된 컴퓨터 사용 툴이 있습니다. 반면 DeepSeek V4-Flash-Vision-Exp가 제공하는 것은 비전 모델과 범용 툴 호출입니다. 컴퓨터 액션, 실행기, 승인 절차, 복구 로직은 애플리케이션에서 직접 설계해야 합니다.

가격은 2026년 8월 22일에 확인했습니다. ‘시작 가격’은 100만 토큰당 직접 API 정가이며 입력/출력 순으로 표기했습니다. 별도 언급이 없으면 실행기 호스팅, 툴 요금, 재시도, 사람의 검수 비용은 포함하지 않습니다.

가장 적합한 용도시작 가격무료 체험
GPT-5.6 Sol공개된 컴퓨터 사용 품질이 가장 높은 경로MTok당 $5/$30API Free 티어 없음
Claude Opus 5통제가 필요한 엔터프라이즈 데스크톱·브라우저 업무MTok당 $5/$25신규 사용자용 소액 크레딧
Gemini 3.7 Flash가장 저렴한 기본 제공 컴퓨터 사용 경로12월 31일까지 MTok당 $0.75/$3.75Computer Use는 해당 없음
DeepSeek V4-Flash-Vision-Exp비용을 우선하는 커스텀 에이전트 하네스오프피크 MTok당 $0.22/$0.66공지된 내용 없음

순위는 다음과 같습니다.

  1. GPT-5.6 Sol은 액션 실패의 대가가 크고, 이 목록에서 공개된 컴퓨터 사용 성능이 가장 강한 모델을 원할 때 가장 좋은 종합 선택입니다.
  2. Claude Opus 5는 벤치마크 선두보다 브라우저 구조 인식, 자동 프롬프트 인젝션 확인, 데이터 처리, 규제 대상 워크로드 적격성이 더 중요할 때 적합한 엔터프라이즈 제어 선택입니다.
  3. Gemini 3.7 Flash는 되돌릴 수 있는 브라우저·모바일·데스크톱 자동화에 가장 비용 효율적인 기본 제공 경로입니다. 모델은 GA지만 Computer Use는 여전히 Preview입니다.
  4. DeepSeek V4-Flash-Vision-Exp는 이미 실행기와 평가 스택을 보유한 기술팀을 위한 최저 비용 경로입니다. 완성된 컴퓨터 사용 시스템이 아니라 실험적 비전 코어입니다.

스크린샷 속 버튼을 찾아낸다는 이유만으로 컴퓨터 사용 모델을 도입해서는 안 됩니다. 프로덕션 에이전트는 상태를 인식하고, 허용된 액션을 제안한 뒤, 격리된 환경에서 실행하고, 결과를 관찰하며, 오류에서 복구해야 합니다. 결과를 초래하는 액션 앞에서는 승인을 받기 위해 멈춰야 합니다. 이 전체 루프를 감당할 수 있는 위험 수준 안에서 가장 낮은 비용으로 끝내는 경로가 진짜 ‘최고의 모델’입니다.

1분 만에 내리는 결론

상태 하나를 놓치거나 좌표를 잘못 짚고, 복구에 실패하는 것만으로 운영자 시간이 몇 분씩 사라지는 고가치 업무라면 GPT-5.6 Sol부터 선택합니다. OpenAI가 공개한 Sol의 OSWorld 2.0 결과는 62.6%입니다. 이는 공급사가 보고한 벤치마크이지, 실제 CRM·보험금 청구 포털·데스크톱 앱에서도 똑같이 작동한다는 보장은 아닙니다. 그래도 현재 네 가지 경로 중 공개된 컴퓨터 사용 수치로는 가장 강합니다.

제어 계층까지 구매 판단에 포함된다면 Claude Opus 5가 맞습니다. Anthropic의 최신 툴셋은 클라이언트 측 액션 17개를 제공하고, 한 턴에 여러 액션을 묶을 수 있으며, 페이지 구조를 읽는 브라우저 전용 툴도 추가합니다. 스크린샷에서 의심스러운 프롬프트 인젝션도 자동으로 검사합니다. 이제 Claude API의 컴퓨터 사용이 GA가 되면서 조달 과정의 큰 걸림돌 하나가 사라졌습니다. 다만 환경과 액션 실행은 여전히 애플리케이션이 책임집니다.

기본 액션 스키마가 필요하면서 비용을 최저선 가까이 유지해야 하는 가역적 워크플로라면 Gemini 3.7 Flash를 선택합니다. 여기서 사용한 워크로드 기준으로 정규화한 토큰 비용은 Sol보다 훨씬 낮습니다. Google은 승인과 로깅에 유용한 액션 의도와 안전 판단도 제공합니다. 단, Gemini 3.7 Flash 모델은 GA지만 Computer Use 기능은 여전히 Preview입니다. Google은 면밀한 감독 없이 민감하거나 되돌릴 수 없는 작업에 쓰지 말라고 경고합니다.

‘빠진 제어 계층을 직접 만드는 것’이 장점으로 느껴질 때만 DeepSeek V4-Flash-Vision-Exp를 선택합니다. 피크 시간 토큰 가격도 Gemini의 현재 Standard 요금보다 낮고, 최대 크기 스크린샷 입력 100장의 피크 비용은 텍스트와 출력을 제외하면 $0.016896 이하입니다. 낮은 가격은 분명 중요합니다. 그러나 공급사가 제공하는 컴퓨터 액션 툴이 없다는 점도 똑같이 중요합니다. 기존 브라우저·데스크톱 하네스가 없는 팀이라면 엔지니어링과 안전 설계 자체를 초기 설정이 아닌 제품 개발로 봐야 합니다.

컴퓨터 사용 워크로드를 GPT-5.6, Claude, Gemini, DeepSeek로 분기하는 실물형 의사결정 흐름도
작업 위험도와 필요한 제어 계층부터 판단한 뒤 모델 경로를 선택합니다.

22초 테스트: 토큰 가격이 작업 비용과 다른 이유

스크린샷 에이전트는 한 번의 추론이 아니라 반복 루프입니다. 애플리케이션이 스크린샷과 상태를 보내면 모델이 액션 하나 또는 짧은 액션 묶음을 반환합니다. 실행기가 이를 수행하고, 애플리케이션은 바뀐 상태를 다시 캡처해 모델에 요청합니다. 턴이 늘어날 때마다 이미지 토큰, 툴 정의, 액션 결과, 지연 시간, 추가 복구 가능성이 쌓입니다.

따라서 모델이 게시한 입력 가격은 비용의 최저선일 뿐입니다. 구매 판단에 써야 할 지표는 다음과 같습니다.

검수 통과 작업 비용 = (모델 토큰 + 툴 요금 + 실행기 런타임 + 사람의 검수 + 재시도) ÷ 검수를 통과한 완료 건수

여기서 중요한 단어는 ‘검수 통과’입니다. 모델이 끝났다고 말해도 작업이 완료된 것은 아닙니다. 결과는 결정론적 검사나 사전에 정한 사람의 기준을 충족해야 합니다. 양식 입력이라면 모든 필드가 원본 레코드와 일치하고 최종 제출은 승인 단계 뒤에 남아 있어야 합니다. 시각적 QA라면 목표 흐름이 완료되고 예상 요소가 나타났으며 증거 스크린샷까지 보관됐는지를 확인할 수 있습니다.

API 가격을 비교하려면 계측된 총 입력 토큰 50,000개와 출력 토큰 5,000개로 구성된 하나의 정규화 작업을 사용합니다. 입력 한도에는 스크린샷, 툴 정의, 이전 상태와 결과가 포함됩니다. 모든 워크플로를 예측하려는 수치가 아니라, 동일한 자로 비교하기 위한 기준입니다.

  • GPT-5.6 Sol의 모델 토큰 비용은 $0.40입니다.
  • Claude Opus 5는 $0.375입니다.
  • Gemini 3.7 Flash Standard Paid는 2026년 12월 31일까지 $0.05625입니다.
  • DeepSeek V4-Flash-Vision-Exp는 캐시 미스 입력 기준 오프피크 $0.0143, 피크 $0.0286입니다.

제출 작업이 1,000건이면 이 최저선은 Sol $400, Opus 5 $375, Gemini $56.25, DeepSeek $14.30~$28.60이 됩니다. 실행기와 공급사별 툴 요금은 제외한 값입니다. 성공률이 같다는 뜻도 아니며, 계측된 토큰 구성이 같다고 가정했을 뿐입니다.

정규화한 컴퓨터 사용 모델 토큰 비용을 비교하는 실물형 세로 막대 차트
계측 입력 토큰 50K개와 출력 토큰 5K개의 모델 비용만 비교했습니다. DeepSeek에는 피크 요금을 적용했습니다.

이제 인건비를 더해 봅니다. 운영자의 총부담 인건비가 시간당 $60이면 1분은 $1입니다. DeepSeek 피크 요금 대비 Sol의 모델 프리미엄 $0.3714는 노동 시간 22.284초와 같습니다. Claude의 프리미엄은 20.784초, Gemini는 1.659초입니다.

이것이 22초 테스트입니다. Sol이 제출 작업 1건마다 검수, 재작업, 실패한 루프의 복구 시간을 22초 줄인다면 DeepSeek 피크 요금 대비 토큰 프리미엄은 사라집니다. 작업 1,000건에서 Sol의 모델 토큰 비용은 $371.40 더 들며, 손익분기점에 도달하려면 운영자 시간을 약 6.19시간 절약해야 합니다. 사람이 로그를 열고 상태를 파악한 뒤 수정하고 실행을 다시 시작하는 과정까지 생각하면 한 번의 개입이 이보다 오래 걸리는 경우가 많습니다.

이 테스트는 Sol이 실제로 그 시간을 절약한다고 증명하지 않습니다. 대신 평가에서 무엇을 측정해야 하는지 알려 줍니다. 벤치마크 점수는 파일럿의 근거가 될 수 있지만, 예산을 정당화하는 것은 실제 복구 시간 로그뿐입니다.

공급사별 추가 항목을 포함하면 최저선도 달라집니다.

  • OpenAI 작업에서 과금 대상 컴퓨터 툴 호출이 20회 발생하면 현재 1,000회당 $2.50인 요금으로 실행기 호스팅 전 $0.05가 추가됩니다.
  • Claude의 기본 Opus 5 컴퓨터 툴셋은 캐시되지 않은 요청에 약 입력 토큰 4,520개를 더합니다. 기본 입력 요금으로 $0.0226입니다. 브라우저 툴셋의 약 6,610개 토큰$0.03305에 해당합니다. 프롬프트 캐싱으로 반복 오버헤드를 낮출 수 있지만, 모든 턴이 캐시에 적중한다고 가정하지 말고 계측 사용량을 확인해야 합니다.
  • Gemini Computer Use에는 선택한 모델의 일반 토큰 요금이 적용되며 출력 토큰과 사고 토큰도 포함됩니다. 숙고가 길어지면 단순한 출력 토큰 5,000개 기준보다 출력 비용 비중이 커질 수 있습니다.
  • DeepSeek는 이미지 1장당 입력 토큰을 384개로 제한합니다. 하지만 커스텀 액션 스키마, 실행기 응답, 재시도, 안전 검사는 이 이미지 비용과 별개로 돈과 엔지니어링 시간을 소모합니다.

화면을 조작할 필요가 없는 모델의 가격 분기는 가장 저렴한 AI API 비교에서 더 폭넓게 다룹니다. 컴퓨터 사용은 별도 예산으로 봐야 합니다. 턴이 이어질수록 스크린샷, 상태 전환, 복구가 누적되기 때문입니다.

1. GPT-5.6 Sol: 실패 복구 비용이 클 때 가장 좋은 종합 선택

GPT-5.6 Sol은 OpenAI의 최상위 멀티모달 모델입니다. 컴퓨터 사용 실패를 복구하는 비용이 유의미할 때 가장 먼저 검토할 만한 종합 선택이기도 합니다. gpt-5.6 별칭은 Sol로 라우팅되며, 모델은 이미지 입력과 1,050,000토큰 컨텍스트 윈도우를 지원하고 Responses API의 최신 computer 툴을 사용할 수 있습니다.

GPT-5.6용 OpenAI 컴퓨터 사용 문서
GPT-5.6 Sol 컴퓨터 사용

OpenAI가 공개한 OSWorld 2.0 결과는 Sol 62.6%, Terra 50.2%, Luna **45.6%**입니다. OSWorld는 에이전트가 데스크톱 소프트웨어를 조작하는 능력을 측정하므로 일반 채팅 벤치마크보다 이 구매 결정에 가깝습니다. 그래도 OpenAI의 평가 환경에서 나온 결과입니다. Sol을 파일럿에 넣을 근거로 활용하되, 자체 검수 테스트를 생략할 허가로 받아들여서는 안 됩니다.

Sol이 잘하는 일

OpenAI의 최신 통합 방식에서 실용적인 장점은 유연성입니다. 모델은 스크린샷을 살펴보고 내장 툴을 통해 컴퓨터 액션을 반환할 수 있고, 커스텀 툴 및 코드 실행 하네스와 함께 작동할 수도 있습니다. 기술팀은 Playwright 브라우저로 시작해, 워크플로가 네이티브 데스크톱 앱으로 이어질 때 전체 가상 머신으로 확장할 수 있습니다.

최신 가이드는 안전 계층에도 적절한 우선순위를 둡니다. 격리된 브라우저 또는 VM, 상속된 환경이 비어 있는 상태, 가능하면 확장 프로그램과 로컬 파일 시스템 접근을 끄는 구성, 결과를 초래하는 액션에 대한 명시적 승인을 권장합니다. 화면의 콘텐츠가 프롬프트 인젝션처럼 보이면 에이전트가 멈추도록 지시합니다. 이는 자동 보호 장치가 아니라 구현 지침이지만, 파일럿을 더 안전한 기본값으로 이끕니다.

가장 잘 맞는 용도는 인터페이스가 복잡하지만 되돌릴 수 있고 가치가 높은 워크플로입니다. 예를 들어 중견기업 재무팀이 웹 포털 세 곳에서 데이터를 수집해 원본 레코드와 대조하고, 승인을 받을 입력 항목을 준비한다고 가정해 봅니다. 상태 추적과 복구 능력이 조금만 좋아져도 운영자의 정리 시간이 줄어든다면 Sol의 프리미엄은 충분히 타당합니다. 반대로 컨트롤 위치가 늘 같고 API로 데이터를 보낼 수 있는 단순 양식에는 설득력이 떨어집니다.

OpenAI 가격표

컴퓨터 사용을 지원하는 최신 GPT-5.6 티어는 세 가지입니다.

  • GPT-5.6 Sol: 입력 토큰 100만 개당 $5.00, 캐시된 입력 토큰 100만 개당 $0.50, 출력 토큰 100만 개당 $30.00입니다.
  • GPT-5.6 Terra: 입력 토큰 100만 개당 $2.00, 캐시된 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $12.00입니다.
  • GPT-5.6 Luna: 입력 토큰 100만 개당 $0.20, 캐시된 입력 토큰 100만 개당 $0.02, 출력 토큰 100만 개당 $1.20입니다.

컴퓨터 툴에는 과금 대상 툴 호출 1,000회당 $2.50가 추가될 수 있으며, 내장 툴이 소비한 토큰에는 선택한 모델의 요금이 적용됩니다. Sol에는 지원되는 API Free 티어가 없습니다.

이 제품군은 실용적인 라우팅 사다리를 제공합니다. 먼저 Sol로 품질 상한선을 확인한 뒤, 검수를 통과한 같은 작업 세트를 Terra에서 다시 실행합니다. 완료율과 검수 지표가 기준 안에 들어오는 작업 유형만 Terra로 옮깁니다. Luna는 훨씬 저렴하지만 공급사가 공개한 OSWorld 결과도 더 낮습니다. 검수 기준이 입증된 뒤 범위가 명확하고 되돌릴 수 있는 작업에 투입해야 하며, 입력 토큰이 Sol보다 훨씬 싸다는 이유만으로 기본 모델로 삼아서는 안 됩니다.

안전한 Sol 파일럿 설계

  1. 범위가 명확한 워크플로 하나를 고릅니다

    시작 상태가 분명하고, 완료 여부를 결정론적으로 검사할 수 있으며, 승인 전에는 되돌릴 수 없는 액션이 없는 작업을 선택합니다. 브라우저 QA, 증거 수집, 검토용 레코드 준비가 좋은 후보입니다. 첫 평가에서는 구매, 삭제, 게시, 제출을 피합니다.

  2. 환경을 고정합니다

    격리된 브라우저 프로필, 컨테이너 또는 VM을 사용합니다. 상속된 환경 변수를 제거하고, 가능하면 확장 프로그램과 로컬 파일 시스템 접근을 비활성화합니다. 필요한 도메인만 허용 목록에 넣고 작업에 꼭 필요한 자격 증명만 노출합니다.

  3. 실행 전에 승인 규칙을 정의합니다

    메시지 전송, 약관 동의, 계정 데이터 변경, 금전적 약정처럼 반드시 사람의 승인이 필요한 액션을 적어 둡니다. 모델이 생성한 문장이 아니라 실행기가 중단을 강제해야 합니다.

  4. 상태와 검수 결과를 기록합니다

    초기 상태, 모든 스크린샷, 제안된 액션, 실행된 액션, 툴 결과, 안전 중단, 최종 상태, 검수 결과를 보관합니다. 모델의 마지막 메시지는 검수 기준이 아닙니다.

  5. Sol이 통과한 뒤에만 하위 모델로 라우팅합니다

    Sol로 달성 가능한 완료율과 검수 기준선을 확립합니다. 이후 같은 작업, 같은 환경, 같은 승인 규칙으로 Terra와 Luna를 비교합니다. 하위 모델에서 실패하는 작업 유형은 Sol로 에스컬레이션합니다.

가장 적합한 용도: 복구 실패의 비용이 큰 고가치 다단계 브라우저 또는 데스크톱 업무입니다.
두드러진 강점: OpenAI가 공개한 OSWorld 2.0 결과는 62.6%로, 현재 비교한 네 가지 경로 중 가장 높습니다.
가격: 입력/출력 토큰 100만 개당 Sol $5/$30, Terra $2/$12, Luna $0.20/$1.20이며 해당되는 툴 호출 요금이 별도로 붙습니다.
무료 체험: Sol에 지원되는 API Free 티어는 없습니다.

강점
잘하는 것
8 points

  • 비교한 네 가지 경로 중 공개된 컴퓨터 사용 벤치마크 결과가 가장 높습니다.
  • GPT-5.6 제품군 전체가 같은 Responses API 툴 형식을 사용하므로 품질과 비용에 따른 라우팅이 실용적입니다.
  • 최신 가이드는 격리 실행, 프롬프트 인젝션, 허용 목록, 결과를 초래하는 액션의 승인을 다룹니다.
  • 주변 하네스를 바꾸지 않고 Sol, Terra, Luna 사이에서 폭넓은 가격 사다리를 활용할 수 있습니다.
  • 이 비교에서 Sol의 정규화 모델 전용 작업 비용이 가장 높습니다.
  • 컴퓨터 툴 호출에 별도 사용 요금이 붙을 수 있습니다.
  • 브라우저나 VM, 액션 실행기, 검수 절차, 로그는 여전히 고객이 구축하거나 연결해야 합니다.
  • 공급사 벤치마크의 선두라는 사실만으로 비공개 애플리케이션에서의 신뢰성이 입증되지는 않습니다.

피해야 할 경우: 결정론적 API가 있거나, 작업 가치가 낮고 반복성이 매우 높거나, Terra·Luna·Gemini가 같은 검수 기준을 충족한다면 Sol을 기본 작업 모델로 쓰지 않는 편이 낫습니다. 일반 자동화가 더 안전하게 처리할 수 있는 고정 컨트롤을 클릭하는 데 최상위 모델 요금을 지불할 필요는 없습니다.

2. Claude Opus 5: 통제가 중요한 엔터프라이즈 데스크톱 업무에 최적

Claude Opus 5는 모델의 순수 성능만큼 컴퓨터 사용 제어 계층이 중요한 경우 가장 좋은 선택입니다. Anthropic은 2026년 8월 20일 새 브라우저 사용 툴과 함께 Claude API의 컴퓨터 사용을 GA로 전환했습니다. 최신 computer_toolset_20260801은 하나의 선언으로 클라이언트 측 툴 17개를 제공하며 beta 헤더가 필요하지 않습니다.

최신 컴퓨터 사용 툴셋을 설명하는 Claude Platform 문서
Claude Opus 5 컴퓨터 사용

컴퓨터 사용과 브라우저 사용의 차이는 실무에서 분명합니다. 컴퓨터 사용은 스크린샷을 바탕으로 마우스와 키보드 액션을 수행해 전체 데스크톱을 제어합니다. 브라우저 사용은 페이지 구조도 읽고 특정 페이지 요소에 액션을 실행하므로, 워크플로가 웹 애플리케이션 안에서 끝날 때 더 적합합니다. 필드나 버튼을 화면 좌표만으로 찾는 것보다 구조를 활용하는 편이 더 정확할 수 있습니다.

둘 다 클라이언트 측 실행 툴입니다. Claude가 직접 데스크톱에 연결하는 것은 아닙니다. 애플리케이션이 컨테이너, VM 또는 통제된 브라우저 안에서 각 액션을 실행하고, 결과를 반환한 뒤 모델을 다시 호출합니다. 현재 Claude Managed Agents에서는 컴퓨터 사용을 지원하지 않습니다. Anthropic이 전체 데스크톱 세션까지 호스팅해 줄 것으로 기대했다면 제품의 경계를 잘못 이해한 것입니다.

Claude가 거버넌스 선택으로 꼽히는 이유

Claude는 모델 한 턴에 여러 컴퓨터 액션을 반환할 수 있습니다. 실행기는 그 액션을 순서대로 수행하고 첫 실패에서 멈춥니다. 클릭하고 입력한 뒤 관찰하는 것처럼 안전한 순서에서는 반복적인 모델 왕복 호출을 줄일 수 있습니다. 그러나 상태를 살펴봐야 하는 구간까지 묶어 실행해서는 안 됩니다. 클릭으로 잘못된 계정이 열릴 가능성이 있다면, 입력하기 전에 에이전트가 결과를 확인해야 합니다.

Anthropic은 의심스러운 프롬프트 인젝션을 감지하고 다음 액션 전에 확인을 요청하도록 모델을 유도하는 스크린샷 분류기도 운영합니다. 고객은 지원팀에 연락해 이 기능을 해제할 수 있지만, 신뢰할 수 없는 페이지를 탐색하는 워크플로에는 기본값이 유용합니다. 이 분류기는 또 하나의 방어 계층일 뿐이며, 도메인 허용 목록, 자격 증명 경계, 실행기 수준 승인을 대신하지 않습니다.

데이터 처리 방식도 beta 시절보다 명확해졌습니다. 스크린샷, 액션, 파일의 저장은 클라이언트가 제어하며, Anthropic은 컴퓨터 사용이 제로 데이터 보존(ZDR) 대상이라고 밝힙니다. 또한 Anthropic의 BAA에 따라 HIPAA 규제 워크로드에도 사용할 수 있습니다. 이 적격성만으로 애플리케이션 전체가 규정을 준수하는 것은 아니지만, 헬스케어 조달 검토에서 모델 차원의 장애물 하나를 없앨 수 있습니다.

이 조합은 유용한 API가 없는 소프트웨어를 사용해야 하고 모든 액션의 증거가 필요한 보험금 청구, 보험, 금융, 운영 워크플로에 잘 맞습니다. Anthropic이 인용한 고객 Asteroid의 사례에서는 가장 긴 보험금 청구 워크플로가 32분에서 13분으로 줄고, 작업 비용이 약 30% 감소했으며, 프롬프트를 바꾸지 않고도 완료율이 **100%**에 도달했습니다. 이는 특정 고객이 보고한 결과이지 신규 도입에서 기대할 보편적 수치가 아닙니다. 그러나 측정할 가치가 있는 결과는 보여 줍니다. 루프 턴이 줄고 대상 지정이 정확해지면 모델 점수뿐 아니라 운영 비용까지 바뀔 수 있습니다.

Claude 멀티 액션 비용 심층 분석에서는 액션 묶음이 언제 비용을 줄이는지, 또 언제 액션 사이의 관찰이 반드시 필요한지 설명합니다.

Claude 가격표

최신 툴셋은 Sonnet 5, Opus 5, Fable 5, 제한적으로 제공되는 Mythos 5, Opus 4.8을 지원합니다. 현재 비교할 만한 모델 가격 사다리는 다음과 같습니다.

  • Claude Sonnet 5: 기본 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10입니다. 5분 캐시 쓰기는 $2.50, 1시간 캐시 쓰기는 $4, 캐시 적중은 토큰 100만 개당 $0.20입니다.
  • Claude Opus 5: 기본 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다. 5분 캐시 쓰기는 $6.25, 1시간 캐시 쓰기는 $10, 캐시 적중은 토큰 100만 개당 $0.50입니다.
  • Claude Fable 5 및 Claude Mythos 5: 기본 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. Mythos 5는 제한적으로 제공됩니다.
  • Opus 5 Fast mode: 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다.
  • Opus 5 Batch: 입력 토큰 100만 개당 $2.50, 출력 토큰 100만 개당 $12.50입니다. Batch는 비동기 모델 작업에 유용하지만, 대화형 컴퓨터 사용 루프는 여전히 순차적으로 관찰하고 액션을 수행해야 합니다.

신규 API 사용자에게는 금액이 명시되지 않은 소액의 무료 크레딧이 제공됩니다. Anthropic은 장기 체험이 필요한 엔터프라이즈 구매자에게 영업팀 문의를 안내합니다.

숨어 있는 비용은 툴 정의 오버헤드입니다. 기본 컴퓨터 툴셋은 요청 하나에 Opus 5 기준 입력 토큰 약 4,520개, Sonnet 5 기준 약 4,590개를 추가합니다. 줌 기능을 끄면 약 410개 토큰이 줄어듭니다. 브라우저 툴셋은 더 커서 Opus 5에 약 6,610개 토큰, Sonnet 5에 약 6,670개 토큰을 추가합니다. 선택형 브라우저 멤버 네 가지를 모두 활성화하면 약 880개 토큰이 더해집니다.

Opus 5 기본 입력 요금을 적용하면 캐시되지 않은 기본 컴퓨터 툴셋 한 번의 비용은 스크린샷, 작업 컨텍스트, 액션 결과, 출력이 들어가기 전부터 약 $0.0226입니다. 같은 기준에서 브라우저 툴셋은 약 $0.03305입니다. 짧은 작업에서는 제어 인터페이스를 선언하는 데 쓰는 비용이 실제 업무 데이터 비용보다 클 수 있습니다. 워크플로가 허용한다면 변하지 않는 지침과 툴 정의를 캐시하고, 쓰지 않는 멤버는 비활성화하며, 추정치가 아니라 응답에 기록된 사용량을 신뢰해야 합니다.

가장 적합한 용도: 명시적 제어, 감사 증거, 지원되는 마이그레이션 경로가 필요한 엔터프라이즈 브라우저·데스크톱 워크플로입니다.
두드러진 강점: 클라이언트 측 액션 17개, 순차적 액션 묶음, 페이지 구조를 인식하는 별도 브라우저 툴을 갖춘 GA 컴퓨터 사용입니다.
가격: 기본 입력/출력 토큰 100만 개당 Sonnet 5 $2/$10, Opus 5 $5/$25, Fable 5 또는 제한 제공 Mythos 5 $10/$50입니다.
무료 체험: 신규 사용자용 소액 API 크레딧은 금액이 명시되지 않았으며, 엔터프라이즈 평가는 영업팀에 문의해야 합니다.

강점
잘하는 것
9 points

  • Claude API의 컴퓨터 사용은 GA이며 최신 툴셋에 beta 헤더가 필요하지 않습니다.
  • 브라우저 사용은 웹 전용 워크플로에 페이지 구조를 더해 픽셀 좌표에만 의존하지 않게 합니다.
  • 자동 프롬프트 인젝션 확인, 고객이 제어하는 실행, ZDR 적격성은 실질적인 제어 설계를 뒷받침합니다.
  • 안전한 액션 묶음은 모델 턴 반복과 경과 시간을 줄일 수 있습니다.
  • Sonnet 5에서는 같은 최신 툴셋을 더 저렴하게 사용할 수 있습니다.
  • 컴퓨터 및 브라우저 툴 정의가 요청에 수천 개의 입력 토큰을 추가합니다.
  • Claude Managed Agents에서는 컴퓨터 사용을 지원하지 않습니다.
  • 샌드박스, 실행기, 자격 증명, 승인, 로그, 실패 복구는 여전히 애플리케이션의 책임입니다.
  • Claude 문서는 지연, 좌표 오류, 스크롤 실패, 특수하거나 여러 애플리케이션을 오갈 때의 신뢰성 저하를 경고합니다.

피해야 할 경우: 작업이 웹페이지 안에서 끝나고 브라우저 사용으로 충분하다면 전체 데스크톱 컴퓨터 사용을 피합니다. 안정적인 API가 있다면 둘 다 쓰지 않는 편이 낫습니다. 목표가 되돌릴 수 있는 UI 루프를 가장 싸게 운영하는 것뿐이라면 Gemini부터, 전체 액션 하네스를 이미 갖췄다면 모델 코어로 DeepSeek부터 가격을 비교합니다.

3. Gemini 3.7 Flash: 가성비가 가장 좋은 기본 제공 컴퓨터 사용

Gemini 3.7 Flash는 Google이 Computer Use용으로 권장하는 모델이며, 이 목록에서 공급사가 액션 루프를 정의한 경로 중 가성비가 가장 좋습니다. 모델 자체는 GA이고 1백만 토큰 컨텍스트 윈도우와 최대 출력 토큰 64,000개를 지원합니다. Computer Use는 여전히 Preview입니다.

브라우저·모바일·데스크톱 컴퓨터 사용을 설명하는 Google Gemini API 문서
Gemini 3.7 Flash Computer Use

Google은 브라우저, 모바일, 데스크톱의 세 가지 대상 환경을 지원합니다. 애플리케이션이 프롬프트, 환경, 스크린샷을 보내면 Gemini가 인터페이스 액션을 함수 호출로 반환합니다. 클라이언트는 좌표 배율을 맞추고 액션을 실행한 다음, 새 화면을 캡처해 다시 전송합니다. 안전한 VM 또는 컨테이너와 클라이언트 측 액션 핸들러는 여전히 필요하며, Google의 예제는 Playwright를 사용합니다.

Gemini 3.x에는 승인 계층에 특히 유용한 신호 두 가지가 추가됐습니다. 각 액션에는 모델이 그 액션을 선택한 이유를 짧게 설명하는 **의도(intent)**가 포함될 수 있습니다. 별도의 **안전 판단(safety decision)**은 액션을 허용하거나, 확인이 필요하다고 표시하거나, 차단할 수 있습니다. 의도가 액션의 정확성을 증명하지는 않지만, 클릭 좌표만 있는 것보다 정책 엔진과 검토자에게 더 많은 맥락을 제공합니다.

안전 시스템은 정책 카테고리별로 설정할 수 있고, 스크린샷 프롬프트 인젝션 감지는 선택형입니다. 따라서 자체 승인 경험을 구축하는 제품팀에 Gemini가 매력적인 선택이 됩니다. 애플리케이션은 제안된 액션, 모델 의도, 정책 판단, 현재 스크린샷을 한 화면에 보여 준 뒤 워크플로의 위험도에 따라 필요한 곳에서만 사람의 승인을 요청할 수 있습니다.

Gemini가 잘 맞는 영역

Gemini는 여러 환경을 오가며 되돌릴 수 있는 작업의 첫 파일럿으로 합리적입니다. 모바일 제품팀이라면 같은 모델 경로로 웹 브라우저와 모바일 빌드의 회원 가입 흐름을 실행하고, 스크린샷을 수집하며, 사용자 여정이 갈라지는 지점을 표시할 수 있습니다. 지원 운영팀이라면 승인된 사이트에서 공개 정보를 수집하고, 최종 제출 버튼을 누르지 않은 채 레코드를 준비하는 데 사용할 수 있습니다.

정규화한 토큰 구성에서 Gemini의 현재 Standard Paid 비용 최저선은 작업당 $0.05625, 즉 1,000건당 $56.25입니다. DeepSeek 피크 요금보다 작업당 $0.02765 비쌉니다. 시간당 $60을 적용하면 Gemini가 엔지니어링 또는 검수 시간을 1.659초만 줄여도 모델 프리미엄을 상쇄합니다. 정의된 액션 스키마와 안전 판단, 커스텀 어댑터를 만들지 않아도 된다는 이점만으로도 이 기준은 빠르게 넘을 수 있습니다.

주의할 점은 세부 약관이 아니라 제품 상태입니다. Google은 Computer Use에 오류와 보안 취약점이 있을 수 있다고 밝히며, 면밀한 감독 없이 중요한 결정이나 민감한 데이터, 심각하고 되돌릴 수 없는 액션에 사용하지 말라고 권고합니다. GA 모델을 쓴다고 Preview 툴까지 GA가 되는 것은 아닙니다. 조달, 위험 검토, 출시 범위에는 툴의 상태를 적용해야 합니다.

Gemini 가격표

Google은 Gemini 3.7 Flash에 네 가지 처리 모드를 제공합니다. 2026년 12월 31일까지 요금은 다음과 같습니다.

  • Standard: 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75, 캐시된 토큰 100만 개당 $0.075입니다.
  • Batch: 입력 토큰 100만 개당 $0.375, 출력 토큰 100만 개당 $1.875, 캐시된 토큰 100만 개당 $0.0375입니다.
  • Flex: 입력 토큰 100만 개당 $0.375, 출력 토큰 100만 개당 $1.875, 캐시된 토큰 100만 개당 $0.0375입니다.
  • Priority: 입력 토큰 100만 개당 $1.35, 출력 토큰 100만 개당 $6.75, 캐시된 토큰 100만 개당 $0.135입니다.

2027년 1월 1일부터 Standard는 $1.50/$7.50, 캐시된 입력은 $0.15가 됩니다. Batch와 Flex는 $0.75/$3.75, 캐시된 입력은 $0.075로 바뀝니다. Priority는 $2.70/$13.50, 캐시된 입력은 $0.27이 됩니다.

모델의 Standard Free 티어는 입력과 출력 토큰을 무료로 제공하지만, Computer Use는 Free 티어에서 사용할 수 없습니다. Paid의 Computer Use에는 Google의 일반 모델 토큰 요금이 적용됩니다. 이 차이는 모든 체험 계획에 반영해야 합니다. AI Studio에서 기본 모델을 시험하는 것은 컴퓨터 사용 루프를 무료로 프로덕션 테스트하는 것과 다릅니다.

대화형 에이전트라면 Batch가 암시하는 비동기 비용보다 Standard 또는 Priority가 더 중요할 가능성이 큽니다. Flex는 서비스 동작이 루프에 맞는다면 예약 가능한 작업에 매력적일 수 있습니다. 업무에 필요한 종단 간 상호작용 방식과 지연 시간을 확인하지 않고 가장 싼 모드를 사업성 검토에 그대로 넣어서는 안 됩니다.

가장 적합한 용도: 낮은 토큰 가격으로 기본 액션 스키마가 필요한 가역적 브라우저·모바일·데스크톱 자동화입니다.
두드러진 강점: 세 가지 환경에서 하나의 권장 모델을 쓰면서 액션 의도, 설정 가능한 안전 정책, 확인 판단, 선택형 프롬프트 인젝션 감지를 활용할 수 있습니다.
가격: 2026년 12월 31일까지 입력/출력 토큰 100만 개당 Standard $0.75/$3.75, Batch 및 Flex $0.375/$1.875, Priority $1.35/$6.75입니다.
무료 체험: 모델에는 Free 티어가 있지만 Computer Use는 Paid 전용입니다.

강점
잘하는 것
8 points

  • 공급사가 컴퓨터 사용 툴을 정의한 세 경로 중 현재 토큰 가격이 가장 낮습니다.
  • 브라우저, 모바일, 데스크톱 지원은 제품 QA와 여러 화면을 오가는 워크플로에 적합합니다.
  • 액션 의도와 안전 판단 덕분에 승인 및 감사 인터페이스를 더 쉽게 설계할 수 있습니다.
  • 가격 페이지상 Paid Computer Use에는 별도 호출 요금 없이 일반 모델 토큰 요금만 적용됩니다.
  • Gemini 3.7 Flash는 GA지만 Computer Use는 여전히 Preview입니다.
  • Google은 면밀한 감독 없이 민감하거나 중요하거나 되돌릴 수 없는 작업에 쓰지 말라고 명시적으로 경고합니다.
  • 낮은 출시 기념 가격은 2026년 말에 종료됩니다.
  • 스크린샷 프롬프트 인젝션 감지는 직접 활성화해야 하며, 실행기와 샌드박스도 고객이 제공합니다.

피해야 할 경우: Preview 위험을 받아들일 수 없는 규제 대상 또는 되돌릴 수 없는 프로덕션 워크플로에는 Gemini Computer Use를 사용하지 않는 편이 낫습니다. 브라우저만으로 부족하고 대상 데스크톱 환경을 격리할 수 없을 때도 피해야 합니다. 품질 실패가 운영자 시간을 조금이라도 많이 소모한다면 토큰 비용부터 최적화하기 전에 Sol과 Claude를 비교하십시오.

4. DeepSeek V4-Flash-Vision-Exp: 비용 우선 커스텀 하네스에 최적

DeepSeek V4-Flash-Vision-Exp는 이 순위에서 가장 저렴한 모델 코어이자 가장 불완전한 컴퓨터 사용 제품입니다. DeepSeek는 2026년 8월 21일 정확한 API 식별자 deepseek-v4-flash-vision-exp로 이 실험적 멀티모달 모델을 출시했습니다.

이미지 입력과 제한을 보여 주는 DeepSeek V4 Flash Vision Exp API 문서
DeepSeek V4-Flash-Vision-Exp 비전 API

이 모델은 텍스트와 이미지 입력, 범용 툴 호출을 지원합니다. OpenAI 호환 Chat Completions 및 Responses API와 Anthropic 호환 인터페이스에서도 작동합니다. 컨텍스트 윈도우는 1백만 토큰, 최대 출력은 384,000토큰이며 사고·비사고 모드를 제공하고 명시된 동시 실행 한도는 2,500입니다.

컴퓨터 사용 에이전트를 만드는 데 유용한 재료이지만, 공급사가 제공하는 컴퓨터 액션 툴은 아닙니다. DeepSeek는 스크린샷을 보내고 범용 툴을 호출하는 방법을 문서화했지만, 기본 제공 브라우저·데스크톱 액션 스키마, 실행기, 승인 판단, 운영 환경은 문서화하지 않았습니다. 이를 모델 코어라고 부르는 것은 그 제품 경계에 근거한 편집상 해석입니다.

실제로는 팀이 클릭, 입력, 스크롤, 스크린샷, 대기, 승인 요청 같은 툴을 직접 정의해야 합니다. 인수를 검증하고 좌표를 매핑하며, 격리된 브라우저나 VM에서 액션을 실행하고, 새 상태를 반환해야 합니다. 루프를 탐지하고 오류에서 멈추며 모든 과정을 기록하는 일도 맡아야 합니다. 성숙한 자동화 팀에는 이런 제어권이 장점일 수 있습니다. 첫 컴퓨터 사용 에이전트를 구매하는 팀이라면 애플리케이션 개발로 계산해야 합니다.

주목할 만한 가격인 이유

DeepSeek는 V4-Flash-Vision-Exp에 Flash 경로와 같은 피크·오프피크 요금제를 적용합니다.

  • 오프피크: 캐시 적중 입력 토큰 100만 개당 $0.007, 캐시 미스 입력 토큰 100만 개당 $0.22, 출력 토큰 100만 개당 $0.66입니다.
  • 피크: 캐시 적중 입력 토큰 100만 개당 $0.014, 캐시 미스 입력 토큰 100만 개당 $0.44, 출력 토큰 100만 개당 $1.32입니다.

피크 시간은 01:00~04:00 UTC06:00~10:00 UTC입니다. 그 밖의 시간은 모두 오프피크입니다. 2026년 8월 23일 베이징 시간부터는 베이징 시간 기준 토요일과 일요일 내내 오프피크 요금이 적용됩니다.

가격 페이지에는 무료 티어나 체험이 안내되어 있지 않습니다. 그래도 실제 평가 비용은 매우 작습니다. 입력 토큰 50,000개와 출력 토큰 5,000개로 정규화한 구성에서 모델 비용은 오프피크 $0.0143, 피크 $0.0286입니다. 토큰이 핵심 비용 항목이 되기 전까지 상당한 규모로 실험할 수 있습니다. 그렇다고 개발, 검수, 잘못된 액션까지 싸지는 것은 아닙니다.

비전 토큰 규칙은 이례적으로 명확합니다. 큰 이미지는 대략 800×800픽셀 예산에 맞춰 크기가 조정되며 이미지 1장당 입력 토큰 384개로 제한됩니다. 피크 캐시 미스 요금에서 최대 토큰 스크린샷 100장의 이미지 입력 비용은 $0.016896 이하입니다. 오프피크에는 $0.008448입니다. 텍스트, 출력, 반복되는 이력, 범용 툴 호출, 재시도는 이 계산에 포함되지 않습니다.

이 제한은 비용상 장점인 동시에 인식의 한계입니다. 촘촘한 스프레드시트, 작은 대화 상자, 여러 열로 구성된 대시보드는 모델의 이미지 예산에 맞게 압축될 때 중요한 세부 정보가 사라질 수 있습니다. 필요한 부분을 잘라 보내거나 문서화된 original 상세 경로를 사용한 뒤, 서비스가 이미지 크기를 어떻게 바꾸는지 검증해야 합니다. 이미지 토큰이 싸다고 작은 글자를 정확히 읽는 것은 아닙니다.

DeepSeek는 JPEG, PNG, GIF, WebP를 지원합니다. base64 데이터, 공개 URL 또는 Files API 참조로 이미지를 보낼 수 있습니다. 요청당 이미지는 최대 600장, 한 변의 길이는 최대 8,192픽셀입니다. 이미지가 15장 이상이면 한 변당 최대 4,096픽셀입니다. base64 및 URL 이미지는 최대 32 MiB, Files API 이미지는 최대 64 MiB, 인라인 요청 본문은 최대 48 MiB까지 허용됩니다.

이 상한은 일반적인 스크린샷 루프보다 훨씬 높으므로 실제 병목은 업로드 장수가 아니라 커스텀 제어 계층입니다. 팀은 액션 스키마, 좌표 매핑, 승인, 복구 로직이 검수를 통과하는 결과를 만든다는 사실을 입증해야 합니다. 모델이 버튼을 볼 수 있다는 이유만으로 누를 권한까지 얻는 것은 아닙니다.

화면 조작을 넘어 두 공급사를 폭넓게 비교하려면 DeepSeek와 ChatGPT 비교를 참고하십시오.

가장 적합한 용도: 자체 브라우저·데스크톱 하네스 안에서 저비용 비전 코어를 쓰려는 숙련된 에이전트 팀입니다.
두드러진 강점: 이미지당 최대 입력 토큰 384개, 캐시 미스 입력/출력 기준 오프피크 $0.22/$0.66 요금입니다.
가격: 캐시 미스 입력/출력 토큰 100만 개당 오프피크 $0.22/$0.66, 피크 $0.44/$1.32입니다. 캐시 적중은 오프피크 $0.007, 피크 $0.014입니다.
무료 체험: 현재 가격 페이지에 안내된 무료 티어나 체험은 없습니다.

강점
잘하는 것
10 points

  • 비교한 네 가지 경로 중 정규화한 모델 토큰 비용이 가장 낮습니다.
  • OpenAI 호환, Responses API, Anthropic 호환 요청 형식 덕분에 모델 어댑터 작업을 줄일 수 있습니다.
  • 범용 툴 호출로 숙련된 팀이 자체 액션 어휘와 정책 경계를 정의할 수 있습니다.
  • 예측 가능한 이미지당 384토큰 상한 덕분에 스크린샷 입력 비용을 쉽게 제한할 수 있습니다.
  • 큰 컨텍스트, 출력, 동시 실행, 이미지 수 한도는 복잡한 커스텀 워크플로를 수용할 여지를 줍니다.
  • 실험적 모델이라는 상태는 변경 가능성과 프로덕션 위험에 대한 의문을 낳습니다.
  • 문서화된 기본 제공 컴퓨터 사용 액션 툴, 실행기, 안전 판단, 승인 계층이 없습니다.
  • 자동 이미지 크기 조정 과정에서 인터페이스의 작은 세부 정보가 사라질 수 있습니다.
  • 피크·오프피크 일정 때문에 대기열에 넣을 수 없는 트래픽의 비용 예측이 복잡합니다.
  • 낮은 토큰 비용이 훨씬 큰 엔지니어링·평가·검수 비용을 가릴 수 있습니다.

피해야 할 경우: 완성된 액션 루프를 기대하거나, 공급사가 정의한 안전 판단이 필요하거나, 격리된 실행기와 평가 시스템이 없다면 DeepSeek를 피해야 합니다. 작은 글자나 정보가 빽빽한 화면도 대표적인 시각 테스트에서 집중 스크린샷이 통과하기 전에는 사용하지 않는 편이 낫습니다.

상황별로 어떤 모델을 선택해야 할까?

되돌릴 수 있는 경쟁사 조사를 자동화하려는 투자를 유치한 창업자라면 Gemini 3.7 Flash부터 시작하는 편이 좋습니다. 액션 루프를 제공하고 브라우저와 데스크톱 환경을 지원하며, 광범위한 평가를 돌리기에 모델 비용도 충분히 낮습니다. 검수와 실패한 루프 복구에 드는 시간이 앞서 설명한 약 22초 프리미엄 기준을 넘으면 Sol로 선택이 바뀝니다. 신뢰할 수 없는 웹 콘텐츠와 승인 설계가 더 어려운 문제가 되면 Claude가 맞습니다.

규제 대상 또는 레거시 애플리케이션에서 데이터를 옮기는 중견기업 CTO라면 Claude Opus 5 또는 Sonnet 5부터 검토해야 합니다. Claude API의 컴퓨터 사용은 GA이고, 스크린샷 분류기가 확인을 요청할 수 있으며, 클라이언트가 환경을 제어하고, 기능은 ZDR 대상입니다. BAA에 따른 HIPAA 적격성은 모델 검토에 중요하지만, 워크플로에는 여전히 최소 권한 자격 증명, 보호되는 로그, 제출 전 사람의 승인이 필요합니다. 모든 단계가 웹페이지 안에서 끝난다면 전체 컴퓨터 사용 대신 브라우저 사용을 선택합니다.

가치가 높고 복잡한 데스크톱 워크플로를 자동화하는 숙련 운영자라면 GPT-5.6 Sol부터 시작해야 합니다. 공급사가 공개한 Sol의 OSWorld 선두 결과와 작은 인건비 손익분기점은 품질 상한선에 먼저 비용을 지불할 이유가 됩니다. 검수 기준을 확립한 뒤 안정적인 작업 유형을 Terra, Luna 또는 Gemini로 라우팅합니다. 가장 싼 티어부터 시작해 더 강한 모델이 복구 시간을 얼마나 줄이는지 끝내 확인하지 않는 것이 잘못된 접근입니다.

액션 실행기, 정책 서비스, 평가 제품군을 이미 보유한 기술 빌더라면 DeepSeek V4-Flash-Vision-Exp를 후보에 포함해야 합니다. 이 정도로 성숙한 팀이라면 커스텀 액션 스키마가 새 프로젝트가 아니며, 오프피크 요금은 대규모 평가와 배치 워크로드의 비용 구조를 바꿀 수 있습니다. 글자가 작은 화면, 모호한 상태, 반복되는 실패에는 더 강한 경로를 남겨 둡니다.

선택을 뒤집는 질문은 네 가지입니다.

  1. 안정적인 API가 있습니까? 그렇다면 API를 사용합니다. 화면 제어는 신뢰할 수 있는 프로그래밍 경로가 없는 인터페이스를 위한 차선책입니다.
  2. 잘못된 액션을 되돌릴 수 있습니까? 그렇지 않다면 승인을 의무화하고, 결과에 맞는 제품 상태·제어·조달 조건을 갖춘 경로를 우선합니다.
  3. 실행기를 이미 보유하고 있습니까? 없다면 DeepSeek의 토큰 절감으로 완성된 솔루션을 살 수는 없습니다.
  4. 프리미엄 모델이 검수 시간을 몇 초 줄입니까? 검수를 통과한 작업 로그로 Sol, Claude, Gemini, DeepSeek 중 하나를 선택합니다. 요금표만 보고 결정해서는 안 됩니다.

이 멀티모달 AI 모델을 선정한 기준

이 순위에는 구매 결정과 직결되는 다섯 가지 기준을 적용했습니다.

  • 컴퓨터 사용의 완성도: 공급사가 액션 루프까지 정의합니까, 아니면 비전과 범용 툴 호출만 제공합니까?
  • 최신 근거: 현재 확인할 수 있는 관련 컴퓨터 사용 결과, 제품 상태 또는 구현 세부 정보가 있습니까?
  • 검수 통과 작업의 경제성: 공통 토큰 구성의 비용은 얼마이며, 프리미엄 경로가 사람의 시간을 얼마나 줄여야 합니까?
  • 프로덕션 장벽: 샌드박스, 실행기 작업, 승인, 프롬프트 인젝션 방어, 로깅 중 구매자에게 남는 것은 무엇입니까?
  • 가격의 지속성: 표준 가격입니까, 기간 한정입니까, 피크 시간제입니까, 아니면 Preview 기능에 붙은 가격입니까?

제품은 2026년 8월 22일 기준 실시간 문서, 가격 페이지, 모델 페이지, 공급사가 이름을 공개한 고객 사례를 바탕으로 비교했습니다. 이번 작업에서 동일한 브라우저 하네스로 직접 실행하지 않았으므로 이 페이지는 테스트 결과를 주장하지 않습니다. 비용 모델은 확정된 요금표를 바탕으로 한 독자적인 분석입니다. 아래의 240회 실행 프로토콜로 구매자별 워크플로에 맞는 근거를 만들 수 있습니다.

네 가지 경로만 다룬 이유는 각각 최대 신뢰성, 통제되는 엔터프라이즈 운영, 저비용 탄력성, 커스텀 스택 경제성이라는 서로 다른 구매 결정을 대표하기 때문입니다. 포함된 경로마다 현재의 차별점, 가격표, 구현 경로, 숨기지 않은 한계가 있습니다. 구형 모델은 마이그레이션 과정에서 구매자가 마주칠 수 있는 경우에만 아래에서 언급합니다.

제휴 관계는 이 순위에 영향을 주지 않았으며, 관련 없는 상업 파트너를 끼워 넣지 않았습니다. 상업적 이용 가능 여부도 모델 순위를 올리거나 내리는 요소로 사용하지 않았습니다.

피해야 할 선택

새 통합에 OpenAI computer-use-preview를 사용하지 마십시오

OpenAI의 최신 GA 요청 형식은 GPT-5.5 이상 모델에 tools: [{ type: "computer" }]를 사용합니다. 구형 computer-use-preview 모델과 computer_use_preview 툴은 액션 형식이 다르고 레거시 요청 설정도 필요합니다. 기존 애플리케이션을 마이그레이션하는 동안에만 유지하십시오. 새 시스템을 레거시 경로에서 시작하면 어차피 교체해야 할 작업을 스스로 만드는 셈입니다.

3.7을 쓸 수 있다면 Gemini 2.5 Computer Use Preview를 피하십시오

Google은 Gemini 2.5 Computer Use Preview를 레거시 모델로 표시합니다. 프롬프트 토큰이 200,000개 이하일 때 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $10이며, 200,000개를 넘으면 $2.50/$15로 오릅니다. Google이 컴퓨터 사용에 권장하는 모델은 Gemini 3.7 Flash이며, 2026년 12월 31일까지 $0.75/$3.75입니다. 직접 측정한 호환성 의존성을 아직 없앨 수 없을 때만 2.5를 유지합니다.

비전 프록시로 위장한 텍스트 전용 DeepSeek 경로를 피하십시오

공식 DeepSeek API에서 이미지를 받는 모델은 deepseek-v4-flash-vision-exp뿐입니다. 다른 DeepSeek 모델에 이미지를 입력하면 400 오류가 반환됩니다. 제3자 어댑터가 다른 모델에 스크린샷 설명을 요청하고 그 텍스트를 DeepSeek에 넘길 수는 있지만, 이 경우 평가 대상은 DeepSeek의 시각적 컴퓨터 사용이 아니라 두 모델로 구성된 스택입니다. 가격, 지연 시간, 정보 손실, 데이터 처리 방식이 모두 달라집니다. 프록시를 별도 구성 요소로 명시하거나 정확한 비전 모델을 사용해야 합니다.

검수 절차가 없는 화면 에이전트는 모두 피하십시오

‘모델이 마지막 단계에 도달했다’는 것은 비즈니스 성과가 아닙니다. 브라우저 에이전트가 잘못된 계정으로 들어가거나, 잘못된 필드에 입력하거나, 페이지가 바뀐 뒤 실패를 알아채지 못한 채 멈출 수 있습니다. 결정론적 검사나 사전에 정한 검토 기준이 없다면 어떤 모델을 쓰더라도 자율 실행할 준비가 되지 않은 작업입니다.

모델 이름보다 중요한 프로덕션 체크리스트

모델은 통제된 시스템을 구성하는 하나의 부품입니다. 사용량을 늘리기 전 프로덕션 검토에서 다음 질문에 답할 수 있어야 합니다.

  • 환경: 브라우저 또는 데스크톱이 호스트, 개인 계정, 로컬 파일, 관련 없는 자격 증명으로부터 격리되어 있습니까?
  • 접근 범위: 도메인, 애플리케이션, 허용된 액션이 워크플로 범위로 제한되어 있습니까?
  • 시크릿: 각 작업에 꼭 필요한 범위의 자격 증명만 제공되며, 스크린샷이나 로그에 시크릿이 노출되지 않습니까?
  • 결과: 항상 사람의 확인이 필요한 액션은 무엇이며 실행기가 그 규칙을 강제합니까?
  • 인젝션: 페이지, 이미지, 문서, 대화 상자가 에이전트에게 원래 작업을 무시하라고 지시하면 어떻게 처리합니까?
  • 상태: 액션 전에 시스템이 어떤 계정, 레코드, 창, 단계에서 작업하는지 입증할 수 있습니까?
  • 복구: 액션이 실패하면 묶음 실행을 멈추고 증거를 보존하며, 안전하게 재시도하거나 에스컬레이션할 수 있는 충분한 상태를 반환합니까?
  • 검수: 어떤 기계 검사 또는 검토자 판단으로 작업 완료를 확정합니까?
  • 경제성: 검수를 통과한 완료 건마다 모델 토큰, 툴 호출, 런타임, 재시도, 검수 시간이 기록됩니까?
  • 변경: 모델 스냅샷, 가격, 브라우저, 대상 UI가 바뀐 뒤 같은 작업 세트를 재실행할 수 있습니까?

모델 교체는 지루할 만큼 단순해야 합니다. 액션 인터페이스, 안전 정책, 로그, 검수 절차는 그대로 두고 뒤쪽의 모델만 바뀌어야 합니다. 공급사를 바꿀 때마다 제어 계층 전체를 다시 작성해야 한다면, 시스템이 한 공급사의 툴 형식을 제품 아키텍처로 착각한 것입니다.

월요일에 할 일: AI 에이전트 240회 비교 테스트

범위가 넓은 ‘AI 에이전트 파일럿’을 잡지 마십시오. 다음 주에 작업 유형 하나를 골라 라우팅 결정 하나만 내립니다. 대표 작업 20개, 이 순위의 네 가지 경로, 경로당 3회 시도를 사용하면 총 240회 실행하게 됩니다. 세 번 반복하면 일회성 운이 어느 정도 드러나면서도, 이 표본이 보편적 벤치마크인 것처럼 과장하지 않을 수 있습니다.

  1. 월요일: 작업과 검수 기준을 고정합니다

    하나의 워크플로에서 정상 사례, 글자가 작은 화면 상태, 팝업, 모호한 컨트롤, 안전한 프롬프트 인젝션 시험 항목 하나를 포함해 작업 20개를 선택합니다. 되돌릴 수 없는 최종 액션은 제거합니다. 정확한 통과 조건과 검토가 필요한 상황을 적습니다.

  2. 화요일: 환경을 동일하게 유지합니다

    모든 경로에 같은 뷰포트, 브라우저 또는 VM 이미지, 도메인 허용 목록, 초기 상태, 자격 증명 범위, 액션 어휘, 제한 시간, 승인 정책을 적용합니다. DeepSeek에서는 커스텀 툴을 기본 제공 경로와 같은 실행기 액션에 매핑합니다.

  3. 수요일: 전체 실행 비용을 수집합니다

    계측 입력, 캐시된 입력, 출력, 과금 대상 툴 호출, 실행기 런타임, 경과 시간, 시도 횟수, 안전 중단, 사람의 검수 시간을 기록합니다. 최초 실패 상태와 검수를 통과한 최종 증거도 보관합니다.

  4. 목요일: 검수 통과 완료 건의 가격을 계산합니다

    모델 비용, 툴 요금, 실행기 비용, 합의한 시급을 적용한 검토자 인건비, 재시도 비용을 합산합니다. 이를 검수를 통과한 완료 건수로 나눕니다. 수정 없이 통과, 복구 후 통과, 안전하게 거부, 안전하지 않게 실패한 비율도 함께 보고합니다.

  5. 금요일: 한 가지 작업을 라우팅하고 에스컬레이션을 남겨 둡니다

    검수 및 안전 기준을 충족하는 가장 저렴한 경로를 선택합니다. 반복 액션, 불확실한 상태, 의심스러운 인젝션, 검증 실패, 큰 결과가 따르는 단계에는 더 강한 모델로 에스컬레이션할 수 있게 합니다. 결정을 재현할 수 있도록 모델 식별자와 가격 기준일을 기록합니다.

월요일에 할 일을 의도적으로 작게 잡은 이유가 있습니다. 측정된 작업 유형 하나는 방어 가능한 예산 항목을 만듭니다. 범위가 넓은 데모가 남기는 것은 스크린샷 모음뿐이며 라우팅 규칙은 없습니다.

자주 묻는 질문

컴퓨터 사용에 가장 좋은 AI는 무엇인가요?

실패 비용이 큰 작업에서는 GPT-5.6 Sol이 가장 좋은 출발점입니다. 공개된 OSWorld 2.0 결과 62.6%와 작은 인건비 손익분기점이 근거입니다. Claude Opus 5는 통제가 필요한 엔터프라이즈 경로, Gemini 3.7 Flash는 가성비 경로, DeepSeek V4-Flash-Vision-Exp는 액션 하네스를 이미 갖춘 팀에 적합합니다.

가장 좋은 멀티모달 AI 모델은 무엇인가요?

컴퓨터 사용에서 최고의 멀티모달 모델은 대상 인터페이스를 충분히 정확하게 보고, 필요한 액션·승인 계층과 연동되며, 검수를 통과한 완료 건당 비용을 최소화하는 모델입니다. 시각적 추론 능력만으로 안전한 실행기, 안전 정책, 완료 검사를 제공하지는 않습니다.

현재 가장 강력한 AI 모델은 무엇인가요?

모든 작업에 대해 이 주장을 뒷받침하는 단일 벤치마크는 없습니다. OpenAI는 GPT-5.6 Sol의 OSWorld 2.0 결과를 62.6%로 공개했고, Anthropic은 컴퓨터 사용에서 Opus 5의 강점을 내세우며, Google은 자사 툴에 Gemini 3.7 Flash를 권장합니다. 이런 공개 자료로 후보를 고른 뒤, 실제 워크플로 안에서 검수를 통과한 완료 건수, 복구 시간, 안전성을 기준으로 순위를 정해야 합니다.

비즈니스 오너를 위한 AI Tools Map을 내려받아 이 후보 목록을 일주일짜리 컴퓨터 사용 비교 테스트로 전환하십시오.

마지막 업데이트

2026년 9월 2일

카테고리AI

Google에서 이 사이트를 우선하기

Google 검색에서 omidsaffari.com을 선호 소스로 추가

omidsaffari.com을 선호 소스로 지정하면 Google이 Top Stories, AI Overviews, AI Mode에서 우선적으로 보여 줍니다.

AI의 다른 글

AI 글 전체 보기
뉴스레터

매주 일요일, 한 통의 편지. 뜨거운 의견이 아닌, 돌아가는 시스템.

AI 벤처 포트폴리오 운영에서 나오는 빌드 로그, 가동 중인 시스템, 현장 노트.

주간 발행. 스팸 없음. 언제든 해지 가능합니다.