GLM-5.2 리뷰(2026): Opus 절반 비용으로 Claude Code를 쓰는 오픈 웨이트 모델
GLM-5.2 리뷰에서 753B 오픈 웨이트 모델의 실제 가격과 코딩 벤치마크를 살펴봅니다. GLM-5.3 Flash 및 Claude Opus와 비교해 새 워크로드에 맞는 모델, 기존 GLM-5.2를 유지할 조건, 셀프 호스팅과 Coding Plan 비용까지 한눈에 정리했습니다.

이번 GLM-5.2 리뷰의 대상인 GLM-5.2는 여전히 753 billion 파라미터와 MIT 라이선스를 갖춘 오픈 웨이트 코딩 모델입니다. 다만 이제는 같은 제품군에서 가격 대비 성능이 가장 뛰어난 모델이 아닙니다. GLM-5.3 Flash의 현재 요금은 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.50입니다. 반면 Cloudflare의 GLM-5.2 엔드포인트는 각각 $1.40와 $4.40입니다. 여기에 네이티브 비전 기능과 Cloudflare 기준 1,048,576토큰 컨텍스트 창까지 추가됐습니다.
GLM-5.2 리뷰 결론
기존 배포 환경과의 호환성이 필요하거나 과거 평가 결과를 정확히 재현해야 하는 경우가 아니라면, GLM-5.2로 새로운 호스팅 워크로드를 시작할 이유는 없습니다. 비용에 민감한 에이전트와 멀티모달 작업에는 GLM-5.3 Flash가 더 나은 기본 선택입니다. 토큰 비용보다 최고 수준의 코딩 성능이 중요하다면 정식 GLM-5.3이 더 적합합니다. 현재 GLM-5.2의 가장 설득력 있는 용도는 안정적인 셀프 호스팅 기준 모델입니다.
이는 이 리뷰의 최초 결론보다 한층 분명한 권고입니다. GLM-5.2는 여전히 허용 범위가 넓은 웨이트, 긴 컨텍스트, 신뢰할 만한 코딩 성능을 두루 갖추고 있지만 Z.ai가 이미 후속 모델 2종을 내놓았습니다. 이제 선택지는 GLM-5.2와 비싼 폐쇄형 모델 사이가 아닙니다. 대체로 Flash와 정식 GLM-5.3 중에서 고르고, 마이그레이션 위험이 절감액보다 큰 경우에만 GLM-5.2를 유지하는 구도가 됐습니다.

2026년 8월 30일부터 Cloudflare AI Search는 GLM-5.3 Flash를 지원합니다. 네이티브 Workers AI 생성 모델로서 @cf/zai-org/glm-5.3-flash 별칭과 1,048,576토큰 컨텍스트 창을 사용합니다. 따라서 Flash는 Z.ai나 코딩 플랜뿐 아니라 관리형 검색·생성 스택 안에서도 쓸 수 있습니다. 설정 방식과 비용에 미치는 영향은 Cloudflare AI Search와 GLM-5.3 Flash 해설에서 자세히 다룹니다.
이미 GLM-5.2를 셀프 호스팅하고 있다면 새 버전이 나왔다는 이유만으로 옮길 필요는 없습니다. 하지만 새로운 호스팅 배포라면 가격 차이를 외면하기 어렵습니다. Flash의 정가 기준 출력 요금은 88.6% 낮고, GLM-5.2가 네이티브로 받지 못하는 이미지·비디오·파일도 처리합니다.
GLM-5.2는 어떤 모델인가?
Z.ai는 2026년 6월 16일, 장시간 엔지니어링 작업을 겨냥한 모델로 GLM-5.2를 공개했습니다. 공식 모델 카드에 따르면 753 billion 파라미터를 갖췄고 텍스트를 입력·출력하며, 웨이트가 공개되어 있습니다. 로컬 배포 프레임워크로는 SGLang, vLLM, KTransformers, xLLM, Transformers가 제시됩니다. Z.ai가 직접 제공하는 모델은 1 million 토큰 컨텍스트와 최대 128K 출력 토큰을 지원합니다. Cloudflare의 호스팅형 GLM-5.2 엔드포인트는 조건이 달라 컨텍스트가 262,144토큰으로 제한됩니다.
초기 출시 때 주목받은 아키텍처 기능은 IndexShare입니다. Z.ai의 GLM-5.2 출시 페이지에 따르면 경량 인덱서 하나를 sparse-attention 레이어 4개마다 공유해, 1 million 토큰 컨텍스트에서 토큰당 연산량을 2.9배 줄였습니다. 쉽게 말하면 거대한 프롬프트를 탐색하는 데 드는 비싼 연산 일부를 모든 레이어에서 되풀이하지 않는 구조입니다. 덕분에 대규모 저장소를 오래 다루는 세션의 서빙 비용을 낮출 수 있습니다.
GLM-5.3은 코딩 분야의 직접적인 후속 모델입니다. Z.ai의 설명에 따르면 GLM-5.2와 같은 베이스 모델을 사용하고, 추가 후속 학습으로 성능을 끌어올렸습니다. GLM-5.3 Flash는 새 베이스에서 출발한 별도 계열입니다. 총 320 billion 파라미터 중 18 billion 파라미터가 활성화되며, 희소·선형 어텐션을 결합했고 30 trillion 토큰 규모의 멀티모달 코퍼스로 학습했습니다. 현재 문서에는 비디오·이미지·텍스트·파일 입력, 텍스트 출력, 1 million 토큰 컨텍스트, 최대 128K 출력 토큰 지원이 명시돼 있습니다.
비즈니스 관점에서 중요한 변화는 더 작아진 활성 파라미터 규모입니다. Z.ai는 정식 GLM-5.3보다 어텐션 연산량이 3.0배 적고 key-value 캐시가 4.4배 작다고 설명합니다. 요청마다 필요한 연산과 메모리가 줄어든 덕분에 토큰 가격도 크게 낮출 수 있었습니다. Flash는 이름만 바꾼 GLM-5.2가 아닙니다. 서빙 경제성을 바꾸고 코딩 루프에 네이티브 시각 피드백까지 더한 모델입니다.
GLM-5.2와 GLM-5.3 Flash는 모두 MIT 라이선스로 제공됩니다. 상업적으로 사용하거나 수정하고 셀프 호스팅할 수 있습니다. 이 때문에 두 모델은 여전히 오픈 웨이트 모델 논의의 중심에 있습니다. 다만 호스팅 이용료와 이 정도 규모의 모델을 구동할 하드웨어 비용까지 무료인 것은 아닙니다.
벤치마크를 과장 없이 읽는 법
GLM-5.2의 초기 벤치마크는 이제 현재 순위가 아니라 과거의 기준점으로 봐야 합니다. Z.ai가 6월 공개 자료에서 제시한 결과를 보면, GLM-5.2는 FrontierSWE에서 Claude Opus 4.8보다 약 1점 낮았고 PostTrainBench에서는 Opus 4.8보다 뒤에 자리했으며 SWE-Marathon에서는 13점 낮았습니다. 오픈 웨이트 모델로서는 강한 성적이었지만, 이는 6월 당시 모델 구성과 Z.ai가 선택해 공개한 과제를 반영한 결과입니다.

최신 비교 결과를 보면 권고안이 달라집니다. Z.ai가 공개한 GLM-5.3 Flash 평가에서 Flash는 Terminal Bench 2.1 기준 84.3으로 GLM-5.2의 81.0을 앞섰고, DeepSWE v1.1에서는 63.4 대 46.2, AutomationBench v1.0.6에서는 48.8 대 26.2를 기록했습니다. Claude Code 2.1.207로 실행한 Z.ai Code Bench v1.0 최고 노력 설정에서는 Flash가 29.0, Opus 4.8이 29.5였습니다.
유용한 수치이지만 여전히 벤더가 공개한 결과라는 점은 감안해야 합니다. 공개 벤치마크는 코딩과 에이전트 작업 전반에서 같은 방향을 가리키지만, 비공개 Code Bench는 Z.ai가 통제합니다. 합리적으로 내릴 수 있는 결론은 Flash가 Z.ai가 보고한 워크로드에서 GLM-5.2를 앞서며, Z.ai 자체 코딩 평가에서는 Opus 4.8에 근접했다는 정도입니다. 글쓰기, 분석, 지시 이행 또는 모든 프로덕션 저장소에서 Flash가 Opus와 동급임을 입증한 결과는 아닙니다.
GLM-5.2 가격, 실제로 얼마인가?
현재 공개된 가격만 보면 새로운 호스팅 워크로드에 GLM-5.2를 선택하기 어렵습니다. 아래 요금은 2026년 8월 30일에 Z.ai의 최신 가격 페이지와 Cloudflare의 최신 Workers AI 가격을 대조해 확인했습니다.
Flash 프로모션은 Z.ai API에만 적용되며, 싱가포르 시간 UTC+8 기준 2026년 9월 9일 24:00에 종료됩니다. Cloudflare의 표준 요금은 입력 $0.15, 캐시 입력 $0.03, 출력 $0.50입니다. Cloudflare 배포 예산을 Z.ai의 한시 할인 가격에 맞춰 계산해서는 안 됩니다.
입력 토큰 1 million개와 출력 토큰 1 million개를 쓰는 단순한 워크로드를 가정하면 GLM-5.2 또는 정식 GLM-5.3의 비용은 $5.80입니다. Flash는 정가 기준 $0.65로 88.8% 저렴합니다. Z.ai 프로모션 기간에는 $0.325로 94.4% 저렴해집니다. 실제 작업에서는 입·출력 비중이 달라지겠지만 결론은 같습니다. GLM-5.2와 GLM-5.3은 같은 가격대이고 Flash는 훨씬 아래에 있습니다.

GLM Coding Plan도 달라졌습니다. Lite는 여전히 월 $18 또는 연간 결제 시 월 $12.60이며, 이제 주당 10,000 credits를 명시합니다. Pro는 월 $80 또는 연간 결제 시 월 $56이고 Lite 사용량의 6배를 제공합니다. Max는 월 $168 또는 연간 결제 시 월 $117.60이며 Lite의 14배입니다. 이 페이지에는 Claude Code와 ZCode를 포함해 20개가 넘는 에이전트 툴이 안내돼 있고, 설정 명령어 npx @z_ai/coding-helper도 계속 제공됩니다.
GLM-5.3 Flash는 모든 Coding Plan 사용자가 이용할 수 있으며, 정식 GLM-5.3보다 3배 많은 실사용 할당량을 제공합니다. 따라서 플랜 선택도 간단해집니다. 주간 작업량이 10,000 credits 안에 들어오면 Lite로 시작하고, 용량이 더 필요할 때 상위 플랜으로 옮기면 됩니다. 이 플랜과 프런티어 구독 상품을 비교하고 있다면 Claude Code 가격 가이드가 도움이 됩니다. 더 많은 할당량을 소모하더라도 높은 코딩 성능이 그만한 가치를 낼 때만 플랜 안에서 정식 GLM-5.3을 선택하는 편이 좋습니다.
GLM-5.2는 무료인가?
웨이트는 MIT 라이선스에 따라 무료로 내려받아 사용할 수 있습니다. Hugging Face에서 GLM-5.2 웨이트를 제공합니다. Z.ai는 지원하는 로컬 추론 프레임워크도 안내합니다. GLM-5.3 Flash 역시 마찬가지입니다.
연산 비용까지 무료인 것은 아닙니다. GLM-5.2는 753 billion 파라미터, Flash는 총 320 billion 파라미터를 갖췄기 때문에 어느 쪽이든 셀프 호스팅은 노트북에서 간단히 실행하는 일이 아니라 인프라 작업입니다. 호스팅형 GLM-5.2의 가격은 입력 토큰 100만 개당 $1.40, 출력 토큰 100만 개당 $4.40입니다. Flash 정가는 각각 $0.15와 $0.50이며, 앞서 설명한 Z.ai 한시 할인이 적용 중입니다.
Cloudflare AI Search에는 또 다른 구분이 필요합니다. AI Search는 공개된 한도 안에서 오픈 베타 기간 동안 무료입니다. Workers Free 기준 월 20,000건의 쿼리와 하루 500개 페이지 크롤링이 포함되지만, Workers AI 생성과 AI Gateway 사용료는 별도로 청구됩니다. 검색 계층이 무료라고 해서 생성 토큰까지 무료가 되는 것은 아닙니다.
코딩용 GLM-5.2 vs GPT·Claude
이제 중요한 비교는 GLM-5.2가 가끔 GPT나 Claude에 근접할 수 있느냐가 아닙니다. 더 젊은 생태계를 감수할 만큼 오픈 모델, 예측 가능한 토큰 비용, 네이티브 멀티모달 입력을 중요하게 보는지가 핵심입니다. GLM-5.3 Flash는 이 세 가지 측면 모두에서 경쟁력을 높였습니다.
GPT와 Claude를 상대로 GLM 제품군이 가장 분명하게 앞서는 부분은 통제권과 비용입니다. 웨이트를 직접 셀프 호스팅할 수 있고, Flash는 지속적으로 많은 출력을 생성할 때 비용을 크게 낮춥니다. 반면 글쓰기·분석·코딩을 두루 처리하는 완성도 높은 어시스턴트 하나를 원하는 사용자라면, 특정 워크로드에 맞춰 모델을 고르는 방식보다 폐쇄형 프런티어 모델이 더 단순한 선택입니다.
순수 코딩 성능을 비교할 때 6월 FrontierSWE 결과를 보편적인 주장으로 확대해서는 안 됩니다. 과거 벤치마크 하나에서 GLM-5.2가 Opus 4.8보다 약 1점 낮았다는 사실이 모든 영역에서 동급이라는 뜻은 아니었습니다. Flash는 비용과 성능의 균형을 개선했고, 정식 GLM-5.3은 GLM-5.2와 같은 API 가격으로 가장 어려운 코딩 작업을 겨냥합니다. 프로덕션 워크플로를 바꾸기 전에 더 폭넓게 비교하려면 프런티어 코딩 모델 가이드부터 보는 편이 좋습니다. Kimi K3 리뷰에서는 비용과 성능의 균형점이 다른 또 하나의 오픈 웨이트 대안을 다룹니다.
GLM-5.2를 써야 할 때와 피해야 할 때
기존 셀프 호스팅 스택이 안정적으로 작동하거나, 평가를 같은 조건으로 재현해야 하거나, 의존성이 GLM-5.2의 동작에 고정돼 있다면 그대로 유지하십시오. 새 모델이 출시됐다고 해서 잘 작동하던 배포가 갑자기 잘못된 선택이 되는 것은 아닙니다.
새로운 대용량 에이전트, 비주얼 코딩, 문서 작업, Cloudflare AI Search 생성에는 GLM-5.3 Flash를 선택하는 편이 좋습니다. 토큰 정가는 GLM-5.2의 거의 9분의 1이고, 시각 자료와 파일을 입력으로 받을 수 있으며, Cloudflare 컨텍스트 창도 더 큽니다. 처리량보다 복잡한 코딩 성능이 중요하면 정식 GLM-5.3을 선택하십시오. API 가격이 GLM-5.2와 같으므로 동일한 요금을 내고 새 유료 코딩 워크로드를 GLM-5.2로 시작할 이유는 거의 없습니다.
워크로드가 가벼워 모델 비용을 무시할 수 있거나, 모델 변경에 필요한 검증 작업이 월간 절감액보다 크다면 마이그레이션을 건너뛰어도 됩니다. 벤더 벤치마크는 실제 저장소를 대표하는 과제를 대신할 수 없습니다.
당장 실행할 방법은 구체적입니다. 실제 저장소 과제 하나를 GLM-5.3 Flash로 수행하면서 출력 토큰, 소요 시간, 수정해야 했던 결과물을 기록한 뒤 정식 GLM-5.3으로 같은 과제를 반복하십시오. Flash가 요구하는 품질 기준을 통과하면 일상 작업의 기본 모델로 지정하고, 정식 모델은 상위 난도 작업에 남겨두면 됩니다. Cloudflare AI Search를 사용한다면 생성 모델로 @cf/zai-org/glm-5.3-flash를 선택하고 첫 비교에서는 검색 설정을 그대로 유지하십시오.
GLM-5.2는 중국 모델인가요?
그렇습니다. Z.ai의 회사 연혁에 따르면 ZhipuAI는 Tsinghua University의 기술을 기반으로 2019년에 설립됐습니다. GLM-5.2와 GLM-5.3 Flash는 모두 MIT 라이선스 웨이트를 제공하므로, 데이터 저장 위치 요건이 엄격한 팀은 호스팅 엔드포인트로 프롬프트를 보내는 대신 셀프 호스팅을 검토할 수 있습니다.
GLM-5.2는 무료인가요?
MIT 라이선스 웨이트는 무료로 내려받아 사용할 수 있습니다. 호스팅 추론은 유료입니다. 현재 가격에 따르면 GLM-5.2는 토큰 100만 개당 입력 $1.40, 출력 $4.40입니다. 셀프 호스팅에도 하드웨어와 운영이라는 실질적인 비용이 듭니다.
코딩에서는 GLM-5.2가 GPT보다 뛰어난가요?
일반화해서 말할 수는 없습니다. Z.ai가 6월에 공개한 자료에서는 일부 장시간 코딩 벤치마크에서 GLM-5.2가 최상위 폐쇄형 모델에 근접했지만, 이후 GLM-5.3과 GLM-5.3 Flash가 Z.ai의 공개 코딩 평가에서 이를 넘어섰습니다. 지금 GLM-5.2를 선택할 가장 강한 이유는 최신 성능 1위가 아니라 오픈 웨이트와 호환성입니다.
GLM-5.2를 Claude Code에서 사용할 수 있나요?
그렇습니다. GLM Coding Plan은 Claude Code를 비롯해 20개가 넘는 에이전트 툴을 지원합니다. 이제 모든 플랜 사용자가 GLM-5.3 Flash를 이용할 수 있고, 정식 GLM-5.3보다 실사용 할당량이 3배 많으므로 일상 작업에서 먼저 시험할 모델로 더 적합합니다.
GLM-5.2가 현재 환경에 맞는지는 대체로 코딩 에이전트의 연결 방식에 달려 있습니다. 기존 워크플로를 깨뜨리지 않고 에이전트가 더 저렴한 모델을 사용하도록 설정하는 절차를 무료 Claude Code 및 Codex 설정 체크리스트에 정리했습니다. 체크리스트와 함께 매주 어떤 모델로 전환할 가치가 있는지 받아보려면 뉴스레터를 구독하십시오.
2026년 9월 3일







