2026년 로컬 LLM 순위: 최고의 오픈소스 모델 8종 비교
2026년 로컬 LLM 판도가 달라졌습니다. GLM-5.2부터 DeepSeek V4, gpt-oss-120b까지 성능, API 비용, 라이선스, 컨텍스트 길이, 자체 호스팅 조건을 한눈에 비교하고 코딩·대규모 처리·온프레미스 환경별 최고의 오픈소스 LLM을 고릅니다.

2026년에 직접 구동할 수 있는 최고의 로컬 LLM은 더 이상 미국 모델도, 차선책도 아닙니다. GLM-5.2는 SWE-bench Pro에서 GPT-5.5보다 높은 점수를 기록하고 MIT 라이선스로 공개됐으며, 월 $18 정액제로 이용할 수 있습니다. 빌려 쓰던 프런티어급 성능을 이제 내려받을 수 있습니다.
결론부터 말하면
에이전틱 작업과 코딩에 제대로 활용할 오픈 모델 하나를 고른다면 GLM-5.2가 답입니다. 비용을 최소화하면서 대량 작업을 처리하려면 DeepSeek V4 Flash, 단일 GPU를 사용해 자체 하드웨어에서 모든 것을 운영해야 한다면 gpt-oss-120b를 선택하면 됩니다. 법무팀이 가장 중요하게 보는 조건이 깔끔한 라이선스라면 Apache 2.0 기반의 Qwen3 또는 Mistral이 안전한 기본 선택입니다.
오픈 웨이트 모델은 API로만 빌려 쓰는 대신, 학습된 파라미터를 내려받아 직접 실행할 수 있는 모델을 뜻합니다. 이 차이 하나가 AI 구축 비용의 구조를 바꿉니다. 잠자는 동안에도 올라가는 사용량 기반 요금이 아니라, 직접 통제할 수 있는 비용으로 모델을 운영하게 됩니다. 실제 성능을 기준으로 정리한 순위는 다음과 같습니다.
표의 가격을 읽을 때 한 가지는 알아둘 필요가 있습니다. 내려받는 모델은 가중치 자체가 무료이므로 토큰당 비용은 결국 가장 저렴한 호스팅 업체가 얼마를 받느냐에 따라 달라집니다. 위 수치는 이번 주에 확인한 각 업체의 공식 API 요금입니다. 자체 호스팅을 선택하면 사용량 요금 대신 GPU 비용을 부담하게 됩니다.
로컬 LLM이 더 이상 타협안이 아닌 이유
지난 2년 동안 '오픈 모델'은 '최고의 모델을 감당할 수 없을 때 쓰는 충분히 괜찮은 대안'에 가까웠습니다. 이제는 그렇지 않습니다. 실제 소프트웨어 엔지니어링 티켓을 해결하는 능력을 평가하는 SWE-bench Pro 결과가 이를 선명하게 보여줍니다. GLM-5.2는 62.1점, GPT-5.5는 58.6점, Gemini 3.1 Pro는 54.2점을 기록했습니다. 확실하게 앞선 모델은 69.2점의 Claude Opus 4.8뿐입니다. Tsinghua에서 분사한 기업이 만든 오픈 MIT 라이선스 모델이 엔지니어링 업무에 가장 중요한 벤치마크에서 서구권 프런티어 연구소 세 곳 중 두 곳을 앞선 것입니다.
정작 실제 도입 가능성을 좌우하지만 대부분의 비교 글이 제대로 짚지 않는 부분이 있습니다. '오픈 웨이트'와 '오픈소스'는 같은 약속이 아닙니다. 오픈 웨이트는 파라미터를 내려받을 수 있다는 뜻입니다. 비즈니스 관점의 오픈소스는 여기서 더 나아가, 허가를 받지 않고도 배포·수정하고 만든 제품을 판매할 수 있어야 합니다. DeepSeek, GLM, Qwen은 상업적 이용까지 자유로운 MIT 또는 Apache 2.0으로 제공됩니다. 반면 Llama와 MiniMax는 이용약관에 제한이 담긴 '커뮤니티 라이선스'를 사용합니다. 이는 학술적인 말장난이 아닙니다. 모델을 기반으로 제품을 출시할 수 있느냐, 아니면 석 달 뒤 법무팀의 경고를 받느냐를 가르는 차이입니다.
GLM-5.2, 현재 넘어야 할 오픈 모델의 기준
중국 연구소 Z.ai(구 Zhipu)가 만든 GLM-5.2는 장기 엔지니어링 작업에서 현재 세계 최고 수준의 오픈 웨이트 모델이며, 가장 먼저 검토할 선택지입니다. 2026년 6월 중순 공개된 이 모델은 이전 버전의 200K에서 늘어난, 실용적인 1M 토큰 컨텍스트 창을 제공합니다. 토큰을 받아들이는 데 그치지 않고 전체 구간에서 품질도 유지합니다. 컨텍스트 창은 모델이 한 번에 작업 기억에 담을 수 있는 텍스트의 양입니다. 1M이면 중간 규모 코드베이스 전체와 테스트, 코딩 규칙까지 보면서 작업할 수 있습니다.

실제 터미널을 조작해 과제를 끝내는 능력을 측정하는 Terminal-Bench 2.1에서 GLM-5.2는 81.0점을 받았습니다. Claude Opus 4.8의 85.0점과 불과 몇 점 차이고, Gemini 3.1 Pro의 74.0점보다 높습니다. Z.ai가 공개한 자체 벤치마크에서도 장기 작업 테스트 전부에서 오픈소스 모델 중 가장 높은 순위를 차지했습니다. MIT 라이선스이므로 12명 규모의 스타트업도 별도 허가나 로열티 없이 자체 호스팅하고, 자사 코드로 파인튜닝해 유료 제품에 탑재할 수 있습니다.
문제는 하드웨어입니다. 파라미터가 약 745B인 모델이라 제대로 자체 호스팅하려면 본격적인 멀티 GPU 서버가 필요합니다. 대부분의 팀은 직접 운영하는 대신 API를 사용하게 될 것입니다. 공개 요금은 입력 토큰 백만 개당 약 $1.40, 출력 토큰 백만 개당 $4.40이며, GLM Coding Plan 정액제는 월 약 $18입니다. 프런티어 API 비용을 내던 창업자라면 이 정액제가 가장 눈에 들어옵니다. 커피 두 잔 정도의 비용으로 한 달간 프런티어급 코딩 성능을 쓰고, 나중에 데이터 통제가 필요해지면 가중치를 내부로 가져올 수도 있습니다.
DeepSeek V4, 누구도 따라오기 어려운 비용 하한선
DeepSeek V4는 무시하기 어려운 비용 구조를 제시합니다. 거의 없는 수준의 가격으로 프런티어급에 근접한 품질을 제공하기 때문입니다. 중국 연구소 DeepSeek가 2026년 4월 공개한 이 제품군은 두 가지 크기로 나뉘며, 모두 MIT 라이선스와 1M 토큰 컨텍스트를 제공합니다. V4-Pro는 1.6조 파라미터의 전문가 혼합(MoE) 모델이고, V4-Flash는 더 가벼운 284B 파라미터 모델입니다. 전문가 혼합 모델은 토큰마다 전체 파라미터 중 일부만 활성화합니다. 이렇게 큰 모델을 저렴하게 서비스할 수 있는 이유입니다.

핵심은 가격입니다. DeepSeek 공식 API에서 V4-Flash 요금은 입력 토큰 백만 개당 $0.14, 출력 토큰 백만 개당 $0.28입니다. 대형 모델인 V4-Pro조차 입력 $0.435, 출력 $0.87에 불과합니다. 격차를 체감해 보면 이렇습니다. 폐쇄형 프런티어 모델에서 월 수백 달러가 들던 작업도 V4-Flash로 같은 일을 처리하면 대개 수십 달러 초반으로 내려갑니다. 일상적인 작업에서는 대부분의 사용자가 출력 품질의 차이도 구분하기 어렵습니다. 두 모델 모두 고난도 추론을 위한 사고 모드와 에이전트 작업용 툴 호출을 지원합니다.
분명한 한계도 있습니다. DeepSeek는 추론·수학·코딩에서 뛰어나지만, 최고 난도의 멀티모달 작업이나 가장 긴 에이전틱 코딩에서는 GLM-5.2와 Kimi가 앞섭니다. 분류, 추출, 요약, 초안 작성처럼 처리량이 큰 작업은 V4-Flash를 기본값으로 삼고, 정말 더 강력한 모델이 필요한 5%의 작업에만 비싼 모델을 배정하는 방식이 합리적입니다.
Kimi K2.7 Code, 코드를 작성하는 에이전트를 위한 모델
Moonshot AI의 Kimi K2.7 Code는 몇 시간씩 구동되는 코딩 에이전트를 위해 설계된 오픈 모델로, 2026년 6월 출시됐습니다. 1조 파라미터의 전문가 혼합 모델이며 텍스트뿐 아니라 이미지와 비디오도 읽는 네이티브 멀티모달 입력, 256K 토큰 컨텍스트 창을 갖췄습니다. GLM-5.2가 코딩도 매우 잘하는 범용 모델이라면, Kimi는 최신 코딩 툴이 수행하는 길고 여러 단계로 이어진 에이전트 루프에 특화됐습니다.

Moonshot이 공개한 수치에 따르면 이전 모델 K2.6은 SWE-bench Verified에서 80.2%를 기록해 폐쇄형 프런티어 모델과 같은 구간에 올랐습니다. K2.7 Code의 공식 API 요금은 입력 토큰 백만 개당 $0.95, 출력 토큰 백만 개당 $4.00입니다. 프롬프트가 캐시되면 입력 요금은 훨씬 저렴한 $0.19로 내려갑니다. 매 단계마다 동일한 대규모 컨텍스트를 다시 보내는 에이전트에는 매우 중요한 차이입니다. 수정 MIT 라이선스로 제공되므로 상업적 자체 호스팅도 가능합니다.
절충해야 할 부분은 범용성입니다. Kimi는 코딩과 에이전틱 실행에는 날카롭지만 일반적인 글쓰기나 분석을 두루 맡기는 모델로는 다소 부족합니다. 코딩 에이전트 제품이나 사내 개발자 툴을 만든다면 최상위 선택지입니다. 하나의 모델로 모든 업무를 처리하려면 GLM-5.2나 DeepSeek가 더 균형 잡힌 선택입니다. 실제 툴에서 이 모델들을 어떻게 활용하는지는 최고의 AI 코딩 에이전트에서 확인할 수 있습니다.
Qwen3, 가장 자유롭게 쓸 수 있는 강력한 오픈 모델
Alibaba의 Qwen3는 단일 벤치마크 선두보다 깔끔한 라이선스와 폭넓은 언어 지원이 더 중요할 때 선택할 오픈 모델입니다. 오픈 플래그십 Qwen3-235B-A22B는 전체 235B 중 22B의 파라미터를 활성화하는 전문가 혼합 모델입니다. 256K 토큰 컨텍스트와 119개 언어 지원을 갖췄습니다. 무엇보다 이 목록에서 가장 관대한 Apache 2.0 라이선스가 적용됩니다. 맞춤형 약관을 꺼리는 법무팀이 있는 기업이라면 기본 선택으로 삼을 만합니다.

하나의 모델에서 고난도 추론을 위한 사고 모드와 일상 대화를 위한 빠른 비사고 모드를 전환할 수 있습니다. 필요하지 않은 숙고 과정에 비용을 지불할 이유가 없습니다. 가중치는 무료로 내려받을 수 있고 Alibaba Cloud 또는 이 모델을 제공하는 다른 호스팅 업체에서 실행할 수 있습니다.
마케팅 문구 때문에 혼동하기 쉬운 부분은 정확히 짚어야 합니다. Alibaba의 최신 플래그십 Qwen3.7-Max는 폐쇄형 API 전용 모델입니다. 실제로 공개된 것은 Max가 아니라 중간급 모델과 235B 모델의 가중치입니다. 비기술 담당자가 구매 여부를 결정할 때 적용할 원칙은 간단합니다. 모델을 소유하려면 Max 등급이 아닌, 이름이 명시된 오픈 Qwen 가중치를 골라야 합니다. 오픈 235B 모델은 가장 어려운 코딩 벤치마크에서 GLM-5.2와 DeepSeek V4보다 약간 뒤처집니다. 하지만 관대한 라이선스와 다국어 지원 덕분에 글로벌 제품을 위한 가장 안전한 독립 운영용 기본 모델입니다.
MiniMax M3, 오픈 프런티어에 멀티모달을 더하다
텍스트·이미지·비디오가 섞인 작업에 거대한 컨텍스트가 필요하다면 MiniMax M3를 주목할 만합니다. 이 목록에서 가장 최근인 2026년 6월 1일에 공개됐습니다. 전체 428B 중 23B의 파라미터를 활성화하는 전문가 혼합 모델로, 1M 토큰 컨텍스트와 네이티브 멀티모달 입력을 제공합니다. 연구소가 MiniMax Sparse Attention이라고 부르는 어텐션 설계를 적용해 장문 컨텍스트 추론 비용을 낮췄습니다.

비용도 공격적입니다. MiniMax 공식 API에서 M3는 상시 50% 할인이 적용돼 입력 토큰 백만 개당 $0.30, 출력 토큰 백만 개당 $1.20입니다. GPQA Diamond에서 93.0점과 같은 벤치마크 성적을 기록해 오픈·폐쇄형을 통틀어 최상위 추론 모델군에 들어갑니다.
단서는 라이선스입니다. M3 가중치는 내려받을 수 있지만, 모델이나 파생 모델을 상업적으로 이용하려면 기본 MiniMax Community License 외에 별도 계약이 필요합니다. 쉽게 말해 실험용으로는 훌륭하지만, 이 모델을 기반으로 사업을 시작하기 전에는 상업 이용 조건을 문서로 확인해야 합니다. 제품을 출시하는 기업 관점에서 MIT와 Apache 모델보다 순위가 낮은 이유는 바로 이 조항 하나입니다.
gpt-oss, 자체 GPU 한 대에서 실행할 수 있는 선택지
OpenAI의 오픈 웨이트 제품군 gpt-oss는 클러스터 없이 직접 통제하는 하드웨어에서 실행해야 할 때 선택할 모델입니다. 대형 모델 gpt-oss-120b는 전체 117B 중 5.1B의 파라미터만 활성화하며, NVIDIA H100 같은 80GB GPU 한 대에서 실행하도록 설계됐습니다. 소형 gpt-oss-20b는 16GB 메모리에서 구동되므로 사양이 좋은 워크스테이션이면 충분합니다. 두 모델 모두 Apache 2.0입니다.

현실적인 온프레미스 선택지입니다. 외부 API로 데이터를 보낼 수 없는 규제 산업 기업, 병원, 은행, 방산업체라면 'H100 한 대에 들어간다'는 사실만으로 결정이 끝날 수 있습니다. 추론 강도를 조절할 수 있어 빠르고 저렴한 모드와 느리지만 신중한 모드 사이에서 설정할 수 있으며, 디버깅을 위한 전체 사고 과정에도 접근할 수 있습니다. 네이티브 함수 호출, 웹 브라우징, Python 실행 기능을 갖춘 진정한 에이전틱 모델입니다.
다만 gpt-oss는 GLM-5.2나 DeepSeek V4처럼 벤치마크 정상 자체를 노리는 모델이 아니며, 이 그룹에서도 출시된 지 더 오래된 편입니다. 가장 똑똑한 단일 모델이어서가 아니라, 이미 보유한 하드웨어에서 깔끔한 라이선스로 실행할 수 있는 유능한 모델이라는 배포상의 강점 때문에 선택합니다.
Mistral, 유럽의 오픈 모델 선택지
프랑스 연구소 Mistral은 유럽 데이터 레지던시와 구매자에게 익숙한 서구권 공급사가 중요할 때 선택할 오픈 모델입니다. 오픈 제품군에는 지시 수행·추론·코딩을 하나의 효율적인 패키지로 통합한 하이브리드 모델 Mistral Small 4, 프런티어급 멀티모달 모델 Mistral Medium 3.5, 코드 에이전트용 Devstral 2가 포함됩니다.

유럽 고객을 상대로 사업하는 유럽 기업이라면, 가중치의 실제 성능과 별개로 베이징 소재 공급사보다 파리 소재 공급사와 구매 절차를 논의하기가 수월합니다. Mistral 모델은 중국의 거대 MoE보다 작고 가볍습니다. 효율성이 필요할 때는 장점이지만 코딩 벤치마크의 절대적인 최고 성능이 필요할 때는 한계입니다. 벤치마크 선두보다는 익숙하고 규정 준수에 적합한 선택입니다.
Llama 4, 프런티어보다 생태계가 강점인 모델
Meta의 Llama 4는 더 이상 벤치마크 우승을 위해 고르는 모델은 아니지만, 가장 깊은 툴링과 넓은 커뮤니티를 갖춘 모델이라는 점은 변하지 않았습니다. 2025년에 공개된 현세대에는 네이티브 멀티모달 전문가 혼합 모델 Scout와 Maverick이 포함됩니다. 두 모델 모두 17B의 활성 파라미터를 사용하며, Maverick은 128개 전문가에 총 400B의 파라미터를 배치합니다. 최대 모델 Behemoth는 아직 공개되지 않았습니다.

2026년 Llama의 진짜 자산은 생태계의 중력입니다. 다른 어떤 오픈 모델보다 파인튜닝과 양자화 버전, 배포 가이드가 많고 채용 시장에서도 익숙합니다. 팀이 이미 Llama를 운영하고 있고 현재 업무를 충분히 처리한다면 서둘러 바꿀 필요는 없습니다. 단, 라이선스는 정확히 구분해야 합니다. Llama는 Apache나 MIT가 아니라 Meta의 커뮤니티 라이선스로 배포되며, 진정한 오픈소스 라이선스에는 없는 상업적 제한이 있습니다. 라이선스를 자유롭게 선택할 수 있는 신규 프로젝트라면 최신 중국계 MIT·Apache 모델이 성능도 더 뛰어나고 조건도 더 깔끔합니다.
상황별로 어떤 모델을 골라야 할까
정답은 하나의 우승 모델이 아니라 각자의 제약 조건에 따라 달라집니다. 현재 상황과 맞는 행을 찾으면 됩니다.
비용 계산, 과장 없이 따져보기
기업 입장에서 이 모든 비교가 중요한 이유는 결국 청구서입니다. 오픈 모델에 비용을 지불하는 방식은 세 가지이며, 각각 맞는 규모가 다릅니다.
API 임대: 가장 부담이 적은 시작
공급사의 API로 모델을 호출하고 토큰 단위로 비용을 냅니다. DeepSeek V4-Flash 요금이라면 출력 토큰 백만 개에 28센트입니다. 바쁜 제품에서 충분히 나올 법한 규모인 월 수억 토큰을 쓰는 팀도 수천 달러가 아니라 수십 달러를 지불합니다. 거의 모든 팀이 여기서 시작하는 편이 좋습니다.
정액제 구매: 예측 가능한 지출
코딩 사용량이 많다면 월 약 $18인 GLM Coding Plan 같은 구독으로 토큰 비용에 대한 불안을 없앨 수 있습니다. 고정 금액 하나만 내면 더 이상 토큰을 세지 않아도 됩니다. 하루 종일 AI와 코딩하는 소규모 엔지니어링 팀에 가장 알맞은 구간입니다.
가중치 자체 호스팅: 가장 큰 투자, 가장 낮은 한계비용
MIT 또는 Apache 라이선스의 가중치를 내려받아 자체 GPU에서 실행합니다. 비용 구조가 토큰당 종량제에서 고정 GPU 비용과 엔지니어링 시간으로 바뀝니다. 사용량이 많고 꾸준하거나 데이터 통제가 반드시 필요할 때만 경제성이 생깁니다. 현실적인 진입점은 H100 한 대에서 실행되는 gpt-oss-120b이며, 1조 파라미터급 MoE에는 클러스터가 필요합니다.
폐쇄형 모델에 월 $10,000를 쓰는 팀이 오픈 모델로는 $1,000에서 $2,000만 지출할 수 있다는 널리 퍼진 주장은 방향상 맞고, 위 가격으로 쉽게 확인할 수 있습니다. GLM-5.2와 DeepSeek V4는 비슷한 작업 기준으로 폐쇄형 프런티어 API보다 약 다섯 배에서 열 배 저렴합니다. 비용 절감 효과는 분명합니다. 다만 이 주장은 자체 추론 인프라를 안정적으로 운영하는 데 드는 엔지니어링 비용을 숨깁니다. 그래서 대부분의 팀은 사용량이 충분히 커지기 전까지 자체 호스팅보다 API나 정액제를 택하는 편이 낫습니다. 이 오픈 모델들이 코딩에서 폐쇄형 Claude, GPT, Gemini와 어떻게 정면 비교되는지는 [코딩을 위한 최고의 AI 모델](/blog/best-ai-model-for-coding-2026)에서 확인할 수 있습니다.
선택을 결정하는 단 하나의 기준
제약 조건 하나가 전체 선택을 바꿉니다. API를 사용할 수 있다면 비용과 성능 사이에서 고르면 됩니다. 고난도 에이전틱 작업에는 GLM-5.2, 대량 작업 전반에는 DeepSeek V4 Flash가 답입니다. 데이터 레지던시, 규제 또는 인터넷과 분리된 인프라 때문에 API를 쓸 수 없다면 보유 하드웨어에서 무엇을 실행할 수 있는지만 보면 됩니다. GPU 한 대라면 gpt-oss-120b, 조금 더 큰 서버라면 Qwen3가 답입니다. API 사용 가능 여부부터 결정하면 나머지는 자연스럽게 정리됩니다.
2026년 최고의 오픈소스 LLM은 무엇인가요?
본격적인 에이전틱 작업과 코딩에는 GLM-5.2가 가장 좋습니다. 장기 작업용 오픈 벤치마크 전부에서 선두를 달리고, MIT 라이선스이며, 월 $18 정액제로 이용할 수 있습니다. 저렴한 대량 작업에는 입력 $0.14, 출력 $0.28인 DeepSeek V4 Flash가 가격 면에서 압도적입니다.
오픈 웨이트와 오픈소스는 같은 뜻인가요?
아닙니다. 이 차이를 놓치면 큰 비용을 치를 수 있습니다. 오픈 웨이트는 모델을 내려받을 수 있다는 뜻입니다. 기업에서 말하는 오픈소스는 배포하고 만든 제품을 판매할 수 있는 라이선스까지 포함합니다. DeepSeek, GLM, Qwen, gpt-oss는 관대한 MIT 또는 Apache 2.0 라이선스를 사용합니다. Llama와 MiniMax는 상업적으로 이용하기 전에 변호사의 검토가 필요한 제한적 커뮤니티 라이선스를 사용합니다.
이 모델들을 자체 하드웨어에서 실행할 수 있나요?
일부 모델은 쉽게 가능합니다. gpt-oss-120b는 80GB H100 한 대에 들어가고, gpt-oss-20b는 16GB에서 실행됩니다. 거대한 전문가 혼합 모델인 DeepSeek V4, GLM-5.2, Kimi K2.7을 제대로 자체 호스팅하려면 멀티 GPU 클러스터가 필요합니다. 그래서 대부분의 팀은 API로 빌려 씁니다.
미국 기업이 중국 오픈 모델을 사용해도 안전한가요?
내려받은 가중치는 전적으로 자체 인프라에서 실행되며 어디에도 데이터를 보내지 않습니다. 따라서 자체 호스팅하면 데이터 레지던시 문제를 완전히 피할 수 있습니다. 문제는 공급사의 호스팅 API를 호출할 때만 생깁니다. 이 경우 데이터가 해당 호스트로 전송됩니다. 중요하게 고려해야 한다면 오픈 가중치를 자체 호스팅하거나 그 모델을 제공하는 서구권 호스팅 업체를 이용하면 됩니다.
일반 컴퓨터에서 로컬로 실행할 수 있는 최고의 오픈 LLM은 무엇인가요?
16GB 메모리에서 실행되는 gpt-oss-20b 또는 중간급 Qwen3 가중치가 적합합니다. 두 모델 모두 외부에서 빌릴 필요 없이 워크스테이션 한 대에서 실행할 수 있는 유능한 모델이며, 관대한 라이선스를 제공합니다.
모델뿐 아니라 이를 제품으로 만드는 에이전트, 툴, 스택까지 비즈니스에 맞춰 한눈에 보고 싶다면 사업자를 위한 AI 툴 지도를 받아보세요. 실제로 출시된 변화와 대응 방법을 매주 짧게 전해드립니다.
2026년 9월 4일







