ローカルLLMおすすめ8選【2026年版】オープンウェイトモデルを比較
2026年に選ぶべきローカルLLMを、性能・料金・ライセンス・必要ハードウェアで比較。GLM-5.2、DeepSeek V4、Qwen3、gpt-ossなど主要8モデルを、コーディング、低コスト運用、オンプレミス利用といった目的別に評価し、最適な選び方を解説します。導入前の判断に必要なポイントがわかります。

2026年に使える最良のローカルLLMは、もはや米国製でも、妥協のための選択肢でもありません。GLM-5.2はSWE-bench ProでGPT-5.5を上回り、MITライセンスで提供され、料金は月額一律$18です。かつて借りるしかなかったフロンティアモデルを、今ではダウンロードできます。
結論:用途別に選ぶローカルLLM
本格的なエージェント処理やコーディングに1つだけ選ぶなら、GLM-5.2です。大量の処理をできるだけ安く回すなら、DeepSeek V4 Flashが向いています。すべてを自社ハードウェアに置き、GPU 1基で動かす必要があるなら、gpt-oss-120bです。法務部門がライセンスの明快さを最優先するなら、Apache 2.0のQwen3またはMistralが安全な標準候補になります。
オープンウェイトモデルとは、APIを通じて利用権を借りるだけでなく、学習済みパラメータをダウンロードして自分で実行できるモデルです。この違いだけで、AIを使った開発の採算は大きく変わります。モデルのコストを、眠っている間も増え続ける従量課金ではなく、自分で管理できる費用に変えられるからです。以下では、実際に得られる価値を基準に各モデルを比較します。
表の料金には注意が必要です。ダウンロードできるモデルの場合、ウェイト自体は無料なので、トークン単価は最も安いホスティング事業者の料金で決まります。上記は、今週確認した各ベンダー公式APIの価格です。セルフホストを選べば、従量課金の代わりにGPU費用を負担することになります。
オープンウェイトが妥協ではなくなった理由
この2年間、「オープンモデル」とは「本命を買えないときに使う、十分に良い代用品」を意味していました。今では、その見方は通用しません。実際のソフトウェア開発チケットをモデルが解決できるか測るSWE-bench Proを見ると、差は明快です。GLM-5.2は62.1、GPT-5.5は58.6、Gemini 3.1 Proは54.2です。明確に上にいるのは69.2のClaude Opus 4.8だけです。清華大学発の企業が開発したMITライセンスのモデルが、エンジニアリング業務で重要なベンチマークにおいて、欧米のフロンティアラボ3社中2社を上回りました。
実際に導入できるかを左右するにもかかわらず、ほとんどの比較記事が明記していない点があります。「オープンウェイト」と「オープンソース」は、同じ約束ではありません。 オープンウェイトとは、パラメータをダウンロードできることです。一方、企業にとって意味のあるオープンソースとは、許可を求めずに導入・改変し、作ったものを販売できるライセンスまで含みます。DeepSeek、GLM、QwenはMITまたはApache 2.0で提供され、商用を含めて自由度の高い条件です。LlamaとMiniMaxは、規約に制限を含む「コミュニティライセンス」です。この差は机上の話ではありません。モデルを組み込んだ製品を出荷できるか、それとも3か月後に法務から警告を受けるかを分けます。
GLM-5.2は現在の最有力オープンモデル
中国のラボZ.ai(旧Zhipu)が開発するGLM-5.2は、長時間にわたるエンジニアリング作業で世界最強のオープンウェイトモデルです。まず試すべき候補でもあります。2026年6月中旬にリリースされ、前バージョンの200Kから大幅に拡張された、実用的な1Mトークンのコンテキストウィンドウを備えています。単にトークンを受け付けるだけでなく、その範囲全体で品質を保ちます。コンテキストウィンドウとは、モデルが一度に作業メモリへ保持できるテキスト量です。1Mあれば、中規模のコードベース全体に加え、テストや開発上の規約まで参照しながら作業できます。

実際のターミナルを操作してタスクを完了できるか測るTerminal-Bench 2.1では、GLM-5.2が81.0を記録しています。85.0のClaude Opus 4.8に数ポイント差まで迫り、74.0のGemini 3.1 Proを上回ります。Z.aiが公表したベンチマークでは、実施したすべての長時間タスクでオープンソースモデル中の最高位でした。MITライセンスなので、12人規模のスタートアップでもセルフホストし、自社コードでファインチューニングしたうえで、許可やロイヤルティなしに有料製品へ組み込めます。
難点はハードウェアです。約745Bパラメータのモデルなので、快適にセルフホストするには本格的なマルチGPUマシンが要ります。自前で動かすチームは少なく、多くはAPIを利用するでしょう。公表料金は入力100万トークン当たり約$1.40、出力は約$4.40で、定額のGLM Coding Planなら月額約$18です。フロンティアAPIに高額を払ってきた創業者にとって、注目すべきはこのプランです。コーヒー約2杯分で1か月間、フロンティア級のコーディングを利用でき、データ管理が必要になれば後からウェイトを社内へ移す選択肢も残ります。
DeepSeek V4は他社が追随できない価格の下限
DeepSeek V4は、無視できないほど圧倒的なコスト構造を持つモデルです。ほぼゼロに丸められる価格で、フロンティアに近い品質を実現します。中国のラボDeepSeekが2026年4月にリリースし、2つのサイズはいずれもMITライセンス、コンテキストは1Mトークンです。V4-Proは1.6TパラメータのMixture-of-Expertsモデル、V4-Flashは軽量な284Bパラメータ版です。Mixture-of-Expertsでは、トークンごとにパラメータの一部だけを有効化するため、これほど大きなモデルでも低価格で提供できます。

最大の魅力は料金です。DeepSeek公式APIでは、V4-Flashが入力100万トークン当たり$0.14、出力は$0.28です。上位のV4-Proでさえ、入力$0.435、出力$0.87に収まります。差を実感できる例を挙げると、クローズドなフロンティアモデルで月数百ドルかかる処理でも、V4-Flashなら同じ仕事を月数十ドル前半で実行できることがよくあります。日常的なタスクでは、大半の利用者が出力品質の違いを判別できません。どちらも難しい推論向けの思考モードと、エージェント処理向けのツール呼び出しに対応します。
率直に言えば、DeepSeekは推論・数学・コードに優れていますが、最も難しいマルチモーダル処理や、長時間のエージェント型コーディングに選ぶモデルではありません。そこではGLM-5.2とKimiが上回ります。V4-Flashは、大量処理、分類、抽出、要約、下書き作成の標準モデルとして使い、本当に必要な5%のタスクだけを高価なモデルに任せるのが合理的です。
Kimi K2.7 Codeはコードを書くエージェントのためのモデル
Moonshot AIのKimi K2.7 Codeは、何時間も動き続けるコーディングエージェントのために作られたオープンモデルで、2026年6月に登場しました。1TパラメータのMixture-of-Expertsモデルで、テキストに加えて画像と動画を読み取るネイティブなマルチモーダル入力と、256Kトークンのコンテキストウィンドウを備えます。GLM-5.2がコードにも強い汎用モデルであるのに対し、Kimiは現代のコーディングツールが実行する、長く多段階のエージェントループに特化して調整されています。

Moonshotが公表した数値では、前世代のK2.6がSWE-bench Verifiedで80.2%に達し、クローズドなフロンティアモデルと同水準でした。公式APIのK2.7 Codeは、入力100万トークン当たり$0.95、出力は$4.00です。同じ大きなコンテキストを毎回送り直すエージェントに重要なプロンプトキャッシュ利用時は、さらに安い$0.19になります。Modified MITライセンスで提供されるため、商用のセルフホストも選択肢に入ります。
その代わり、用途は絞られます。Kimiはコーディングとエージェント実行に鋭い一方、一般的な文章作成や分析までこなす万能型ではありません。製品がコーディングエージェントや社内開発ツールなら、有力な選択肢です。1つのモデルですべてを担いたい場合は、GLM-5.2またはDeepSeekのほうがバランスに優れます。これらのモデルを実際に動かすツールとの組み合わせは、おすすめのAIコーディングエージェントで解説しています。
Qwen3は本格派で最も自由度の高いオープンモデル
AlibabaのQwen3は、単一ベンチマークの首位よりも、明快なライセンスと対応言語の広さを重視するときに選ぶべきオープンモデルです。オープンな旗艦モデルQwen3-235B-A22Bは、総パラメータ235B、アクティブパラメータ22BのMixture-of-Expertsモデルで、256Kトークンのコンテキストと119言語への対応を備えます。何よりApache 2.0を採用しており、この一覧で最も寛容なライセンスです。独自規約に法務部門が慎重になる企業にとって、標準候補になります。

難しい推論に使う思考モードと、日常的なチャット向けの高速な非思考モードを同じモデル内で切り替えられます。不要な熟考に費用を払わずに済む仕組みです。ウェイトは無料でダウンロードでき、Alibaba Cloudまたは対応する任意のホスティング事業者で実行できます。
マーケティング表現では曖昧になりやすいため、区別しておきたい点があります。Alibabaの最新旗艦モデルQwen3.7-Maxはクローズドで、APIからしか使えません。本当にオープンなのは、公開された中位モデルと235Bのウェイトであり、Maxではありません。技術者ではない調達担当者なら、判断基準は単純です。モデルを自社で所有したいなら、Maxではなく、明示的にオープンとされたQwenのウェイトを選んでください。オープンな235Bは、最難関のコーディングベンチマークでGLM-5.2やDeepSeek V4にわずかに及びません。それでも、寛容なライセンスと多言語対応によって、世界向け製品で主権性を確保したい場合の最も安全な標準候補になります。
MiniMax M3はオープンモデル最前線にマルチモーダルを持ち込む
テキスト・画像・動画を組み合わせ、巨大なコンテキストを必要とするなら、MiniMax M3は注目すべきオープンモデルです。この中では最も新しく、2026年6月1日にリリースされました。総パラメータ428B、アクティブパラメータ23BのMixture-of-Expertsモデルで、1Mトークンのコンテキストとネイティブなマルチモーダル入力を備えます。長大なコンテキストの推論コストを抑えるため、開発元がMiniMax Sparse Attentionと呼ぶアテンション設計を採用しています。

価格にも攻めた設定が見られます。MiniMax公式APIにおけるM3の料金は、継続中の50%割引適用時で、入力100万トークン当たり$0.30、出力は$1.20です。GPQA Diamondでは93.0を記録するなど、オープンかクローズドかを問わず、最上位の推論モデルに並ぶベンチマーク性能を示しています。
ただし、ライセンスには注意書きがあります。M3のウェイトはダウンロードできますが、モデルや派生物を商用利用するには、標準のMiniMax Community Licenseとは別の契約が必要です。端的に言えば、実験には魅力的でも、事業の基盤にする前に商用条件を書面で確認すべきモデルです。製品を出荷する企業にとってMITやApacheのモデルより順位が下がる理由は、この1条にあります。
gpt-ossは手元のGPUで動かせる本命
OpenAIのオープンウェイトファミリーgpt-ossは、クラスタを用意せず、自社管理のハードウェアで動かすことが絶対条件なら選ぶべきモデルです。大型のgpt-oss-120bは総パラメータ117Bですが、アクティブなのは5.1Bだけで、NVIDIA H100のような80GB GPU 1基で動くよう設計されています。小型のgpt-oss-20bは16GBのメモリで動作するため、高性能なワークステーションで利用できます。どちらもApache 2.0です。

オンプレミス導入では現実的な選択肢です。規制対象の企業、病院、銀行、防衛関連企業など、外部APIへデータを一切送れない組織にとって、「H100 1基に収まる」ことが決定打になります。推論量を調整できるため、高速・低コストから低速・慎重まで切り替えられ、デバッグ時には完全なChain-of-Thoughtにもアクセスできます。ネイティブな関数呼び出し、Webブラウジング、Python実行を備え、本格的なエージェント処理にも対応します。
正確に位置づけるなら、gpt-ossはGLM-5.2やDeepSeek V4のようにベンチマーク首位を狙うモデルではなく、この中では古いリリースです。最も賢いという理由ではなく、明快なライセンスのもと、すでに所有するハードウェアで動かせる十分に高性能なモデルだから選びます。
Mistralは欧州発のオープンな選択肢
フランスのラボMistralは、EU域内のデータ保管と、欧米の買い手に馴染みのあるベンダーであることを重視する場合のオープンモデルです。オープンな製品群には、指示追従・推論・コーディングを1つの効率的なパッケージにまとめたハイブリッドモデルMistral Small 4、フロンティア級のマルチモーダルモデルMistral Medium 3.5、さらにコードエージェント向けのDevstral 2があります。

欧州の顧客へ販売する欧州企業にとって、ウェイトの実力にかかわらず、北京を拠点とするベンダーよりパリのベンダーのほうが調達手続きを進めやすくなります。Mistralのモデルは、中国製の巨大なMoEより小さく軽量です。効率を求めるなら利点ですが、コーディング性能の絶対的な頂点が必要なら限界でもあります。ベンチマーク首位ではなく、安心感とコンプライアンスを重視する選択肢です。
Llama 4の強みは最先端性能ではなくエコシステム
MetaのLlama 4は、もはやベンチマークで勝つために選ぶモデルではありません。それでも、ツール群とコミュニティの厚さでは今も随一です。2025年にリリースされた現行世代にはScoutとMaverickがあり、どちらもアクティブパラメータ17BのネイティブなマルチモーダルMixture-of-Expertsモデルです。Maverickは128のエキスパートに総パラメータ400Bを持ちます。最大モデルのBehemothは、まだリリースされていません。

2026年のLlamaが持つ本当の資産は、引力です。他のどのオープンモデルよりもファインチューニング版、量子化版、導入ガイドが多く、採用市場でも広く知られています。すでにLlamaを運用し、現在のタスクを十分に処理できているなら、急いで乗り換える必要はありません。ただし、ライセンスは正確に理解すべきです。LlamaはApacheやMITではなく、Meta独自のコミュニティライセンスで提供されます。そこには、真のオープンソースライセンスにはない商用上の制限があります。ライセンスを自由に選べる新規開発なら、より新しい中国製のMITまたはApacheモデルのほうが性能でも条件の明快さでも優れています。
目的別LLM比較:どのモデルを選ぶべきか
正解は1つではなく、制約によって決まります。自社の状況に合う行を選んでください。
コストを正しく比較する
企業にとって重要なのは請求額です。誇張を取り除いて計算すると、オープンモデルへの支払い方は3通りあり、それぞれ適した規模が異なります。
APIを借りる(最小のコミットメント)
ベンダーのAPI経由でモデルを呼び出し、トークン単位で支払います。DeepSeek V4-Flashの料金なら、出力100万トークンは28セントです。利用量の多い製品で、チームが月に数億トークンを処理しても、支払いは数千ドルではなく数十ドルです。ほぼすべてのチームが、まずここから始めるべきです。
定額プランを契約する(支出を予測しやすい)
コーディング利用が多い場合、月額約$18のGLM Coding Planのようなサブスクリプションなら、トークン単価を気にせずに済みます。固定料金だけを払い、トークンを数える必要がなくなります。AIを使って一日中コードを書く小規模なエンジニアリングチームには、最もバランスの良い選択です。
ウェイトをセルフホストする(最大のコミットメント、最小の限界費用)
MITまたはApacheのウェイトをダウンロードし、自社GPUで実行します。コストはトークン単位の従量課金から、固定的なGPU費用とエンジニアリング工数へ移ります。採算が合うのは、処理量が多く安定している場合か、データ管理が絶対条件の場合です。H100 1基で動くgpt-oss-120bが現実的な出発点であり、1Tパラメータ級のMoEにはクラスタが必要です。
クローズドモデルに月$10,000を払うチームでも、オープンモデルなら$1,000〜$2,000にできるという広く知られた主張は、おおむね正しく、上の料金から簡単に確かめられます。同等の仕事で比べると、GLM-5.2とDeepSeek V4はクローズドなフロンティアAPIより約5〜10倍安くなります。節約効果は本物です。ただし、この主張は自前の推論基盤を適切に運用するエンジニアリングコストを隠しています。そのため、ほとんどのチームでは処理量が十分に増えるまで、セルフホストよりAPIや定額プランのほうが有利です。これらのオープンモデルとクローズドなClaude、GPT、Geminiをコーディング用途で直接比較した結果は、[コーディングに最適なAIモデル](/blog/best-ai-model-for-coding-2026)をご覧ください。
最後に:APIを使えるかどうかを先に決める
選択を決定的に変える制約は1つです。APIを利用できるなら、判断軸はコストと性能になります。難しいエージェント処理にはGLM-5.2、大量処理にはDeepSeek V4 Flashが答えです。データ保管、規制、エアギャップ環境などの理由でAPIを利用できないなら、手元のハードウェアで何が動くかだけが重要になります。その場合はGPU 1基のgpt-oss-120bか、もう少し大きなマシンで動かすQwen3です。まずAPIを使えるか決めてください。残りの判断は、そこから自然に決まります。
2026年に最もおすすめのオープンソースLLMは?
本格的なエージェント処理やコーディングならGLM-5.2です。長時間タスクのすべてのオープンベンチマークで首位に立ち、MITライセンスで、月額$18の定額プランもあります。低価格で大量処理するなら、100万トークン当たり入力$0.14、出力$0.28のDeepSeek V4 Flashは価格面で他を寄せ付けません。
オープンウェイトとオープンソースは同じですか?
同じではなく、この違いはコスト問題にもなります。オープンウェイトは、モデルをダウンロードできるという意味です。企業にとってのオープンソースは、作ったものを導入し販売できるライセンスまで含みます。DeepSeek、GLM、Qwen、gpt-ossは自由度の高いMITまたはApache 2.0を採用しています。LlamaとMiniMaxは制限付きのコミュニティライセンスで、商用利用の前に弁護士の確認が必要です。
これらのモデルを自社ハードウェアで動かせますか?
簡単に動かせるものもあります。gpt-oss-120bは80GB H100 1基に収まり、gpt-oss-20bは16GBで動作します。巨大なMixture-of-ExpertsモデルであるDeepSeek V4、GLM-5.2、Kimi K2.7を快適にセルフホストするにはマルチGPUクラスタが必要なので、大半のチームはAPI経由で利用します。
中国製のオープンモデルを米国企業が使っても安全ですか?
ダウンロードしたウェイトはすべて自社インフラ上で動き、データをどこにも送信しません。そのため、セルフホストならデータ保管場所の懸念を完全に回避できます。問題になるのは、ベンダーのホスト型APIを呼び出し、データがその事業者へ送られる場合だけです。それが問題なら、オープンウェイトをセルフホストするか、そのモデルを提供する欧米のホスティング事業者を利用してください。
一般的なマシンでローカル実行できる最良のオープンLLMは?
16GBのメモリで動くgpt-oss-20b、または中位サイズのQwen3ウェイトです。どちらも外部サービスを借りずに、GPU 1基のワークステーションで実用的な性能と自由度の高いライセンスを得られます。
モデルだけでなく、製品化に必要なエージェント、ツール、技術スタックまで自社向けに整理した全体像が必要ですか?ビジネスオーナー向けAIツールマップに登録すると、実際に登場したものと、次に何をすべきかをまとめた短い週刊レポートも受け取れます。
2026年9月4日







