ローカルLLM比較:OllamaとLM Studioの選び方
ローカルLLMを使うならOllamaとLM Studioのどちらが適しているのでしょうか。開発者向けAPIとデスクトップでの使い勝手から、ヘッドレス運用、Mac・GPU対応、商用利用のライセンス、無料のローカル実行と任意のクラウド料金まで比較。会話状態の保持や認証、推論の実行先も踏まえ、用途に合う選び方を解説します。
公開日

ローカルLLMを選ぶなら、開発者が管理するローカルAPIには**Ollama、モデルを探し、設定を調整し、チャットするデスクトップ環境にはLM Studio**が向いています。ローカル実行ソフトの利用料は、どちらも$0です。OllamaとLM Studioの選び分けで重要なのは、使い方とライセンス上の許諾範囲です。開発用途では、APIが会話の状態を保持できるかどうかで結論が変わることもあります。
料金、業務利用の条件、機能は、2026年10月11日に各社の公開ページで確認しました。本記事はドキュメントに基づく比較であり、実機での速度ベンチマークは行っていません。ローカルソフトの料金は、Ollamaの料金ページとLM Studioの料金ページで確認しています。
ローカルLLMの比較:OllamaとLM Studioはどちらを選ぶべきですか?
アプリやエージェントからモデルを呼び出すならOllama、人がデスクトップアプリで直接作業するならLM Studioが基本の選択です。 どちらも、アプリがモデルに出力を求める窓口となるAPIを提供できます。また、どちらにもGUIがあるため、「ターミナルかデスクトップか」という分け方だけでは判断できません。
社内文書の分類、コーディングエージェントのバックエンド、定期実行する自動化を開発するなら、まず候補にしたいのはOllamaです。サービスとしての設定方法が文書化されており、MITライセンスで使えるため、自ら管理する構成要素として導入しやすいからです。ただし、周辺のアプリ、アクセス制御、運用時の確認は自分たちで用意する必要があります。
少人数のチームでモデルを試し、プロンプトを調整し、手元の文書を扱うなら、LM Studioから始めるのがよいでしょう。モデルの検索、設定、チャット、文書を使った対話を、デスクトップの作業環境にまとめられます。ただし、アプリのライセンスが認めているのは個人利用や社内業務での利用であり、ソフトウェアの再配布や第三者へのサービス提供には複数の制限があります。
状態を保持するResponses APIの呼び出しが必要なアプリでは、LM Studioが有力になります。 以前のレスポンスIDを指定し、サーバー側で会話を継続できるためです。一方、Ollamaが明示しているのは、状態を保持しないステートレスなResponses対応です。この違いは、アプリ開発者向けの一般的なおすすめよりも優先される場合があります。
対応範囲は、OllamaのAPI互換性ガイド、LM Studioのアプリとデーモンの解説、および後述する各ライセンスに記載されています。
デスクトップでモデルを試すならLM Studio
ローカルモデルをダウンロードして実行するデスクトップアプリであるLM Studioは、日常的にモデルの設定を確認し、調整する作業に向いています。モデルのホスティングサービスであるHugging Faceからモデルを探し、設定やプリセットを調整し、チャットしながら手元の文書をコンテキストとして使えます。文書を扱う仕組みには、回答に必要な情報を検索してモデルに渡す検索拡張生成、RAGを採用しています。詳しくはLM Studioのアプリガイドに記載されています。
社内の仕様書を確認するアナリストや、プロンプトの設定を比較する開発者にとって、画面上で操作が完結する環境は、周辺ソフトを組み合わせる手間を減らします。このような用途ならLM Studioが適しています。ただし、デスクトップでモデルを探せるからといって、今後開発する社内アプリの認証、ユーザーインターフェース、監視まで揃うわけではありません。
コマンドラインとHTTPサーバーを備えたローカルモデル実行ソフトのOllamaにも、独自のチャットアプリがあります。macOSとWindows向けのアプリでは、モデルのダウンロード、チャット、ファイルのドラッグ&ドロップが可能です。チャット画面が欲しいという理由だけで、問題なく動いているOllama環境を入れ替える必要はありません。
デスクトップでモデルを扱う作業環境としては、LM Studioが優勢です。 Ollamaのチャット機能で必要な作業ができており、アプリとの連携も安定しているなら、そのまま使い続けるのがよいでしょう。
ローカルAPIとヘッドレス運用は、APIの挙動で選びます
開発者が管理するサービスの基本候補はOllamaです。一方、状態を保持するAPIによってアプリ側の実装を減らせるなら、LM Studioが有利です。 デスクトップ画面を開かずに動かすヘッドレス運用には、どちらも対応しています。
Ollamaの独自APIはhttp://localhost:11434/api、OpenAI互換APIのベースURLはhttp://localhost:11434/v1です。LM Studioの互換APIのベースURLはhttp://localhost:1234/v1で、独自APIは/api/v1/*配下にあります。どちらも、チャット補完、埋め込み、モデル一覧、Responsesの各エンドポイントを文書化しています。OllamaのAPI入門とLM Studioの互換API一覧で確認できます。
リクエストの形式が共通していれば、クライアント側の切り替えは楽になります。ただし、サーバーをそのまま置き換えられるとは限りません。
- OllamaのResponsesはステートレスです。 公式ドキュメントでは、
previous_response_idとconversationは非対応とされています。必要な会話履歴はアプリ側から送信する必要があります。Ollamaの互換性リファレンス。 - LM Studioでは、状態を保持したResponsesの継続呼び出しができます。
previous_response_idを使うため、毎回クライアント側で会話履歴を組み立て直したくない社内アシスタントに適しています。LM StudioのResponsesリファレンス。 - LM Studioの独自チャットAPIと互換チャットAPIでは、機能が異なります。 機能比較表では、カスタムツールに対応するのは
/v1/responsesと/v1/chat/completionsであり、独自APIの/api/v1/chatは非対応です。「独自APIのほうが機能が揃っていそう」という理由で選ぶと、エージェントとの連携が動かなくなる可能性があります。独自APIの機能比較。
ツール呼び出しが機能するかどうかは、モデルにも左右されます。エンドポイントがツールのスキーマを受け付けても、選んだモデルがそのツールを安定して使えるとは限りません。
OllamaのLinux向けガイドには、ollama serveと起動時に実行するサービスの設定が記載されています。LM Studioのllmsterは独立したデーモンなので、デスクトップアプリを開いたままにする必要はありません。開発者向けのインストールガイドに、macOS/Linux用とWindows用のインストーラーが用意されています。
用途に合ったサービスを起動します
Ollamaでは、インストール済みのサーバーがまだ動いていなければ
ollama serveで起動します。LM Studioをヘッドレス構成でインストールした場合は、lms daemon upでデーモンを起動します。適切なモデルをダウンロードして読み込みます
Ollamaのクイックスタートでは
ollama run gemma4:e2bを使っています。LM Studioのドキュメントでは、lms get openai/gpt-oss-20bに続けてlms load openai/gpt-oss-20bを実行します。いずれも各社が示す例です。どのマシンにも適していることや、同等の負荷になることを意味するものではありません。目的のエンドポイントに接続します
LM Studioでは
lms server startを実行します。アプリの互換クライアントに適切な/v1ベースURLを設定し、そのサーバーが公開するモデル識別子を指定します。バックエンドを置き換える前に、アプリで使うAPI機能が実際に動くかを確認してください。
モデルの操作コマンドは、OllamaのクイックスタートとLM Studioのデーモンガイドに基づいています。
インストールとモデル形式は、使うマシンに合わせて選びます
ターミナル中心でサービスを導入するならOllama、画面の案内に沿ってデスクトップ環境を整えるならLM Studioが向いています。 どちらもmacOS、Windows、Linuxに対応していますが、動作要件は同じではありません。
OllamaのmacOS版は、ディスクイメージからアプリを「アプリケーション」フォルダへドラッグしてインストールします。Windows版には専用インストーラーがあり、ドキュメント上の要件はWindows 10 22H2以降です。Linux向けにはx86-64とARM64のパッケージがあり、次のインストールコマンドが案内されています。
curl -fsSL https://ollama.com/install.sh | sh出典:OllamaのmacOS向けガイド、Windows向けガイド、Linux向けガイド。
LM Studioも各デスクトップOS向けにダウンロードを提供しており、Linux版はAppImage形式です。ハードウェア要件のページにはWindowsのx64とARM、Linuxのx64とARM64が記載されています。Windowsのx64版では、CPUがAVX2命令に対応している必要があります。macOS/Linuxでヘッドレス運用する場合は、別のインストールコマンドを使います。
curl -fsSL https://lmstudio.ai/install.sh | bashこれらのコマンドは、各社のインストールスクリプトをダウンロードして実行します。LM Studioの開発者ガイドには、Windows PowerShell向けのインストーラーも記載されています。導入前に、実際に使うマシンがシステム要件を満たすか確認してください。
移行時に共通で使いやすい形式はGGUFです。 ローカル推論エンジンが扱う、モデルをひとまとめにしたファイル形式です。Ollamaでは、モデル設定ファイルであるModelfileを使って、GGUFとSafetensorsの重みをインポートする方法が文書化されています。LM Studioは、推論エンジンのllama.cppを通じて互換性のあるGGUFモデルを実行し、Apple SiliconではMLXモデルにも対応します。MLXはAppleの機械学習フレームワークです。ただし、拡張子が対応しているだけで、あらゆるモデルアーキテクチャが動くわけではありません。Ollamaのインポートガイド、LM Studioのモデル形式を参照してください。
Macではどちらがよいですか?Apple SiliconとIntelで選択が変わります
Apple Silicon搭載MacでGGUFとMLXを試すならLM Studioが適しています。Intel Macでは、この2つのうち対応しているのはOllamaです。 どちらもmacOS 14以降が必要です。OllamaはIntel/x86でCPUのみの実行に対応すると明記していますが、LM StudioはIntel Macを明確に対象外としています。LM Studioの推奨RAMは16 GB以上です。一方、小型モデルと控えめなコンテキストであれば、8 GBのMacでも動作すると説明しています。これらはアプリの動作要件であり、選んだモデルに必要なメモリを保証するものではありません。OllamaのMac動作要件、LM Studioの動作要件で確認できます。
OllamaのGPU対応とLM Studioの違い:メーカー名だけでなくバックエンドも確認します
手元のGPUと使いたいモデルに対応する実行ソフトを選んでください。 Ollamaは、NVIDIA、ROCm経由での一部のAMD GPU、Metal経由でのApple GPUへの対応を文書化しています。さらに、Windows/LinuxではVulkan経由の対応もあります。カードとドライバーの要件はハードウェアのページに記載されています。
LM StudioはリリースノートでNVIDIA CUDAとAMD ROCm/Vulkanへの対応を説明しており、画面上で複数GPUを設定する機能も提供しています。一部の設定項目は、使うハードウェアによって異なります。対応GPUであっても、モデル本体と、回答中に保持する会話情報であるコンテキストのために十分なメモリが必要です。
画面で設定を確認・調整するならLM Studioが有利ですが、あらゆるハードウェアで優位な製品はありません。 Ollamaではollama psを実行すると、読み込まれたモデルがCPUメモリ、GPUメモリ、または両方を使っているか確認できます。出力が遅い原因を実行ソフトに求める前に、まず割り当てを確かめましょう。
商用利用のライセンスは、Ollamaのほうが自由度の高い選択です
どちらも、ローカル実行ソフトのサブスクリプションを購入せずに社内業務で使えます。ただし、再配布できる範囲は異なります。
OllamaのリポジトリはMITライセンスを採用しています。必要な著作権表示と許諾表示を残すことを条件に、商用利用、改変、配布、販売が認められています。実行ソフトを製品に同梱する可能性がある場合や、サービスの実装を自ら管理したい場合には、Ollamaがより有力な基本候補になります。
LM Studioは2025年7月に、業務利用に別途ライセンスを必要とする仕組みを廃止しました。2026年8月23日付の現行アプリ利用規約では、個人利用と社内業務での利用が認められています。この条件のもとで、企業は従業員の非公開の業務にアプリを使用できます。
社内業務での利用が認められていても、実行ソフトをサービスとして再販売できるとは限りません。 LM Studioのアプリ利用規約は、再配布、サブライセンス、サービスビューローとしての利用、アプリケーションサービスプロバイダーとしての利用、SaaS用途の利用を制限しています。社内業務を超える形で導入する予定なら、「業務利用が無料」という告知だけで判断せず、その構成で利用する許可を確認する必要があります。
小規模な制作会社が社内の仕様書を作成する用途なら、LM Studioの業務利用許諾が該当します。一方、顧客に販売するソフトウェアに推論機能を組み込みたい開発者にとっては、ライセンスの柔軟性でOllamaが有利です。
どちらを使っても、モデルには別途ライセンスがあります。実行ソフトが無料でも、モデル固有の制限はなくなりません。選んだモデルの利用条件は、個別に確認してください。
ローカル利用の料金は同額。クラウドは任意で追加します
ローカル実行ソフトの料金は、どちらも$0です。利用人数やトークン量が増えた結果、片方のローカルライセンスが割安になる分岐点はありません。 現行の料金ページでは、どちらもローカルモデルを無料で使えます。Ollamaの料金、LM Studioの料金に記載されています。
同じ処理量で比べる例として、開発者5人がそれぞれ月100万トークンを処理するケースを考えます。適切なマシンをすでに所有しており、モデルには別途ライセンス料がかからないとします。チーム全体では月500万トークンです。どちらの実行ソフトでも、料金は次のとおりです。
- 月額の実行ソフト利用料:5 × $0 = $0。
- 1ユーザー・1か月あたりの実行ソフト利用料:$0。
- ローカルで処理する1,000トークンあたりの実行ソフト利用料:$0。
これはソフトウェア利用料の計算であり、計算資源まで無料になるわけではありません。追加のハードウェア、電気代、セットアップ、保守、モデルのライセンス費用は、引き続き予算に含める必要があります。この処理量でローカル利用のサブスクリプションが発生する製品はないため、根拠のないトークン単価の差を作るよりも、運用を支えるために必要な時間を比べるほうが有益です。
任意のクラウドプランの料金:2026年10月11日確認
Ollamaのプランは、Freeが$0、Proが月額$20または年額$200、Maxが月額$100、早期アクセスのTeamが月額$500です。有料プランに含まれる月間クレジットは、Proが$60、Maxが$300、Teamが共有で$1,000です。Teamのユーザー数は無制限です。Enterpriseは個別見積もりとなります。これらはクラウドプランであり、モデルをローカルで動かすために必要なライセンスではありません。Ollamaの現行プランで確認できます。
LM Studioの料金ページにも、任意のクラウドサブスクリプションとしてBionic+が月額$20、Proが月額$100と記載されています。ローカルモデル向けには**$0のFree**があります。チームの推論クレジットをまとめて請求できると案内されていますが、チーム向けのサブスクリプションプランは今後提供予定です。LM Studio/Bionicの現行プランを参照してください。
サブスクリプションの価格が同じでも、同じだけ推論できるとは限りません。LM Studioの公開ページには、含まれる利用量の具体的な数値や、同じモデル同士で比較できる料金が十分に示されていません。そのため、Ollamaと比べてどこからクラウド利用が割安になるかを、根拠をもって計算することはできません。本記事で扱う、手元のマシンで非公開の作業を行う選択では、どちらのクラウド料金も比較の基準から外します。プラン全体の選び方は、別記事のOllama料金ガイドで扱っています。
非公開の作業では、推論の経路をローカルに保ちます
URLがlocalhostでも、モデルが手元のマシンで動いている証拠にはなりません。 Ollamaのローカルサーバーは、サインイン後にクラウドモデルも利用できます。非公開のローカル環境として運用するなら、ダウンロード済みのローカルモデルを選び、OLLAMA_NO_CLOUD=1または公式に案内されているdisable_ollama_cloud設定でOllamaのクラウド機能を無効にしてから再起動してください。Ollamaをローカルのみに制限する手順に記載されています。

LM Studioは、ダウンロード済みモデルの実行、文書処理、ローカルサーバーのオフライン動作を文書化しています。一方、モデルの検索やダウンロード、ランタイムのインストール、更新確認ではインターネット接続を使うことがあります。作業を手元のマシン内にとどめる必要がある場合は、任意のクラウド機能や外部ツールも別の通信経路として確認してください。LM Studioのオフライン動作で説明されています。
複数人でアクセスする場合は、認証にも実用上の違いがあります。Ollamaのローカル互換APIの例では、渡したAPIキーの値は無視されます。サーバーを保護するパスワードにはなりません。LM StudioはAPIトークン認証を提供していますが、初期状態では無効であり、サーバー設定で有効にする必要があります。Ollamaのクライアントの挙動、LM Studioの認証を参照してください。
組み込みのトークン認証ではLM Studioが有利です。ローカルの業務には、どちらも利用できます。 社内ネットワークで共有する前に、アクセス権を意図したとおりに設定してください。自分のノートPCからリクエストが成功しただけでは、非公開のチームデータを扱える共有サービスになったとはいえません。
OllamaとLM Studioはどちらが速いですか?条件次第で結果は変わります
本記事で用いた資料だけでは、どちらが高速かは判断できません。 比較には、同じマシン、同じモデルファイル、同じ量子化、コンテキスト長、GPU割り当て、リクエストの負荷が必要です。量子化は、モデルの重みを低い精度で保存する仕組みです。量子化を変えることは、ダウンロード時の設定変更にとどまらず、比較条件そのものを変えます。
自分たちの用途で動作を検証する際は、モデルの読み込み時間と回答の生成時間を分けて測ります。そのうえで、最初の有用な出力が得られるまでの時間、回答の品質、メモリ使用量、同僚が同時にリクエストを送ったときの挙動を比べてください。短いチャットに素早く答えられるモデルでも、長いリポジトリ履歴を抱えるエージェントには向かない場合があります。
まず用途に合う実行ソフトを選び、次に適切なモデルを検証します。コーディング向けローカルAIモデルの比較記事では、現在Mellum2.1も取り上げ、モデルファイルとハードウェア要件を分けて解説しています。実行ソフトを切り替えるだけで、用途に合わないモデルが優れたコーディングアシスタントに変わるわけではありません。
OllamaとLM Studioを乗り換える価値があるのは、どんなときですか?
文書化された制限が作業の妨げになっているなら、乗り換えを検討します。画面が変わることだけが利点なら、安定している環境を維持するのがよいでしょう。
LM Studioは、モデルを扱う作業環境、MacでのMLX対応、状態を保持するResponsesが必要な場合に、Ollamaの代替になります。サービスを自ら管理できることやMITライセンスが決め手なら、LM Studioの代わりにOllamaを選べます。LM Studioでモデルを試しながら、Ollamaをサービスとして運用する併用も可能です。ただし、小規模チームでは、その役割分担によって十分な手間を減らせる場合に限って、両方を維持するのがよいでしょう。

最初に確認するのは、実際に使うモデルファイルです。OllamaはModelfileによるGGUFのインポートに対応し、LM Studioはlms importで互換性のある外部GGUFファイルを取り込めます。再ダウンロードを減らせる場合はありますが、各製品が管理するモデルの保存領域やチャット履歴まで自動で移行されるわけではありません。Ollamaのインポート、LM Studioのインポートを参照してください。
続いて、システムプロンプト、コンテキストの設定、サンプリング設定、ツール定義を引き継ぎます。クライアントのベースURLとモデル識別子を更新し、アプリが使うストリーミング、構造化レスポンス、ツール呼び出しを再確認します。Ollamaの独自APIである/api/chatを使うアプリは、ポート番号をLM Studioの既定値に変えるだけでは移行できません。
LM Studioで保存済みのレスポンスIDを使っていた場合は、Ollamaへ移る前に、アプリ側で会話履歴を保持して再送する方法を設計してください。ヘッドレス運用のため、あるいは「商用利用には料金がかかるはず」という思い込みだけで乗り換える必要はありません。 LM Studioはすでに独立したデーモンと、無料の社内業務利用に対応しています。
どちらも予定している構成に合わない場合は、Ollamaの代替ツールガイドで、より広い選択肢を紹介しています。
よくある質問
LM StudioとOllamaは、どちらがおすすめですか?
開発者が管理するサービスや、ソフトウェアライセンスの自由度を重視するなら、Ollamaが有力な基本候補です。デスクトップでモデルを扱う作業環境としてはLM Studioが向いています。また、状態を保持するResponsesに対応しているため、一部の社内アプリではバックエンドとしてもLM Studioが適しています。
Ollamaに課金する価値はありますか?
有料プランを検討するのは、クラウド機能を使いたい場合です。ローカルモデルの利用にPro、Max、Teamは必要ありません。手元のマシンで実行しなければならない作業では、これらのプランによってローカルソフトの料金面で有利になることはありません。
OllamaはAIモデルをローカルで実行できますか?
はい。ダウンロード済みのローカルモデルを選べば、手元で実行できます。Ollamaはクラウドモデルも提供しているため、選択中のモデルを確認してください。リモート推論を使わない運用では、公式に案内されているローカル専用の設定を使います。
OllamaはCPUだけでも動きますか?
はい。GPUのみで実行する必要はありません。ollama psで読み込み済みモデルのCPU/GPU割り当てを確認し、マシンに合うモデルとコンテキストを選んでください。
OllamaでGPUが使われないのはなぜですか?
使用しているカード、OS、ドライバー、バックエンドを、Ollamaのハードウェア対応ドキュメントと照合してください。続いてollama psとサーバーログを確認します。GPUが搭載されていても、対応するバックエンドが認識しているとは限らず、モデル全体がGPUメモリに収まるとも限りません。
AI業務ワークフローの点検チェックリストを使って、手元のマシンに移す価値のある非公開業務を選びましょう。その後のツールの変化は、ニュースレターでお届けします。
- 公開日
- カテゴリー
- Build
- 言語







