AI コーディングの最適解は?Qwen 3.8 MaxとClaude Fable 5.1を比較
AI コーディングエージェント向けにQwen 3.8 MaxとClaude Fable 5.1を比較します。品質、ツール制御、コンテキスト、料金、導入条件を検証し、難しいリポジトリ作業と大量処理のどちらに最適かを、同一タスクのコストと切り替え基準から実務目線で具体的に判断します。

AI コーディングエージェントでQwen 3.8 MaxとClaude Fable 5.1のどちらを選ぶかは、品質と経済性のトレードオフです。長期間にわたる難度の高いリポジトリ作業にはFable、大量のツールループやツール呼び出しを必須にする処理にはQwenが向いています。新規入力120,000トークン、出力20,000トークンにそろえたタスクの場合、米国向け直接APIの料金は、リトライ、ツール、人によるレビューを含める前でQwenが$0.30、Fableが$2.20です。
AI コーディング向けQwen 3.8 MaxとClaude Fable 5.1の比較:結論
一件の難しいリポジトリ作業に失敗した際の損失がモデルの利用料を上回るなら、Claude Fable 5.1を選ぶべきです。たとえば、複数サービスにまたがる移行、長時間のデバッグ調査、多数のツールターンを通して複雑な計画を維持しなければならないエージェントが該当します。一方、反復可能でトークン消費が多く、価格を重視するワークロードや、指定したツールの実行が契約上の必須条件になる処理にはQwen3.8-Max-0902が適しています。
両者が互角という結論ではありません。品質を最優先するならFableです。経済性を基準にしたデフォルトはQwenであり、ツール選択の強制が譲れない要件なら、統合面でもQwenのほうが安全です。
上記の料金とモデル上限は、2026年9月2日にAlibaba Model Studioの0902専用テーブルとAnthropicのFable 5.1モデルページで確認しました。比較対象は直接APIであり、リセラーによる複合レートではありません。
Qwen3.8-Max-0902は、エンジニアリング規模のコーディング、長期的な開発、複数ツールを使う作業に向けてAlibabaが提供する9月2日版のホステッドスナップショットです。弱点は評価材料にあります。リリース直後で、エージェント性能を独立かつ明確に評価した結果がまだないため、価格の安さを最難関タスクでの同等性と混同してはいけません。

Claude Fable 5.1は、高度な推論と長時間動作するエージェントを想定したAnthropicの9月1日版モデルです。こちらの弱点は運用面です。料金が大幅に高く、常にthinkingを行い、ツール選択の強制を拒否するうえ、過去の履歴を書き換えた会話が拒否されることもあります。

判断基準は、単純なトークン単価ではなく、受け入れ可能な成果物一件あたりのコストです。本番環境を壊しかねないタスクでは、まず品質を見ます。必須の副作用を伴うワークフローではツール遵守が、長いセッションを有効に保てるかどうかはコンテキストの挙動が左右します。導入ポリシーを通過しなければ、そもそもシステムにモデルを組み込めません。これらの条件を満たして初めて、料金が最終判断の材料になります。
AI コーディングエージェントに最適なモデルは、ルーティングで決める
深い調査、計画の継続性、難しい最終レビューが結果を左右する少数のタスクにはFableを使います。リポジトリのインデックス作成、定型的なissue対応、テスト生成、強い検証を伴う反復的な移行、大量のツールループにはQwenが適しています。すべての初回試行にFableの料金を払うのではなく、Qwenで失敗したときにFableへエスカレーションします。
Qwenが受け入れ可能な結果を一件出すまでに、同じトークン量の処理をFableの約7.4倍必要とする場合、またはエンジニアの総人件費を一時間あたり$120と仮定したとき、Fableがタスクあたり57秒を超えるレビュー時間を削減できる場合に判断が逆転します。これはブランドの好みではなく、検証可能なルーティング基準です。
Qwen 3.8 Maxのベンチマーク:根拠ではFableが優勢
勝者はClaude Fable 5.1です。 評価材料は完全ではないものの、現状では一方向を示しています。Artificial AnalysisのIntelligence Indexでは、現在、デフォルトのフォールバックを伴うxhigh effortのFable 5.1が65、Qwen3.8 Maxが58です。同じページで測定された出力速度は、Fableが毎秒60トークン、Qwenが39トークンです。Artificial Analysisによれば、これらは同社独自の評価群に基づく測定値であり、幅広い推論タスクの中にエージェント型のターミナル作業とコーディングが含まれています。
ここには重要な日付のずれがあります。Artificial AnalysisはQwenのエントリーを2026年8月リリースとしていますが、Qwen3.8-Max-0902の登場は9月2日です。つまり58というスコアは0902より前の基準値であり、この記事のタイトルにあるスナップショットへの評価ではありません。65対58を現在の0902との直接比較として示すなら、異なるリリース時点を比べることになります。
Anthropicはさらに、Fable 5.1のスコアとしてTerminal-Bench 4.0で55.8%、CursorBench 3.2で73.4%、AutomationBenchで31.4%と報告しています。有益な手掛かりではありますが、これはAnthropic自身のローンチレポートによるもので、この比較のために行われた独立テストではありません。Qwenの現行ページには、0902で複雑なエンジニアリング作業と複数ツールのオーケストレーションが改善したとありますが、同ページに直接比較できるスコアは掲載されていません。
購入判断として誠実に言える範囲は限定的です。現在、品質を裏付ける根拠はFableのほうが強力です。Qwenには8月版の基準値より新しいという利点が期待できますが、同一ハーネスを使った独立比較ではまだ測定されていません。最も難しい作業を移す前に、実際のリポジトリで評価を行い、修正なしでパッチを受け入れられたか記録してください。一般的なベンチマークスコアだけでは、アーキテクチャを守ったか、不変条件を維持したか、レビューしやすい差分を作れたかは分かりません。
ツール利用:決定論的な契約ではQwenが勝つ
勝者はQwen3.8-Max-0902です。 コーディングエージェントは、ファイルを読み、リポジトリを検索し、コードを編集し、テストを実行して結果を確認し、次へ進むというツール中心のループです。一度でも呼び出しを逃すと、管理されたワークフローが未検証の回答に変わり得るため、モデルの文章力と同じくらいツール呼び出しの契約が重要です。
Qwenではthinkingを無効にすると、アプリケーション側から特定の関数を指定するか、少なくとも一度のツール呼び出しを必須にできます。thinkingが有効な場合、tool_choiceで受け付けるのはautoまたはnoneだけです。また、parallel_tool_callsをtrueに設定すれば、独立した呼び出しを並列実行できます。Qwenのfunction-callingガイドには、両方の制約が明記されています。
このトレードオフには、明確な使い道があります。成功を返す前に必ずrun_testsを呼ばなければならないリリースボットなら、その制御されたステップだけthinkingをオフにして関数を強制できます。その呼び出しではモデルの推論モードを失いますが、代わりに決定論的なアプリケーション契約を得られます。
Fable 5.1では同じ選択ができません。adaptive thinkingは常時有効で、tool_choiceにanyまたは特定のツールを設定すると、HTTP 400のinvalid-requestエラーが返ります。自動選択とツールなしのモードは利用できます。strict tool useなら引数の形は検証できますが、ツールが必ず呼ばれる保証にはなりません。Anthropicは、厳格なスキーマまたはstructured outputと自動選択を組み合わせる方法を推奨しています。
並列処理の仕様は、コストとレイテンシにも影響します。Qwenはデフォルトで単一のツール呼び出しを返し、独立した処理には明示的な並列化スイッチを用意しています。Anthropicによると、Fable 5.1はFable 5が複数の呼び出しをまとめていた場面でも、一ターンにつき一回しか呼ばない場合があるため、明示的にバッチ処理を指示することを推奨しています。ターン数が増えれば、入力の再送、往復通信、状態のずれが増える可能性があります。
どちらのモデルでも、推論状態は慎重に扱う必要があります。Qwenは、thinking有効時には後続リクエストへreasoning_contentを引き継ぐよう求めています。Fableはさらに厳格です。thinkingブロックは、それ以前のシステムプロンプト、ツール、メッセージにバインドされます。先行部分を編集するとブロックが無効になる可能性があります。ツール制御ではQwenが勝ちますが、会話を不用意にシリアライズすれば、どちらのモデルでも問題が起きます。
コンテキストの挙動:運用余力ではQwenが勝つ
日常的な長文コンテキスト処理ではQwen3.8-Max-0902が勝者です。 両モデルとも1,000,000トークンのコンテキストウィンドウを掲げています。コンテキストウィンドウとは、指示、ツール定義、会話履歴、ファイル、推論、出力を含む作業全体の上限です。容量を示すものであり、深く埋もれた情報をすべて思い出せる保証ではありません。
Qwenの正確な直接入力上限は991,808トークン、thinkingモードでは983,616トークンで、最大131,072トークンを出力できます。Fableは1,000,000トークンのウィンドウと最大出力128,000を掲げています。この差は小さく、生の容量だけでモデルを決める理由にはなりません。実務上の分岐点は、有用なコンテキストを維持するコストです。
米国向け直接料金では、Qwenの明示的キャッシュ読み取りが100万トークンあたり$0.137、Fableは$0.25です。新規入力では$1.65対$10と、さらに大きな差があります。そのため、リポジトリマップ、ツールカタログ、安定したエンジニアリング指示を保持する費用は、出力料金の差を考慮する前からQwenのほうが安くなります。
Fableの状態モデルはより厳格です。バインディングが適用されるアカウントでは、保持したthinkingブロックより前にあるシステムプロンプト、ツール定義、または過去のメッセージを変更するとHTTP 400が発生する場合があります。従来のClaudeモデルはFable 5.1のthinkingブロックを読み取れないため、フォールバック時にその内容が暗黙に失われることもあります。実用的な対策は、追記専用の履歴を使い、thinkingをモデル固有の状態として扱うフォールバック設計にすることです。移行の詳細は、別記事のClaude Fable 5.1解説で説明しています。
Qwenもステートレスではありません。ドキュメントでは、thinkingモードのツール会話でreasoning_contentを引き継ぐ必要があるとされています。違いは、Fableが暗号学的な接頭辞バインディングに近い仕組みを明記しており、履歴の編集が明確な統合リスクになる点です。
ウィンドウ全体を使うのは、タスクにそれだけの価値がある場合に限るべきです。どちらのモデルでも、モノレポ全体を流し込むより、対象を絞ったリポジトリマップと検索で取得したファイルを使うほうが安く、評価もしやすいケースが少なくありません。この項目でQwenが勝つのは、同じ容量をより低い運用費で使えるからであり、100万トークンなら自動的にコードの品質が上がるからではありません。
Qwen 3.8 Maxの料金:同一タスクではいくらか
勝者はQwen3.8-Max-0902です。 両方の現行料金表は2026年9月2日に確認しました。この試算では、QwenはAlibaba Model Studioの米国VirginiaにあるDirect Global deployment、FableはAnthropicの直接APIを利用します。ゲートウェイ、別のQwenリージョン、ツール料金、サンドボックスの計算資源、データ転送、リトライ、人によるレビューによって請求額は変わります。
入力料金はAlibabaのリージョン別料金表とAnthropicのFable料金表に基づきます。ここでいう一シート月は、一人のエンジニアが使うエージェント経路のワークロード単位であり、ベンダーのサブスクリプションではありません。どちらのモデルも画像を生成しないため、画像一枚あたりの出力料金は該当しません。画像入力には両方とも対応していますが、両社は固定の画像生成料金ではなく、これらのエンドポイントをトークン単位で課金しています。
正規化したタスクでは、Qwenの料金は(0.12 x $1.65) + (0.02 x $4.951)、つまり$0.29702です。Fableは(0.12 x $10) + (0.02 x $50)、つまり$2.20です。一か月に受け入れ済みタスクを1,000件処理すると、$297.02対$2,200で、差額は$1,902.98になります。

最初の損益分岐点はリトライです。Fableの処理一回分は、Qwenの処理約7.4回分に相当します。Fableが一回で済むすべてのケースでQwenの試行回数が7.4回未満なら、モデルの直接費用ではQwenが引き続き有利です。かなり広い余裕がありますが、質の低いパッチを繰り返せば、テスト基盤とレビュアーの時間も消費します。
次の損益分岐点は人によるレビューです。この条件でFableのAPIに上乗せされる料金は、タスクあたり$1.90298です。エンジニアの総人件費を一時間あたり$120と仮定すると、これはレビュー時間57.09秒分に相当します。Fableによって受け入れ済みパッチのレビューを毎回57秒より多く短縮できるなら、API料金が高くても、人件費を含む総コストは低くなる可能性があります。
同じ接頭辞をキャッシュから繰り返し読む場合、料金差は縮まります。明示的キャッシュの読み取りは、100万トークンあたりQwenが$0.137、Fableが$0.25で、新規入力ほどの差はありません。また、Anthropicはバッチ入力を$5、バッチ出力を$25とし、基本トークン料金の半額に設定しているため、非同期のFable処理でも差が縮まります。Qwenにも同等のバッチ経路があると決めつけてはいけません。Alibabaの0902専用リージョン表ではBatch Inferenceが非対応となる一方、QwenCloudのマーケットプレイスページではBatchesが機能として掲載されています。キューの設計に入る前に、実際に料金を払うエンドポイントを確認してください。
導入経路:エンタープライズ対応はFable、高速なルーティングはQwen
この項目では、既存のエンタープライズ向けクラウド調達ならClaude Fable 5.1が勝ちます。 既存の互換ゲートウェイ経由で最速にモデルを切り替えるならQwen3.8-Max-0902です。 制約がガバナンスなのか、統合速度なのかで結論が変わります。
Qwenのコーディングモデルは0902スナップショットを固定する
Qwen3.8-Max-0902の直接IDはqwen3.8-max-0902で、Vercel AI Gatewayではalibaba/qwen3.8-max-0902として公開されています。Vercelの現行セットアップガイドでは、Claude Code、Codex、OpenCode、Cursor、Piを接続できます。ルーティングルールを使えば、既存の汎用Qwen経路を日付付きスナップショットへ向ける際も、アプリケーションコードを変更せずに済みます。
モデルの固定は重要です。汎用エイリアスは、出力を比較している最中でも切り替わる可能性があります。日付付きスナップショットなら評価を再現でき、後のエイリアスでツール挙動が変わってもロールバックできます。
Qwenの直接料金はリージョンによって異なります。この記事のコストモデルで使った米国Virginiaの料金は入力$1.65、出力$4.951です。QwenCloudのSingaporeページでは入力$2、出力$6となっています。リージョンはまずポリシーとレイテンシで選び、その後、そのリージョンの料金で再計算してください。安い米国料金をすべてのアーキテクチャにそのまま当てはめるべきではありません。
ホステッドかオープンかという違いも、導入上の壁です。より広いQwen3.8ファミリーには、8月13日に公開されたオープンウェイトのqwen3.8-2.4t-a95bがあります。一方、0902専用の製品ページではホステッドスナップショットとして紹介され、ダウンロード可能な0902のウェイト成果物へのリンクはありません。「Qwenはオープンだ」という一般論を、この比較で扱うモデルそのものをセルフホストできる根拠にするのは、カテゴリを取り違えています。
Claude Fableのコーディングは、管理された経路を意図的に選ぶ
Claude APIで使うClaude Fable 5.1のIDはclaude-fable-5-1です。Anthropicは、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundryからも利用できると説明しています。この選択肢の広さが、エンタープライズ導入でFableが勝る理由です。組織によっては、これらのクラウドのいずれかでID、請求、ログ、ベンダー承認がすでに整っている場合があります。
ポリシー上の壁は、こちらのほうが明確です。Fable 5.1のデータ保持期間は30日間で、Anthropicの明示的な許可がない限り、通常のzero data retentionでは利用できません。Anthropicによれば、Enterprise Frontier Safeguardsの経路は段階的に導入され、対象顧客はそれまでzero data retentionを利用できますが、対象資格を確認する必要があります。ソースコードの保持ポリシーがこの経路を許容しないなら、品質を比較する段階には進めません。
Fableには、基本トークン料金の半額となるバッチ料金もあります。オフラインのリポジトリ分析やキューに入れたレビューには有効ですが、次のツール結果を待つインタラクティブなエージェントには向きません。同期処理を大量に回す用途ではQwenの安い直接料金が優勢ですが、調達と管理策が最優先ならFableのマネージドクラウド対応が勝ちます。
モデル文字列の変更だけでは済まないスイッチングコスト
モデルを切り替えると、その周囲のステートマシンも変わります。高くつくのはデータの書き出しではありません。エージェントシェルがツール、履歴、リトライ、出力について、どのような前提を組み込んでいたかを突き止める作業です。
QwenからFableへ移るには、特定ツールを強制する呼び出しを取り除き、thinkingを含む会話を追記専用に保ち、旧Claudeモデル向けのフォールバックを確認し、並列ツール用のプロンプトを調整し直す必要があります。ターンごとにシステムメッセージを書き換えるランナーはQwenでは動いても、Fableのバインドされたthinkingブロックでは失敗する可能性があります。
FableからQwenへ移る場合は、モデル固有のリクエストフィールドを変換し、thinkingを無効にするタイミングを決め、thinkingモードのツールループでreasoning_contentを保持し、既存のパーサーで出力を検証します。ゲートウェイ経由なら、ルーターの変更で比較結果が壊れないように、プロバイダーと日付付きモデルIDをログへ残してください。
長期的に価値を持つ資産は評価セットです。代表的なissue、期待するテスト、禁止する変更、ツールトレース、受け入れ済みの差分、トークン使用量、レイテンシ、レビュー時間を残します。記録をプロバイダーに依存しない形で保持すれば、次のモデルも新しいデモではなく、同じ作業を基準に採点できるため、ロックインを抑えられます。
切り替えるべきでないケースは次のとおりです。
- アプリケーションコード側で、強制
tool_choiceを使わずに副作用を保証できるまでは、ツール実行が必須のワークフローをQwenからFableへ移してはいけません。 - 文書化された保持ルールがポリシーに反し、書面による例外もない場合は、機密性の高いソースコードをFableへ移してはいけません。
- 同じハーネスで0902スナップショットを独立評価した証拠がない段階で、価格だけを理由に難しい作業をFableからQwenへ移してはいけません。
- Qwen3.8ファミリーの別モデルにオープンウェイトがあるという理由だけで、0902をセルフホストする計画を立ててはいけません。
- すでに合格基準を満たす経路を置き換えるなら、モデル料金の削減額が移行とレビューの費用を上回ることが条件です。
リスクの低い形はデュアルルーティングです。既存モデルを利用できる状態に保ち、日常的な作業をQwenへ送り、信頼度が低いタスクや失敗したタスクをFableへエスカレーションして、受け入れ済みタスクの総コストを比較します。Qwenの失敗率が7.4回分の境界を超える、またはFableによって57秒分のレビュープレミアムを安定して回収できるなら、エージェント全体ではなく、そのワークロード区分だけを移してください。
月曜の朝から始める評価プラン
次に行うべきは、日付付きの正確なモデルを使った、管理されたワークロード評価です。単独のパズルを解けるかではなく、実際に出荷する成果を測る必要があります。
代表的な作業を固定する
複数ファイルの編集、ツールに依存するデバッグ、移行、レビューなど、重視する失敗パターンを含む実際のリポジトリタスクを選びます。開始時のコミット、受け入れテスト、変更可能なファイル、停止条件を保存し、両経路へ同じ作業を渡してください。
両モデルのIDを固定する
qwen3.8-max-0902とclaude-fable-5-1を呼び出します。異なるAPIで許される範囲で、effort、ツールへのアクセス、コンテキスト取得、最大出力をそろえます。すべての結果にプロバイダーとリージョンを記録してください。受け入れ済みの結果にかかった費用を計算する
新規入力、キャッシュ作成、キャッシュ読み取り、出力、リトライ、ツール呼び出し、経過時間、レビュアーの作業時間を記録します。テストとレビューに合格した場合だけ、タスクを受け入れ済みとします。こうすることで、トークン単価を出荷可能な作業のコストへ置き換えられます。
単一モデルを選ばずルーティングする
日常的な作業はQwenから始め、特に難しいケースや失敗したケースをFableへ送ります。合格率、レビュー時間、総コストが上記の基準を超えた場合に限り、そのワークロード区分を移します。新しい経路が通常の失敗に耐えられるまで、以前の経路も利用可能な状態にしてください。

エージェントシェルによって結果がモデルと同じくらい変わり得るため、より広いコーディングエージェントの選択肢も検討する必要があります。優れたリポジトリインデクサー、テストループ、権限システム、差分レビューがあれば、安価なモデルを活用できます。弱いハーネスではフロンティアモデルさえ無駄になります。シェルも選定中なら、すべての差をモデルのせいにする前に、Codex、Claude Code、Cursorの比較でワークフロー上のトレードオフを確認してください。
よくある質問
QwenのコーディングモデルはClaude Codeより優れていますか?
Qwen3.8-Max-0902は、直接のトークンコストと決定論的なツール選択で優れています。難しいエージェント作業の品質については、Claude Fable 5.1のほうが現時点で強い独立評価を得ているため、どちらが適切かはタスク失敗時のコストで決まります。
コーディングに最適なQwenモデルはどれですか?
ホステッドのフラッグシップモデルを評価するなら、この記事で比較した日付付きのqwen3.8-max-0902スナップショットを使ってください。ローカル導入、レイテンシ、ハードウェア費用が決定条件なら、より小型のQwenモデルやオープンウェイトモデルが適する場合があります。
Claude Fableはコーディングに向いていますか?
はい。AnthropicはFable 5.1を、長期にわたる難度の高いエージェント型コーディング向けと位置付けており、Artificial Analysisでも現在は総合インデックスが上です。一方、料金、ツール強制の制限、履歴バインディングのルールがあるため、自動的なデフォルトではなく専門的な経路として使うモデルです。
Fable 5は最高のAIモデルですか?
あらゆるワークロードに最適なモデルはありません。失敗する試行やレビュー時間を品質によって減らせるならFableは有力です。処理量とツール制御が重要なら、Qwenのほうが優れたデフォルトです。
Fable 5はコーディングに向いていますか?
はい。ただし、現在の選択肢は2026年9月1日リリースの新しいFable 5.1です。ベンダーのベンチマークはコーディング性能を裏付けていますが、割増料金に見合うかどうかは実際のリポジトリテストで判断してください。
Fable AIが停止されたのはなぜですか?
Claude Fable 5のことなら、Anthropicによると、米国の輸出規制が2026年6月12日に発効したためです。利用者の国籍をリアルタイムで確認できず、世界中でアクセスを停止しました。その後、規制の解除を受けてFable 5を復旧しました。
Claude Fableは米国で禁止されたのですか?
米国で恒久的に禁止されたわけではありません。輸出規制命令を受け、AnthropicはFable 5を全利用者向けに一時停止しましたが、その後、世界中でアクセスを復旧しました。
Fable 5は禁止されていますか?
いいえ。Anthropicは2026年7月1日にFable 5へのアクセスを世界中で復旧しました。Fable 5.1は、その後9月1日にリリースされたモデルです。
Claude Fableは復活しますか?
すでに復活しています。Fable 5は7月1日に世界中で復旧し、続いて2026年9月1日にFable 5.1が登場しました。
Qwen 3.8 MaxとFable 5の比較
現在のスナップショットであるQwen3.8-Max-0902とClaude Fable 5.1を使ってください。8月版のQwenと初代Fable 5を比べたページには、9月のアップグレードも現在の統合ルールも反映されていません。
Qwen 3.8 MaxのHugging Face版はありますか?
より広いQwen3.8ファミリーにはオープンウェイトがありますが、0902専用のホステッド製品ページには、固定された0902のダウンロード可能な成果物へのリンクがありません。ファミリー単位のHugging Face掲載モデルを、現行0902 APIで提供されるモデルと同一だと決めつけてはいけません。
AIビジネスワークフロー監査チェックリストでエージェントのワークフローを一つ採点し、次の開発判断をメールで受け取ってください。
2026年9月2日






