AIモデルの評価をプロンプト非公開で実行できるか:DeepMindの二重盲検検証
機密テストプロンプトと独自モデル重みを双方に隠したまま、AIモデルを評価する二重盲検検証が実現しました。Google DeepMindの実証実験をもとに、セキュアGPU基盤のコスト、法務やコードレビューの課題、企業調達や監査への実践的応用を体系的に解説します。

機密のテストプロンプトをモデル開発元に渡さず、独自モデルの重みを評価者に開示することもなく、AIモデルを評価することは可能です。少なくとも実証実験のレベルでは実現しました。Google DeepMindは、Gemini 2.5 Flash Liteと非公開のベンチマークプロンプトを暗号学的に検証された単一のGPU環境に配置し、承認された結果のみを外部へ出力させることに成功しました。セキュアなコンピュート環境の生コストは、現在のIowa Spotレートで1時間あたり約$7.08です。しかし、真に高コストなのは人件費です。DeepMindの技術レポートによると、ハードウェアのオーバーヘッドではなく、法務面での調整やコードレビューが現在の主要なボトルネックとなっています。これにより、機密評価は単なる「信頼関係の対話」から、スコープと予算を計画可能な「アシュアランスプロジェクト」へと変化しました。
可能ではあるが、完成された商用機能ではなくパイロット検証
実用的な結論を言えば、「一定の境界条件下で可能」となります。Google DeepMindによるAugust 27のパイロットは、外部組織がクローズドモデルをテストする際、2つの貴重な資産を完全に分離できることを示しました。
- 評価者は、ベンチマークプロンプト、スコアリングルール、失敗事例をモデル開発元に対して秘匿します。
- モデル開発元は、モデルの挙動を左右する中核機構であるモデルの重みと推論コードを、評価者に対して秘匿します。
モデルの重みとは、モデルの振る舞いを決定づける学習済みのパラメータ群です。一方、プライベートベンチマークは試験問題そのものです。どちらを相手に渡しても、資産価値を損なう恐れがあります。ベンチマークが流出すれば学習データとして取り込まれ、モデル自体の性能が向上していないにもかかわらず将来のスコアだけが見かけ上改善してしまう可能性があります。また、重みが流出すれば、開発元が保護すべき知的財産や独自機能が白日の下に晒されるリスクがあります。
このパイロットは、2つのドアを備えた密閉された試験室のようなものだと考えてください。一方のドアからモデルが搬入され、もう一方のドアからテスト問題が搬入されます。双方がドアを開ける前に、どのような部屋で、どの鍵が使われ、どんなルールが適用されているかを証明する署名付き証明書を確認します。テストはその室内で実行されます。その後、合意されたスコアカードのみが出力され、部屋は消滅します。
このパイロットでは、Google Cloud Confidential Space、a3-highgpu-1g Confidential VM、Intel TDXメモリ保護技術、NVIDIA H100 80GB Confidential GPU 1基、そしてOpenMinedのPySyftソフトウェアが使用されました。セキュアエンクレーブとは、まさにその密閉空間をハードウェアレベルで実装したものです。ジョブの実行中はメモリが暗号化され、署名付きのアテステーション(認証)によって、双方が機密データを送信する前に実行中のソフトウェアスタックを検証できます。

これは一般提供(GA)された製品ではありません。発表および技術レポートは初期の実証実験について記述したものであり、セルフサービス型の評価機能や公開価格、正式リリース日を示すものではありません。
二重盲検評価が機能する仕組み
暗号技術が基盤にありますが、ワークフロー自体は5つの承認ステップとして捉えると理解しやすくなります。
インターフェースの合意
モデル開発元はモック(擬似)インターフェースを公開します。評価者は実モデルを受け取ることなく、その枠組みに沿ってテストコードを準備できます。また、評価側で何を計算し、どの結果を外部へ出力してよいかについて双方が合意します。
密閉環境の起動
一方の当事者が、承認済みのOS、ランタイム、PySyftコンテナを含むコンフィデンシャルGPU環境を起動します。マシンをホストする側には停止する権限はありますが、相手側の機密データを検査する権限はありません。
環境の検証
双方がリモートアテステーション(ハードウェアおよびソフトウェアスタックの署名付きフィンガープリント)を確認します。これらの測定値が期待通りの構成と完全に一致し、今回の実行用に生成された最新のものである場合にのみデータが送信されます。
ロードと承認
モデル開発元は暗号化された重みと推論コードをエンクレーブへストリーミングします。評価者は暗号化されたプロンプトと評価コードを別チャネル経由で送信します。双方が許可されたコードパスを確認し、実行を承認します。
実行、出力、破棄
エンクレーブ内でモデルが評価され、出力ポリシーで許可された結果のみが外部に公開された後、環境は安全に破棄されます。一時的なメモリ暗号化キーは環境停止時に完全に消去されます。
DeepMindのパイロットでは、2つの非公開評価が実施されました。1つ目は、サイバー攻撃、CBRNE(化学・生物・放射性物質・核・爆発物)関連コンテンツ、ヘイトスピーチ、自傷行為、暴力的犯罪の誘発などのリスクを対象としたMLCommons AILuminateベンチマークのリザーブプロンプトです。2つ目は、Singapore AISIによるシンガポール地域に特化した有害コンテンツデータセットです。AVERIがプロンプトと出力の暗号化・復号を担当し、スタッフがそれらの出力結果を評価しました。
この最後のディテールが重要です。二重盲検だからといって、「誰も何も見ない」という意味ではありません。評価者は自らが作成したテスト内容を把握しており、モデルの出力を受け取ることもあります。約束されている範囲はより具体的で実用的なものです。すなわち、「モデル開発元は機密テストを受け取らず、評価者は重みを受け取らず、クラウド環境はハードウェアとポリシーによって厳格に制限される」ということです。
変化する予算の内訳
機密評価は、単なるモデル可観測性(オブザーバビリティ)ツールの追加アカウントとして調達すべきではありません。ベンダーデューデリジェンス、モデルリスク管理、セキュリティ保証、または規制対象企業の調達プロセスの一環として位置づける必要があります。
日常的な評価ツールの価格は、これまでのソフトウェア予算の目安になります。BraintrustのProプランは月額$249です。LangSmithのPlusプランは1シートあたり月額$39であり、5シートの場合は利用従量課金を除いて月額$195になります。これらの製品は、チームが通常の評価を実行・整理するのに適しています。価格の基準にはなりますが、二重盲検監査の代替にはなりません。
セキュアなインフラ自体の費用は驚くほど明瞭です。Google Cloudは、Confidential Spaceに追加料金はかからないとしています。Iowaリージョンにおけるパイロット構成(a3-highgpu-1g)のSpot取得価格は1時間あたり$6.636703068で、Confidential Computingの追加料金は$0.4391592です。合計すると1時間あたり約$7.08、10時間の実行ウィンドウであればストレージやネットワーク費用を除いて約$70.76となります。

レポートによると、エンクレーブ構成によるコンピュートのオーバーヘッドは5 percent未満にとどまる一方、手続き上のオーバーヘッドや人間同士の調整が最大の障壁であるとされています。これこそが商業上の本質です。コンピュートコストは見積もりが容易なレベルまで下がりましたが、信頼設計のコストはそうはいきません。
実用的な予算計画には、5つの項目が必要です。「評価者の作業費用」「モデル開発元の統合対応」「エンクレーブインフラ」「法務契約」、そして「コードおよび出力ポリシーのレビュー」です。見積もりにGPU時間しか計上されていない場合、それは監査計画とは呼べません。逆に対面アドバイザリーの工数しか記載されていない場合は、なぜ機密実行環境が含まれていないのかを確認すべきです。
最も恩恵を受ける7つのユースケース
1. クローズドモデルを採用する規制対象企業
銀行、保険会社、医療グループには、最も明確なビジネスケースが存在します。調達チームは、実際の社内規程や業務フローに基づいた独自の失敗事例を持ち寄ることができます。モデルベンダーはクローズドな選考対象モデルを提供します。独立した評価者がテストを実行し、双方が中核資産を開示することなく、範囲を限定したスコアカードを納品します。
得られるメリットは、長期的なモデル利用契約を結ぶ前に、より確実な証跡を入手できる点です。購入企業は公開リーダーボードに頼るだけでなく、自社ビジネスに直結する状況下でテストできます。ベンダー側も重みを渡すリスクを避け、保管したくない機密プロンプトの受領を回避できます。
2. 国家規模のAI安全・セキュリティ機関
政府の検証機関は、サイバー、生物兵器、情報操作、あるいは各法域固有のプロンプトをモデルラボの社内システムに渡すことなく、最先端のプロプライエタリモデルを評価できます。これは、Singapore AISIが独自の有害コンテンツセットを提供したパイロットの実際の運用形態に非常に近いものです。
得られるメリットは、ベンチマークの寿命が延び、監督体制の根拠が強固になる点です。テストが非公開に保たれるため、モデルが複数世代更新されても学習データに混入しにくく、長期間にわたり評価の有効性が維持されます。
3. 独立系ベンチマーク開発組織
ベンチマーク機関は、最難関の問題セットを手元に保持し、モックインターフェースのみを公開した上で、検証済み環境を通じて各ベンダーのモデルをテストできます。個々のプロンプトを秘匿したまま、集約されたスコアのみを公表することが可能です。
得られるメリットは、ベンチマークの希少価値が損なわれない点です。自らの価値の源泉であるデータセットを流出させることなく、より多くのクローズドモデルをテストできます。ただし、結果が詳細すぎると間接的にテスト内容が推測される恐れがあるため、課題は出力ポリシーの設計へと移行します。
4. 信頼性の高い外部保証を求めるモデルラボ
モデル開発企業は、プライベートなチェックポイント自体を外部に出力することなく、信頼ある評価機関にテストを委託できます。評価者が難解な課題セットを持ち込み、双方が環境を承認することで、エンタープライズの監査や安全性の証明に使える証跡が得られます。
得られるメリットは、重みファイルをそのまま引き渡すことなく信頼性を獲得できる点です。API経由のテストでは通常のサービス基盤に評価用プロンプトが開示されてしまうような場合に、特に有効です。
5. 攻撃耐性を検証するサイバー防衛チーム
重要インフラ事業者は、ベンダーの再利用可能なデータセットとして決して残してはならないプロンプトを使い、モデルが機密性の高い攻撃経路を発見・連鎖・解説できるかを検証できます。モデルは非公開のまま保たれ、テスト内容もセキュリティ体制の内部に留まります。
得られるメリットは、プロンプトの流出リスクを抑えながら、より確実な導入判断を下せることです。ただし、評価には依然としてサンドボックス環境と厳格な出力ポリシーが必要です。機密実行環境を使ったからといって、危険な出力の外部公開が安全になるわけではありません。
6. 専門性の高い挙動を検証する医療機関
病院の研究グループは、承認済みの匿名化されたエッジケースからなるプライベートデータを作成し、通常のモデルAPIに送信することなくクローズドモデルを評価できます。モデルに自由形式の医療アドバイスを求めるのではなく、拒絶動作、エスカレーション判断、エビデンス提示の要件などを中心にスコア化できます。
得られるメリットは、事例データとベンダーのモデル双方を保護しつつ、病院の運用ルールに直結した証拠を得られる点です。当然ながらプライバシー関連法、臨床レビュー、データガバナンスは引き続き遵守する必要があります。エンクレーブは技術的統制手段であり、法適合証明そのものではありません。
7. 提携やM&Aにおける技術デューデリジェンス
AI企業の買収を検討する企業は、ディールルームから非公開の業務データを提供し、買収対象企業はプロプライエタリなモデルを提供します。中立的な評価者が合意されたテストを実行し、承認された関係者に限定的な結果を報告します。
得られるメリットは、取引完了前の情報開示を最小限に抑え、作り込まれたデモへの依存を減らせる点です。セットアップコストがかかるため、日常的なベンダー選定ではなく、重要度の高い大型ディールやプラットフォーム提携に適しています。
構築する価値のある3つのプロダクト案

1. プライベートなモデル調達検証ラボ(最大の事業機会)
規制対象の導入企業が機密の受入テストを提供し、ベンダーがクローズドモデルを提供し、検証済みのエビデンスパックを返すマネージドサービスを構築します。ターゲット顧客は、戦略的モデルプロバイダーを選定する最高リスク管理責任者(CRO)、モデルリスク管理チーム、セキュリティ責任者、調達部門です。
需要を示すシグナルは極めて明確です。ai governance platformというキーワードは米国で月間1,600件検索されており、公開されているページ上部掲載の入札単価は$27.92から$71.51に達します。関連データでは前年比307 percentの伸びを記録しています。購入企業はガバナンスインフラを求めています。調達検証ラボは、その広範なニーズを「署名付きの結果を伴う、高単価な意思決定支援」へと変換します。
最小限の販売可能バージョン(MVP)は、「1つのモデル、1種類のプライベートテスト群、1組の承認済み指標、1回の検証済み実行、経営陣向けの1通のエビデンスファイル」です。受け入れと証拠保全を支援するソフトウェアを備えたサービスとして開始します。最大のハードルは信頼の構築です。これにはエンタープライズ水準のセキュリティ、信用の置ける評価者、クラウドの知見、法務テンプレート、そしてダッシュボードだけでは誤魔化せない評判が必要です。
2. AI評価用のアテステーション・コントロールプレーン
ハッシュ値、ナンス、イメージの同一性、ポリシー承認、実行証明書などを、監査可能な管理記録へと変換するソフトウェアを構築します。ターゲット顧客は、セキュアコンピュートを運用できるものの、案件ごとにカスタムの暗号化プロジェクトを立ち上げたくない評価機関やモデルベンダーです。
confidential computingというキーワードは米国で月間880件検索され、CPCは$30.80です。一般的なガバナンスに比べて対象は狭いものの、購買層は技術力が高く、直面している課題の解決単価も高額です。DeepMindのレポートが掲げる長期的な目標も、依存関係のハッシュや鍵の複雑さを隠蔽したシンプルな信頼シグナルの実現です。
MVPとしては、Google Cloud Confidential Spaceのパターンを1つ検証し、双方の承認を記録して測定済みソフトウェアイメージと紐づけ、署名付きの実行マニフェストを出力する機能を提供します。ハードルはクラウドやハードウェアへの依存性です。別のエンクレーブ構成に対応することは、単にコネクタを増やす作業とは異なり、信頼の起点(Root of Trust)、エビデンス形式、障害モードそのものが変化します。
3. 機密保持型ベンチマーク取引所
ベンチマーク所有者がテスト内容を明かすことなく「何を測定するか」を一覧化し、モデル開発元が承認された指標のみを受け取る検証済みテストを購入できるマーケットプレイスを構築します。ベンチマーク所有者は希少な問題セットを配布することなく収益化でき、モデルベンダーは重みを渡すことなく独立したテストを受けられます。
ai model evaluationというキーワードは米国で月間140件の検索ボリューム、KD 0、検索候補データでは前年比200 percentの伸びを示しています。大衆市場向けの数字ではありませんが、単なる低価格アカウントではなく「信頼性の高いアクセス権」を販売する場合、特定領域にフォーカスしたエンタープライズ向け商材として成立します。
MVPには、1社のベンチマークパートナー、1社のモデル所有者、1つのエンクレーブイメージ、1つの出力ポリシーが必要です。ハードルは反復実行による情報漏洩です。クエリ、指標、スライス分析が過度に繰り返されると、非公開ベンチマークが逆算されてしまうリスクがあります。レート制限、結果の粒度設計、ベンチマークの管理運用は、利用規約の隅に書くような項目ではなく、プロダクトの中核機能です。
調達検証ラボは、「モデルの購入を承認、却下、あるいは再交渉する」という、すでに予算が存在する結果に直結しているため、最初のビジネスとして最も優れています。他の2つも有用なインフラですが、その価値が明白になるには市場のエコシステムが醸成される必要があります。
この手法でも解決できない課題
このパイロットは、相互の機密保持が技術的に可能であることを証明しました。しかし、評価を自動化したり、トータルコストを劇的に下げたり、あらゆる信頼依存を不要にしたりするものではありません。
- セルフサービス機能ではない: DeepMindは一般提供の時期やパイロットの正式価格を公表していません。
- 1基のH100上の1モデルで実証されたに過ぎない: レポートでは、より大規模なモデル向けに、多ノードのH100やB200によるコンフィデンシャルクラスタの構築を今後の課題として挙げています。
- 完全なトラストレスではない: クラウドプロバイダーとハードウェアメーカーが結託しないことが前提となっています。クローズドなファームウェアは依然として信頼基盤の一部です。
- Googleが検証経路に含まれている: パイロットはGoogleによる署名と検証に依存しており、秘密の署名鍵が入力として使われたため、ゲスト環境のビルドを第三者が完全に独立して再現することはできませんでした。
- 一部のモデルコードはブラックボックスのまま: チームはプロプライエタリな手法のすべてを検査可能にしたり、許可リストに登録したりすることはできず、AVERIはこのパイロットにおいてその制限を受け入れました。
- 機密環境で実行しても粗悪なテストは粗悪なまま: エンクレーブはプロンプトの秘匿性と実行の完全性を保護するだけであり、ベンチマークが適切な対象を測定しているかや、スコアが本番環境の挙動を予測できるかを保証するものではありません。
- 出力自体にもプライバシー規則が必要: 詳細すぎる結果はベンチマークの内容やモデルの挙動を間接的に漏洩させます。実行を開始する前に、何を出力してよいかを双方が合意しなければなりません。
- 人件費の課題は残る: レポートでは、法務契約、コードレビュー、複数者間の調整が主要なボトルネックであると特定されています。
現在評価ソフトウェアを選定しているチームにとっては、ベンチマーク監査ツールガイドが日常的なツール層の参考になります。モデル、テスト、またはその両方が機密性を帯びており、通常のAPIテストでは扱えない場合に、二重盲検評価がその上位の選択肢となります。
結論として、これは極めて有望な新しいアシュアランスの枠組みですが、価格表から即座に購入できるような製品カテゴリにはまだ達していません。最初の利用者は、信頼できる結果を得る価値が調整コストを上回るような、極めて重大なモデル選定の意思決定を迫られている組織となるはずです。
来週から実践できる具体的なアクション
AI調達、モデルリスク管理、またはセキュリティを担当している場合は、今後30日以内に判断を下す必要があるモデル選定案件を1つ選定してください。そして、モデル名、1つの失敗事例カテゴリ、プロンプトの保有者、重みの保有者、外部出力を許可する指標、その指標によって変化する決定事項をまとめた、1ページの「機密評価ブリーフ」を作成します。
次に、評価機関とモデルベンダーに対し、「統合対応」「評価者の人件費」「法務契約」「コードおよび出力ポリシーのレビュー」「コンフィデンシャルインフラ」の5項目を個別に算定するよう依頼してください。GPU 1時間あたり約$7.08という数字は、純粋なコンピュートコストの基準値としてのみ利用してください。重要なのは、アシュアランスにかかる真のコストを可視化することであり、10時間で$71程度のVM費用だけでプロジェクト全体が完了するかのように錯覚しないことです。
最初から汎用的なプラットフォームを作ろうとしてはなりません。まずは密閉された評価を1回実施し、それが1つの購買、リリース、あるいは導入の決定を明確に変えられるかを証明してください。それが実証できれば、再現性のある組織的プログラムとして展開していくための確固たる根拠が得られます。
AIモデルの性能はどのように評価すべきですか?
まず、その評価がどのような意思決定をサポートするためのものかを明確にし、その業務を代表する独立したテストケースを作成します。モデルを実行する前に評価指標と合格基準を定義し、開発用データとテストデータを完全に分離し、モデルのバージョン、実行環境、プロンプト、スコアリングコード、出力ポリシーを記録します。テスト内容やモデル自体の開示によっていずれかの当事者に不利益が生じる場合は、二重盲検の構成を採用します。
AIモデルの評価者(Evaluator)とは何を指しますか?
定義されたテストケースやスコアリングルールに照らしてモデルの挙動をテストする担当者、組織、またはソフトウェアシステムを指します。DeepMindのパイロットでは、外部組織が機密テストを提供して出力をレビューする一方、プロプライエタリなモデル自体は検証済み環境の内部で保護されたまま維持されました。
AIにおけるモデル評価では何を測定しますか?
タスクの精度、安全動作、拒否対応の品質、頑健性、事実性、バイアス、レイテンシ、コストなど、導入判断に直結する多様な特性を測定できます。セキュアエンクレーブは「誰がテストやモデルを閲覧できるか」を変更するものであり、どの指標が妥当であるかを決定するものではありません。
AIモデルのテストにおけるプロンプトとは何ですか?
管理された条件下で、特定の能力や失敗モードを引き出すために設計された入力データのことです。有用なテストプロンプトには想定される出力やスコアリングルールが設定されており、モデルが事前調整(ファインチューニング)されていない独立したデータセットに含まれます。機密評価においては、モデル開発元に漏洩させてはならない社内ポリシー、脅威情報、ドメイン固有の専門知識がプロンプトに含まれることもあります。
自社の意思決定基準、証跡要件、信頼境界に合わせて設計されたプライベートなモデル評価ワークフローの構築については、AI production systemsをご覧ください。
2026年9月3日







