Évaluer un modèle IA sans exposer ses prompts en 2026
Oui, l'évaluation en double aveugle protège prompts et poids. Découvrez ce que le pilote DeepMind change pour les audits IA et les budgets.

Oui, il est désormais possible d'évaluer un modèle IA sans révéler de prompts de test confidentiels à l'éditeur du modèle, ni céder les poids propriétaires à l'évaluateur — du moins dans le cadre d'un pilote en conditions réelles. Google DeepMind a isolé Gemini 2.5 Flash Lite et des prompts de benchmark privés au sein d'un environnement GPU vérifié cryptographiquement, en n'autorisant que la sortie de résultats validés. La facture brute de calcul sécurisé s'élève à environ $7.08 par heure aux tarifs Spot actuels dans l'Iowa. La ligne budgétaire la plus lourde reste humaine : le rapport technique de DeepMind indique que la coordination juridique et la revue de code, et non la surcharge matérielle, constituent désormais le véritable goulot d'étranglement. Cela transforme l'évaluation confidentielle : d'une négociation basée sur la confiance, elle devient un projet d'assurance qualité chiffrable et planifiable.
Oui, mais il s'agit d'un pilote et non d'un produit clé en main
La réponse utile est oui, mais avec des limites claires. Le pilote du 27 août de Google DeepMind prouve qu'une organisation tierce peut tester un modèle propriétaire fermé tout en séparant strictement deux actifs stratégiques :
- L'évaluateur garde les prompts de benchmark, les règles d'évaluation et les cas d'échec secrets vis-à-vis du fournisseur du modèle.
- Le fournisseur du modèle conserve les poids et le code d'inférence — le cœur de sa technologie — secrets vis-à-vis de l'évaluateur.
Les poids d'un modèle représentent les valeurs numériques apprises qui dictent son comportement. Un benchmark privé est le sujet d'examen. Divulguer l'un ou l'autre détruit de la valeur. Un benchmark qui fuite peut servir de données d'entraînement, gonflant artificiellement les scores futurs sans que le modèle ne progresse réellement. Révéler des poids expose une propriété intellectuelle et des capacités que l'éditeur a d'excellentes raisons de protéger.
Considérez ce pilote comme une salle d'examen scellée munie de deux portes. Le modèle entre par l'une. Le test entre par l'autre. Avant que l'une des parties n'ouvre sa porte, chacune vérifie un certificat signé attestant de la configuration de la salle, des verrous et des règles établies. Le test s'exécute à l'intérieur. La pièce ne libère qu'une grille de résultats convenue, puis s'autodétruit.
Le pilote s'est appuyé sur Google Cloud Confidential Space, une Confidential VM de type a3-highgpu-1g, la protection mémoire Intel TDX, un Confidential GPU NVIDIA H100 80GB et la suite logicielle PySyft d'OpenMined. Une enclave sécurisée n'est rien d'autre que cette salle scellée concrétisée au niveau matériel : la mémoire est chiffrée pendant l'exécution, et une attestation signée permet aux deux parties de vérifier la pile logicielle interne avant de débloquer la moindre donnée.

Nous ne sommes pas face à une disponibilité générale. L'annonce officielle et le rapport technique détaillent une première expérimentation, et non un service d'évaluation en libre-service avec des tarifs publics ou une date de lancement commercial.
Comment fonctionne l'évaluation en double aveugle
La cryptographie sous-jacente est essentielle, mais le workflow s'articule plus simplement autour de cinq validations successives.
S'accorder sur l'interface
Le fournisseur du modèle met à disposition une interface fictive (mock). L'évaluateur peut ainsi préparer son code de test face à cette structure sans accéder au modèle réel. Les deux parties s'accordent également sur ce que l'évaluation est autorisée à calculer et sur les résultats qui pourront sortir.
Démarrer la salle scellée
Une partie lance un environnement GPU confidentiel intégrant le système d'exploitation, l'environnement d'exécution et le conteneur PySyft préalablement validés. Héberger la machine confère le pouvoir de l'interrompre, mais nullement celui d'inspecter les secrets de l'autre partie.
Vérifier l'environnement
Chaque partie contrôle l'attestation distante, une empreinte cryptographique signée de la pile matérielle et logicielle. Les données ne sont débloquées que si ces mesures correspondent exactement à la configuration convenue et sont certifiées fraîches pour cette session.
Charger et valider
Le fournisseur du modèle injecte les poids chiffrés et le code d'inférence dans l'enclave via un flux sécurisé. L'évaluateur transmet les prompts chiffrés et le code d'évaluation via un canal distinct. Les deux parties examinent les chemins de code autorisés et valident l'exécution.
Exécuter, restituer, effacer
L'enclave évalue le modèle, exporte uniquement le résultat autorisé par la politique de sortie, puis est détruite. Les clés éphémères de chiffrement de la mémoire s'effacent dès l'arrêt de l'environnement.
Le pilote de DeepMind a mené deux évaluations privées distinctes. La première a exploité des prompts de réserve issus du benchmark AILuminate de MLCommons, ciblant des risques majeurs : cyberattaques, menaces CBRNE, discours de haine, automutilation et incitation au crime violent. La seconde a mobilisé un corpus de contenus illicites axé sur Singapour, fourni par le Singapore AISI. AVERI a pris en charge le chiffrement et le déchiffrement des prompts et des résultats, tout en mandatant ses équipes pour évaluer ces sorties.
Ce dernier détail a son importance. Le principe du double aveugle ne signifie pas que personne n'observe quoi que ce soit. L'évaluateur connaît ses propres tests et peut consulter les réponses produites par le modèle. La promesse est plus précise et pragmatique : l'éditeur du modèle n'a pas accès au test confidentiel, l'évaluateur n'obtient pas les poids, et l'environnement cloud est strictement bridé par le matériel et les politiques de sécurité.
Comment évaluer un modèle IA transforme la ligne budgétaire
L'évaluation confidentielle ne doit pas être traitée comme une simple licence d'observabilité logicielle supplémentaire. Elle relève des audits de conformité des fournisseurs, de la gestion des risques de modèles, de l'assurance sécurité ou des achats réglementés.
Les outils d'évaluation classiques illustrent les budgets logiciels traditionnels. Braintrust propose son forfait Pro à $249 per month. LangSmith affiche son offre Plus à $39 per seat per month, soit $195 per month pour cinq utilisateurs avant les coûts d'usage. Ces solutions aident une équipe à structurer ses tests internes. Elles servent de repères tarifaires, mais ne remplacent pas un audit en double aveugle.
L'infrastructure sécurisée s'avère étonnamment accessible. Google Cloud précise que Confidential Space n'ajoute aucun surcoût spécifique. Dans la région Iowa, le tarif Spot relevé pour l'instance a3-highgpu-1g du pilote est de $6.636703068 par heure, auquel s'ajoute le surcoût lié au confidential computing de $0.4391592. Au total, cela représente environ $7.08 par heure, soit $70.76 pour une session de dix heures, hors stockage et bande passante.

Le rapport relève une surcharge de calcul inférieure à 5 percent pour l'architecture en enclave, pointant plutôt les démarches procédurales et la coordination humaine comme premier obstacle. C'est là que réside l'enjeu économique. La puissance de calcul se budgétise précisément. L'ingénierie de la confiance, en revanche, ne s'improvise pas.
Un budget réaliste comprend cinq postes : les honoraires de l'évaluateur, l'intégration côté fournisseur de modèle, l'infrastructure d'enclave, le cadrage juridique, et l'audit conjoint du code et des politiques de sortie. Un devis qui ne mentionne que des heures GPU n'est pas un plan d'audit sérieux. S'il ne liste que du conseil sans couche d'exécution confidentielle, interrogez-vous sur la sécurité réelle du dispositif.
Sept cas d'usage, classés par retour sur investissement
1. Grandes entreprises réglementées achetant un modèle fermé
Les banques, assureurs et organisations de santé présentent le cas métier le plus évident. Leurs équipes d'achats peuvent injecter des scénarios d'échec privés inspirés de processus et règles réels. Le fournisseur soumet son modèle propriétaire candidat. Un tiers indépendant exécute le test et transmet une synthèse chiffrée sans qu'aucune des parties n'abandonne son actif stratégique.
Le gain réside dans une décision d'achat validée avant tout engagement pluriannuel. L'acquéreur éprouve les contextes critiques pour son activité au lieu de se fier à des classements publics. Le fournisseur évite de diffuser ses poids ou de récupérer des prompts sensibles qu'il ne souhaite pas archiver.
2. Instituts nationaux de sécurité et de sûreté de l'IA
Une agence étatique d'évaluation peut préserver des prompts critiques (menaces cyber, risques biologiques, manipulation ou contraintes réglementaires locales) hors des systèmes des laboratoires d'IA, tout en testant un modèle de pointe fermé. Ce cadre reflète précisément le pilote mené avec le Singapore AISI, qui a fourni un jeu d'évaluation spécifique.
Le bénéfice se traduit par une durée de vie prolongée des benchmarks et un contrôle réglementaire renforcé. Un examen tenu secret reste pertinent sur plusieurs générations de modèles, le risque d'ingestion dans les données d'entraînement étant neutralisé.
3. Gestionnaires indépendants de benchmarks
Un organisme de certification peut réserver ses cas les plus sélectifs, exposer uniquement une interface mock et soumettre différents éditeurs au même banc de test attesté. Il peut ainsi publier des scores agrégés tout en conservant chaque prompt sous scellé.
L'intérêt réside dans la préservation de la valeur du benchmark. L'organisme teste un plus grand nombre de modèles fermés sans dilapider le jeu de données qui fait sa réputation. Le point d'attention se reporte sur la politique d'export : un compte-rendu excessivement détaillé pourrait permettre de déduire les questions en filigrane.
4. Laboratoires de modèles en quête d'une certification tierce
Un éditeur d'IA peut autoriser un auditeur reconnu à évaluer une version préliminaire privée sans jamais exporter cette version. L'auditeur fournit le jeu d'épreuve, les deux entités valident l'environnement d'exécution, et les conclusions obtenues viennent étayer une analyse de conformité d'entreprise ou un dossier de sûreté.
Le gain est d'ordre réputationnel, sans dispersion de propriété intellectuelle. Cette approche évite également qu'un audit réalisé via une API standard n'expose les prompts de l'auditeur à la télémétrie de l'infrastructure de production.
5. Équipes de cyberdéfense évaluant les capacités offensives
Le responsable de la sécurité d'une infrastructure d'importance vitale peut vérifier si un modèle parvient à détecter, enchaîner ou documenter des vecteurs d'attaque sensibles, à l'aide de prompts qui ne doivent en aucun cas enrichir les données d'un tiers. Le modèle demeure scellé, tandis que le test reste confiné au système d'information de l'entreprise.
Cela débouche sur un arbitrage de déploiement lucide avec un risque nul de fuite de prompts. L'évaluation exige tout de même un bac à sable strict et une régulation stricte des sorties. L'exécution confidentielle n'assainit pas automatiquement un résultat dangereux à l'export.
6. Établissements de santé validant des comportements métiers
Un pôle de recherche hospitalier peut concevoir une batterie d'anomalies cliniques anonymisées et éprouver un modèle fermé sans faire transiter ces dossiers médicaux par des API cloud publiques. La grille de notation peut alors sanctionner les refus injustifiés, les mécanismes d'escalade médicale et la vérification des sources, plutôt que de solliciter un avis médical génératif sans garde-fous.
L'évaluation s'aligne fidèlement sur les exigences opérationnelles du secteur hospitalier tout en protégeant les données de santé et le modèle tiers. Le secret médical, l'expertise des praticiens et la gouvernance des données demeurent indispensables. Une enclave constitue un mécanisme de sécurité, pas une dispense de conformité réglementaire.
7. Audits techniques lors de fusions, acquisitions et partenariats
Un acquéreur menant l'audit d'une entreprise d'IA peut utiliser des flux de données confidentiels issus de la data room, tandis que la cible fournit son modèle propriétaire. Un évaluateur neutre conduit les tests prédéfinis et ne transmet qu'un rapport calibré aux décideurs habilités.
L'opération limite les divulgations d'informations préalables au closing et évite de s'en remettre à des démonstrations commerciales préparées. Compte tenu des coûts d'initialisation, cette démarche convient aux opérations de fusion-acquisition stratégiques et aux alliances technologiques majeures, plutôt qu'au sourcing de fournisseurs courants.
Trois opportunités de produits à développer

1. Un laboratoire privé pour l'approvisionnement en modèles
Développer un service géré au sein duquel un donneur d'ordre réglementé dépose ses critères de recette confidentiels, le fournisseur fournit un modèle fermé, et la plateforme délivre un dossier d'assurance attesté. La cible comprend les directeurs des risques (CRO), les cellules de gestion du risque algorithmique, les directions de la sécurité et les achats stratégiques.
La demande du marché est explicite : la requête ai governance platform enregistre 1,600 recherches mensuelles aux États-Unis, avec des enchères de haut de page estimées entre $27.92 et $71.51. Ce volume d'intérêt a progressé de 307 percent en un an selon les données de tendances. Les décideurs recherchent des fondations de gouvernance tangibles. Un laboratoire d'audit transforme cette attente diffuse en un arbitrage structuré et certifié.
La version minimale viable (MVP) : un modèle, une famille de tests privés, un ensemble resserré d'indicateurs certifiés, une exécution attestée et une synthèse exploitable par un conseil d'administration. Lancez l'activité sous la forme d'une prestation de services adossée à une application de collecte et de reporting. Le défi central est la crédibilité : l'offre requiert une sécurité de niveau bancaire, des auditeurs réputés, une maîtrise avancée du cloud, des contrats types éprouvés et une autorité technique qu'aucun tableau de bord ne peut simuler.
2. Un plan de contrôle d'attestation pour les évaluations IA
Concevoir un logiciel qui consolide les condensats (hashes), les nonces, les identifiants d'images logicielles, les validations de chartes et les journaux d'exécution dans un registre auditable. Les clients cibles sont les évaluateurs indépendants et les éditeurs de modèles disposant d'infrastructures sécurisées, mais refusant que chaque audit devienne un projet de cryptographie sur mesure.
La requête confidential computing cumule 880 recherches par mois aux États-Unis avec un CPC de $30.80. L'audience est plus ciblée que celle de la gouvernance globale, mais le profil acheteur est éminemment technique et confronté à des dépenses d'ingénierie élevées. L'ambition à long terme formulée par le rapport de DeepMind vise précisément un indicateur de confiance simplifié, masquant la complexité des clés et des empreintes de dépendances.
Le MVP vérifie une architecture Google Cloud Confidential Space, enregistre les validations mutuelles, les relie à l'image logicielle mesurée et génère un manifeste d'exécution signé. La difficulté repose sur l'hétérogénéité des composants cloud et matériels. Prendre en charge une nouvelle enclave ne se résume pas à développer un simple connecteur : cela modifie la racine de confiance, les formats de preuve et les scénarios de défaillance.
3. Une place d'échange de benchmarks sous scellés
Bâtir une place de marché où les éditeurs de benchmarks répertorient les compétences évaluées par leurs tests sans dévoiler leurs items, permettant aux créateurs de modèles d'acquérir une session d'exécution attestée ne restituant que les indicateurs autorisés. Les concepteurs de tests valorisent leurs prompts rares sans les diffuser. Les éditeurs de modèles accèdent à des audits indépendants sans livrer leurs poids.
L'expression ai model evaluation totalise 140 recherches mensuelles aux États-Unis (KD 0) et affiche 200 percent de hausse annuelle dans les suggestions de recherche. Bien qu'il s'agisse d'un marché de niche, ces volumes justifient une approche B2B ciblée, particulièrement pour une offre commercialisant un accès hautement sécurisé plutôt qu'un abonnement logiciel standard.
Le MVP nécessite un créateur de benchmark partenaire, un éditeur de modèle, une image d'enclave standardisée et une charte de sortie stricte. Le risque principal réside dans les fuites par requêtage répété. Une répétition excessive d'évaluations et une granularité de métriques trop fine peuvent permettre de reconstituer le benchmark sous-jacent. Les plafonds d'appels, la finesse des scores et la gouvernance des données constituent des attributs produit fondamentaux, et non de simples mentions légales.
Le laboratoire d'approvisionnement privé représente la proposition la plus prometteuse à court terme, car elle répond à un arbitrage assorti d'un budget identifié : approuver, refuser ou renégocier un contrat de modèle IA. Les deux autres projets apportent des briques d'infrastructure indispensables, mais exigent un écosystème mature pour déployer toute leur valeur.
Ce que cette technologie ne résout pas
Le pilote prouve la faisabilité d'une confidentialité réciproque. Il ne rend pas pour autant l'évaluation automatique, économique ou exempte de toute chaîne de confiance humaine.
- Ce n'est pas un service en libre-service. DeepMind n'a communiqué aucun calendrier de mise sur le marché ni grille tarifaire pour ce pilote.
- L'essai portait sur un seul modèle fermé hébergé sur un unique H100. Le rapport cite la mise en cluster de plusieurs nœuds H100 ou B200 comme un chantier futur indispensable pour les architectures de plus grande envergure.
- Le système n'est pas "sans confiance" (trustless). Le modèle repose sur l'hypothèse que l'opérateur cloud et le fondeur de semi-conducteurs ne s'entendent pas. Les micrologiciels propriétaires (firmwares) font partie intégrante de la chaîne de confiance.
- Google intervient directement dans la chaîne de certification. L'expérimentation a mobilisé les infrastructures de signature et de vérification de Google, et les environnements invités n'étaient pas reproductibles de manière indépendante car alimentés par des clés de signature privées.
- Certaines portions du modèle sont restées opaques. L'équipe n'a pas pu rendre l'intégralité du code d'inférence propriétaire inspectable ou soumise à une liste blanche stricte. AVERI a validé cette réserve technique pour le périmètre du pilote.
- Un mauvais test sous scellé demeure un mauvais test. L'enclave garantit la confidentialité des prompts et l'intégrité de l'exécution. Elle ne préjuge pas de la pertinence métier du benchmark ni de la capacité du score à anticiper les performances en production.
- Les résultats exigent une politique de confidentialité dédiée. Des bilans trop détaillés risquent de trahir le contenu des prompts ou les singularités du modèle. Les deux parties doivent impérativement s'accorder sur les métriques exportables avant l'exécution.
- Le facteur humain reste déterminant. Le rapport technique rappelle que la formalisation des accords juridiques, l'audit de code et les échanges inter-entreprises représentent le frein opérationnel majeur.
Pour les organisations évaluant des solutions de test actuelles, notre guide des outils d'audit de benchmarks IA détaille l'offre logicielle standard. L'évaluation en double aveugle se positionne à un échelon supérieur, dès lors que le modèle, le protocole de test ou les données s'avèrent trop sensibles pour un transit par des API conventionnelles.
Mon analyse est nette : nous sommes devant une méthode d'assurance technique robuste, et non face à une offre logicielle prête à l'emploi. Ses premiers adoptants seront les structures confrontées à des choix de modèles critiques, pour lesquelles le coût d'une décision erronée surpasse largement les dépenses de coordination d'un tel dispositif.
La feuille de route pour lundi
Si vous pilotez la stratégie d'achat d'IA, la gestion des risques de modèles ou la sécurité des systèmes d'information, isolez une décision relative à un modèle devant intervenir dans les 30 prochains jours. Rédigez un cadrage d'évaluation confidentielle d'une page précisant le modèle cible, un domaine de criticité précis, l'entité détentrice des prompts, celle détenant les poids, l'indicateur synthétique autorisé à l'export et l'arbitrage conditionné par cette métrique.
Demandez ensuite à un auditeur et au fournisseur du modèle d'établir un devis détaillant séparément cinq postes : l'intégration logicielle, le temps d'expertise de l'évaluateur, la convention juridique, la revue du code et des règles de restitution, et l'infrastructure confidentielle. Considérez le coût d'environ $7.08 par heure de GPU uniquement comme une estimation du calcul brut. L'objectif est de mesurer le coût complet de l'assurance technique, sans imaginer qu'une session de dix heures sur une VM à $71 couvre la totalité de la démarche.
Ne cherchez pas à développer une plateforme généraliste d'emblée. Démontrez d'abord qu'un audit scellé permet de trancher une décision concrète d'acquisition, de mise en production ou de rejet. C'est sur cette preuve opérationnelle que vous bâtirez un programme d'évaluation pérenne.
Comment évaluer la performance d'un modèle d'IA ?
Partez de l'arbitrage opérationnel que cette mesure doit éclairer, puis constituez un jeu d'épreuve représentatif isolé des phases d'apprentissage. Définissez les indicateurs cibles et les seuils d'acceptabilité avant d'interroger le modèle, préservez une séparation stricte entre données d'entraînement et de test, puis consignez la version du modèle, l'environnement d'exécution, les prompts, la logique de notation et les règles d'export des résultats. Recourez à un dispositif en double aveugle dès lors que l'exposition des tests ou du modèle présente un risque pour l'une des parties.
Qu'est-ce qu'un évaluateur de modèle d'IA ?
Ce terme désigne un expert, une institution tierce ou un dispositif logiciel chargé de mesurer le comportement d'un modèle face à des scénarios de test et des barèmes d'évaluation définis. Dans le pilote mené par DeepMind, des organismes externes ont fourni des batteries de tests confidentiels et validé les réponses produites, tandis que le modèle propriétaire demeurait confiné dans un environnement matériel certifié.
Que mesure précisément l'évaluation d'un modèle en IA ?
Elle quantifie l'exactitude des tâches, la sûreté des réponses, la pertinence des refus, la robustesse aux attaques, la véracité factuelle, les biais éventuels, la latence ou les coûts opérationnels rattachés à une décision de déploiement. L'usage d'une enclave sécurisée régit les droits d'accès aux tests et aux poids du modèle, mais n'influe pas sur la légitimité des critères d'évaluation choisis.
Qu'est-ce qu'un prompt de test pour modèles d'IA ?
Il s'agit d'une consigne conçue pour révéler une aptitude spécifique ou provoquer une défaillance dans des conditions d'observation rigoureuses. Un prompt de test pertinent intègre un résultat attendu ou une règle de scoring, et appartient à un corpus strictement disjoint des données ayant servi à l'ajustement du modèle. Dans le cadre d'un audit sensible, ce prompt peut également encapsuler des règles de gestion internes, des scénarios de cybermenaces ou un savoir-faire métier qui ne doivent jamais être divulgués à l'éditeur du modèle.
Pour structurer un protocole d'évaluation de modèle privé aligné sur vos exigences de décision, vos critères de preuve et vos impératifs de sécurité, découvrez notre accompagnement sur les systèmes d'IA en production.
3 sept. 2026







