Valutazione Modelli AI Double-Blind nel 2026: È Possibile Senza Rivelare i Prompt?
È possibile testare modelli AI senza mostrare prompt e pesi? Il pilot di DeepMind protegge i dati. Impatti su procurement, audit e budget.

Sì, un modello AI può ora essere valutato senza consegnare i prompt di test segreti al proprietario del modello né i pesi proprietari al valutatore, quantomeno all'interno di un pilot reale. Google DeepMind ha inserito Gemini 2.5 Flash Lite e benchmark di prompt privati all'interno di un singolo ambiente GPU verificato crittograficamente, consentendo l'uscita solo ai risultati approvati. La linea di costo puro per il calcolo sicuro è di circa $7.08 all'ora ai tassi Spot attuali in Iowa. La voce costosa riguarda le persone: il report tecnico di DeepMind dichiara che il coordinamento legale e la revisione del codice, non l'overhead hardware, sono ora il principale collo di bottiglia. Ciò trasforma la confidential evaluation da una discussione basata sulla fiducia in un progetto di assurance che è possibile quantificare e pianificare a budget.
Sì, ma si tratta di un pilot, non di un prodotto finito
La risposta utile è sì, ma con dei limiti ben precisi. Il pilot del 27 agosto di Google DeepMind dimostra che un'organizzazione esterna può testare un modello chiuso mantenendo separati due asset di grande valore:
- Il valutatore mantiene segreti rispetto al proprietario del modello i prompt di benchmark, le regole di scoring e i casi di fallimento.
- Il proprietario del modello mantiene segreti rispetto al valutatore i pesi del modello e il codice di inferenza, ossia l'architettura centrale del sistema.
I pesi del modello sono i parametri numerici appresi che codificano il comportamento del modello stesso. Un benchmark privato è l'equivalente del testo di un esame. Cedere uno di questi due elementi può distruggere valore economico. Un benchmark trapelato può trasformarsi in materiale di addestramento, facendo apparire migliori i punteggi futuri senza che il modello sia realmente migliorato. Rilasciare i pesi può esporre proprietà intellettuale e capacità che il proprietario ha forti motivi strategici per proteggere.
Immagina questo pilot come un'aula d'esame sigillata dotata di due porte. Il modello entra da una porta. Il test entra dall'altra. Prima che ciascuna parte apra la propria porta, entrambe verificano un certificato firmato che attesta quale stanza, quali serrature e quali regole siano attive. Il test viene eseguito all'interno. La stanza rilascia una scorecard concordata e poi scompare.
Il pilot ha utilizzato Google Cloud Confidential Space, una Confidential VM a3-highgpu-1g, la protezione di memoria Intel TDX, una Confidential GPU NVIDIA H100 80GB e il software PySyft di OpenMined. Una secure enclave è esattamente quella stanza sigillata implementata nell'hardware: la memoria è cifrata durante l'esecuzione del task e un'attestazione firmata permette a entrambe le parti di verificare quale software sia presente all'interno prima di rilasciare qualsiasi dato.

Non siamo davanti a una disponibilità generale (GA). L'annuncio e il report tecnico descrivono un primo pilot, non un servizio di valutazione self-service, un listino prezzi pubblico o una data di rilascio sul mercato.
Come funziona la valutazione modelli AI in modalità double-blind
La crittografia è fondamentale, ma il flusso di lavoro è più facile da comprendere se suddiviso in cinque passaggi di approvazione.
Accordo sull'interfaccia
Il proprietario del modello pubblica un'interfaccia fittizia (mock). Il valutatore può preparare il proprio codice di test su questo template senza ricevere il modello reale. Entrambe le parti concordano inoltre cosa la valutazione possa calcolare e quali risultati abbiano il permesso di uscire.
Avvio della stanza sigillata
Una delle parti avvia un ambiente GPU confidenziale con sistema operativo, runtime e container PySyft approvati. L'hosting della macchina conferisce a tale parte solo il potere di interromperla, non la facoltà di ispezionare i segreti della controparte.
Verifica della stanza
Ciascuna parte verifica la remote attestation, un'impronta digitale firmata dell'intero stack hardware e software. I dati vengono rilasciati solo quando tali misurazioni corrispondono alla configurazione prevista e risultano generate ex novo per l'esecuzione corrente.
Caricamento e approvazione
Il proprietario del modello trasmette in streaming pesi e codice di inferenza cifrati nell'enclave. Il valutatore invia prompt cifrati e codice di valutazione attraverso un canale separato. Entrambi esaminano i percorsi di codice consentiti e approvano l'esecuzione.
Esecuzione, rilascio, cancellazione
L'enclave valuta il modello, rilascia unicamente il risultato autorizzato dalla output policy e viene decommissionato. Le chiavi temporanee di cifratura della memoria scompaiono nel momento stesso in cui l'ambiente viene arrestato.
Il pilot di DeepMind ha eseguito due valutazioni private. La prima ha utilizzato prompt di riserva dal benchmark AILuminate di MLCommons su rischi comprendenti attacchi informatici, contenuti CBRNE, hate speech, autolesionismo e induzione a crimini violenti. La seconda ha impiegato un set di contenuti dannosi focalizzato sul contesto di Singapore, fornito da Singapore AISI. AVERI ha gestito la cifratura e decifratura di prompt e output, incaricando il proprio staff di valutare tali output.
Quest'ultimo dettaglio è essenziale. Double-blind non significa che nessuno veda nulla. Il valutatore conosce il proprio test e può ricevere gli output del modello. La promessa è più circoscritta e pratica: il proprietario del modello non riceve il test riservato, il valutatore non riceve i pesi e l'ambiente cloud è vincolato da policy e hardware.
La voce di budget che cambia
La confidential evaluation non deve essere acquistata come una semplice licenza aggiuntiva per la model observability. Appartiene all'ambito della vendor diligence, del rischio di modello, della sicurezza o del procurement regolamentato.
Gli strumenti di testing convenzionali mostrano la struttura dei costi del software tradizionale. Braintrust propone il piano Pro a $249 per month. LangSmith propone Plus a $39 per seat per month, portando cinque postazioni a $195 per month prima del consumo effettivo. Questi prodotti aiutano un team a gestire ed eseguire test ordinari. Rappresentano riferimenti di prezzo, non sostituti di un audit double-blind.
L'infrastruttura sicura è sorprendentemente chiara da analizzare. Google Cloud specifica che Confidential Space non aggiunge costi separati. In Iowa, il prezzo Spot rilevato per l'istanza a3-highgpu-1g utilizzata nel pilot è di $6.636703068 all'ora, a cui si aggiunge il costo per il confidential computing pari a $0.4391592. In totale, si tratta di circa $7.08 all'ora, ovvero $70.76 per una finestra di dieci ore, al netto di storage e rete.

Il report indica un overhead di calcolo inferiore al 5 percento per l'architettura enclave, evidenziando poi i vincoli procedurali e il coordinamento umano come il fattore limitante principale. È questa la reale conseguenza commerciale. I costi di calcolo sono diventati abbastanza ridotti da poter essere preventivati con precisione. La progettazione della fiducia (trust design) non lo è ancora.
Un budget funzionale comprende cinque voci: compenso per il valutatore, integrazione a carico del proprietario del modello, infrastruttura enclave, accordi legali e revisione di codice e output policy. Se una proposta commerciale mostra soltanto le ore GPU, non è un piano di audit. Se mostra solo ore di consulenza, chiediti perché manchi il livello di esecuzione confidenziale.
Sette casi d'uso, ordinati per ritorno economico
1. Imprese regolamentate che acquistano un modello chiuso
Banche, assicurazioni o gruppi sanitari hanno il caso di business più evidente. Il team di procurement può apportare casi di fallimento proprietari basati su policy e flussi di lavoro aziendali reali. Il fornitore mette a disposizione il modello candidato proprietario. Un valutatore indipendente esegue il test e restituisce una scorecard delimitata senza che nessuna delle due parti rinunci ai propri asset fondamentali.
Il vantaggio è disporre di prove concrete prima di impegnarsi in contratti pluriennali. L'acquirente testa le casistiche cruciali per il proprio business anziché limitarsi ai benchmark pubblici. Il fornitore evita di dover consegnare i pesi o di ricevere prompt riservati che non intende memorizzare.
2. Istituti nazionali per la sicurezza dell'intelligenza artificiale
Un ente governativo di controllo può mantenere prompt relativi a minacce informatiche, biologiche, manipolative o specifici per giurisdizione al di fuori dei sistemi dei laboratori AI, riuscendo comunque a collaudare un modello di frontiera proprietario. Questo riflette da vicino il contesto reale del pilot, in cui Singapore AISI ha contribuito con un set privato di contenuti a rischio.
Il vantaggio è una vita utile più estesa per i benchmark e una base più solida per la vigilanza. Un test segreto rimane valido attraverso molteplici iterazioni di rilascio dei modelli perché non rischia di confluire nei dati di addestramento.
3. Proprietari indipendenti di benchmark
Un'organizzazione specializzata in benchmark può riservare i propri casi più complessi, esporre un'interfaccia mock e sottoporre i fornitori allo stesso ambiente certificato. Potrebbe pubblicare risultati aggregati mantenendo sigillati i singoli prompt.
Il vantaggio risiede in un benchmark che conserva la sua rarità. L'organizzazione può testare un numero maggiore di modelli chiusi senza dover cedere il dataset che costituisce il valore stesso della sua offerta. La vera sfida si sposta sulla output policy, poiché un risultato eccessivamente dettagliato potrebbe rivelare indirettamente la composizione del test.
4. Laboratori di modelli in cerca di una validazione esterna credibile
Una società che sviluppa modelli può consentire a un valutatore accreditato di esaminare un checkpoint privato senza doverlo esportare. Il valutatore fornisce la suite di test, entrambe le parti approvano l'ambiente e le evidenze ottenute possono supportare una due diligence aziendale o una documentazione di sicurezza formale.
Il beneficio è ottenere credibilità senza trasferire fisicamente i pesi. Ciò risulta particolarmente utile quando i test eseguiti solo tramite API esporrebbero il set di prompt del valutatore alla normale infrastruttura del servizio.
5. Team di difesa informatica che testano capacità offensive
Un operatore di infrastrutture critiche può verificare se un modello sia in grado di scoprire, concatenare o illustrare vettori di attacco sensibili tramite prompt che non dovrebbero mai confluire nei dataset riutilizzabili dal fornitore. Il modello resta chiuso, mentre il test rimane circoscritto al programma di sicurezza interno.
Il risultato è una decisione di deployment più affidabile con minor rischio di fuga di prompt. La valutazione richiede comunque una sandbox e una rigorosa policy di emissione dei dati. L'esecuzione confidenziale non rende automaticamente sicuri gli output pericolosi.
6. Sistemi sanitari che convalidano comportamenti specialistici
Un gruppo di ricerca ospedaliero può costruire un insieme riservato di casi limite anonimizzati e approvati, valutando un modello chiuso senza trasmettere tali benchmark alle normali API pubbliche. La scheda di valutazione può concentrarsi sui criteri di rifiuto, escalation e requisiti di evidenza clinica anziché richiedere al modello pareri medici aperti.
Il valore generato consiste in evidenze allineate alle regole operative della struttura sanitaria, proteggendo contestualmente sia i casi clinici sia il modello proprietario. Normative sulla privacy, comitati etici e data governance continuano ad applicarsi interamente. Un enclave rappresenta una misura di controllo, non un certificato di conformità legale.
7. Due diligence tecnica in operazioni di partnership e M&A
Un acquirente che valuta l'acquisizione di una società di intelligenza artificiale può portare flussi di lavoro proprietari direttamente dalla data room, mentre la società target mette a disposizione il proprio modello riservato. Un valutatore neutrale esegue i test concordati e fornisce un responso ristretto solo ai destinatari autorizzati.
Il ritorno economico si traduce in una minore divulgazione di asset prima della chiusura della transazione e in una ridotta dipendenza da demo preconfezionate. I costi di setup rendono questo approccio ideale per accordi commerciali strategici o partnership di piattaforma, non per scouting preliminare di fornitori.
Tre prodotti che vale la pena costruire

1. Un laboratorio per il procurement di modelli privati: l'opportunità primaria
Costruire un servizio gestito in cui un acquirente operante in settori regolamentati fornisce test di accettazione riservati, un fornitore mette a disposizione un modello chiuso e il servizio restituisce un pacchetto di attestazione con validità formale. Il cliente tipo è un Chief Risk Officer, un team di model risk management, un responsabile della sicurezza o un gruppo di acquisti strategici.
La domanda di mercato è quantificabile: ai governance platform registra 1,600 ricerche mensili negli Stati Uniti, con stime di offerta per la parte superiore della pagina comprese tra $27.92 e $71.51. La query mostra anche una crescita del 307 percento su base annua nei dati aggregati. Gli acquirenti sono alla ricerca di infrastrutture di governance. Un laboratorio di procurement trasforma questo bisogno generico in una decisione ad alto valore supportata da un esito crittograficamente firmato.
La versione minima commerciabile (MVP) include un singolo modello, una suite di test privati, un set di metriche approvate, un'esecuzione attestata e un report formale pronto per il consiglio di amministrazione. Si parte come servizio ad alto contatto umano supportato da software per l'ingestione e la generazione di prove. L'ostacolo principale è la reputazione: servono competenze avanzate di sicurezza aziendale, credibilità come valutatori terzi, padronanza delle tecnologie cloud, contrattualistica legale solida e un'affidabilità che nessuna dashboard può simulare.
2. Un control plane di attestazione per valutazioni AI
Sviluppare un software che trasformi hash crittografici, nonce, identità delle immagini, approvazioni di policy e ricevute di esecuzione in un registro di controllo facilmente verificabile. I clienti ideali sono valutatori o produttori di modelli in grado di gestire infrastrutture di confidential computing ma intenzionati a evitare che ogni progetto si trasformi in una complessa implementazione crittografica personalizzata.
La query confidential computing registra 880 ricerche mensili negli Stati Uniti con un CPC di $30.80. Il pubblico è più ristretto rispetto al settore generico della governance, ma il profilo dell'acquirente è prettamente tecnico e la problematica da risolvere comporta spese ingenti. L'obiettivo a lungo termine delineato nel report di DeepMind punta a una conferma fiduciaria immediata che mascheri la complessità delle catene di dipendenze e delle chiavi crittografiche.
L'MVP verifica un'architettura standard basata su Google Cloud Confidential Space, traccia le autorizzazioni di entrambe le parti, le associa all'immagine software misurata ed esporta un manifest firmato dell'esecuzione. Il punto critico è la dipendenza dall'hardware e dai singoli cloud provider. Integrare un diverso stack di enclave non equivale ad aggiungere un semplice connettore software: comporta la revisione dell'intera root of trust, dei formati di certificazione e della gestione degli errori.
3. Un marketplace sigillato per benchmark proprietari
Creare una piattaforma in cui i proprietari di benchmark espongono ciò che un determinato test è in grado di misurare senza rivelarne le istanze, consentendo agli sviluppatori di modelli di acquistare un'esecuzione certificata che restituisca unicamente le metriche concordate. Chi crea benchmark monetizza i propri set di prompt rari senza distribuirli; chi realizza modelli accede a test indipendenti senza dover esporre i propri pesi proprietari.
La keyword ai model evaluation genera 140 ricerche mensili negli Stati Uniti, con KD 0 e una crescita annua del 200 percento nei dati analizzati. Pur non trattandosi di volumi da mercato di massa, tali valori giustificano un posizionamento enterprise mirato, in particolare quando l'offerta ruota attorno all'accesso verificato ad alto livello di fiducia piuttosto che a licenze a basso costo.
L'MVP richiede un unico partner proprietario di benchmark, uno sviluppatore di modelli, una specifica immagine enclave e una chiara politica di emissione dei risultati. Il rischio principale è la fuga di dati per estrazione progressiva: ripetendo le interrogazioni e variando parametri e granularità delle metriche, è teoricamente possibile ricostruire un benchmark segreto. Meccanismi di rate limiting, granularità dei dati in output e monitoraggio continuo costituiscono funzionalità centrali del prodotto, non semplici clausole contrattuali.
Il laboratorio per il procurement rappresenta il modello di business iniziale più promettente perché intercetta un budget già esistente e finalizzato a una scelta precisa: approvare, respingere o rinegoziare l'acquisto di un modello. Le restanti due opzioni costituiscono infrastrutture di supporto rilevanti, ma richiedono la maturazione di un ecosistema più ampio prima di esprimere appieno il proprio valore economico.
I problemi che questa tecnologia non risolve
Questo pilot dimostra che la riservatezza bilaterale è tecnicamente attuabile. Non rende tuttavia la valutazione automatica, universalmente economica o del tutto indipendente da terze parti fidate.
- Non è un servizio self-service. DeepMind non ha pubblicato alcuna data di rilascio commerciale né un listino prezzi per il pilot.
- Ha collaudato un singolo modello chiuso su una H100. Il report cita la gestione di cluster confidenziali multi-nodo basati su H100 o B200 come obiettivo futuro per i modelli di dimensioni superiori.
- Non è un'architettura trustless a livello assoluto. Il modello presuppone l'assenza di collusione tra cloud provider e produttore dell'hardware. Il firmware proprietario chiuso rimane parte integrante della catena di fiducia.
- Google rimane parte del processo di verifica. Il pilot si è affidato ai sistemi di firma e validazione di Google e le build dell'ambiente ospite non risultavano riproducibili in modo del tutto indipendente poiché facevano uso di chiavi di firma private.
- Porzioni del codice del modello sono rimaste opache. Il team non ha potuto rendere ispezionabile o inserire in whitelist ogni metodo proprietario. AVERI ha accettato tale compromesso per le finalità di questo pilot.
- Un test inadeguato rimane inadeguato anche se sigillato. L'enclave tutela la riservatezza dei prompt e la coerenza dell'esecuzione. Non garantisce in alcun modo che il benchmark misuri i parametri corretti o che il punteggio ottenuto sia predittivo delle prestazioni in produzione.
- Gli output richiedono policy di riservatezza dedicate. Risultati eccessivamente analitici possono esporre parti del benchmark o svelare dettagli sul funzionamento del modello. Entrambe le parti devono concordare i limiti informativi consentiti prima dell'esecuzione.
- Il costo delle risorse umane non diminuisce. Il documento individua negli accordi legali, nella revisione del codice e nella gestione tra le parti la principale causa di rallentamento operativo.
Per i team impegnati nella scelta degli strumenti software di valutazione, la guida agli strumenti di benchmark audit illustra le soluzioni ordinarie disponibili. La valutazione double-blind si colloca a un livello superiore, intervenendo quando modello, dati di test o entrambi risultano troppo sensibili per consentire verifiche tramite le consuete API.
La mia valutazione è pragmatica: siamo di fronte a un modello di assurance solido e innovativo, non ancora a una categoria merceologica acquistabile tramite tariffari pubblici. I primi ad adottarlo saranno le organizzazioni chiamate a prendere decisioni critiche sull'impiego dei modelli, in contesti in cui l'affidabilità certificata del risultato giustifica ampiamente i costi di coordinamento.
Il piano d'azione per lunedì
Se ti occupi di procurement di AI, gestione del rischio o sicurezza, individua una decisione di acquisto o adozione che dovrai finalizzare nei prossimi 30 giorni. Prepara un documento di sintesi di una singola pagina indicando il modello da testare, una categoria specifica di fallimento, il titolare dei prompt, il proprietario dei pesi, le metriche ammesse in uscita e la decisione strategica che tale metrica andrà a determinare.
Chiedi quindi a un valutatore terzo e al fornitore del modello di quotare separatamente cinque elementi: integrazione tecnica, lavoro del valutatore, accordi legali, revisione del codice e dell'output policy, infrastruttura confidenziale. Utilizza il parametro di circa $7.08 per ora GPU esclusivamente come stima di base per il calcolo grezzo. Lo scopo è mettere a nudo il costo effettivo dell'assurance, evitando di considerare i circa $71 necessari per dieci ore di istanza virtuale come il totale dell'investimento.
Non partire con l'obiettivo di realizzare un'infrastruttura generica. Dimostra inizialmente che una singola procedura di valutazione modelli AI protetta può guidare efficacemente una specifica scelta di acquisto, rilascio o deployment operativo. Una volta validato questo processo, avrai la giustificazione economica per strutturare un programma continuativo e scalabile.
Come valutare le prestazioni di un modello di intelligenza artificiale?
Parti dalla decisione operativa che la valutazione deve supportare, quindi struttura dataset di test riservati (held-out) che rispecchino tale contesto applicativo. Definisci le metriche e le soglie di fallimento prima di eseguire il modello, mantieni una rigorosa separazione tra dati di addestramento e dati di test, e traccia versione del modello, ambiente di esecuzione, prompt, codice di scoring e output policy. Ricorri a un'architettura double-blind se l'esposizione del test o dei pesi compromette la riservatezza delle parti coinvolte.
Cos'è un valutatore di modelli AI?
Può indicare una persona, un ente indipendente o una soluzione software incaricata di verificare il comportamento di un modello rispetto a casi di prova prestabiliti e a regole di scoring codificate. Nel pilot di DeepMind, organizzazioni esterne hanno fornito test riservati e verificato gli output elaborati, mentre il modello proprietario è rimasto confinato e protetto all'interno di un ambiente sicuro e certificato.
Cosa misura la valutazione di un modello nell'intelligenza artificiale?
Può misurare l'accuratezza nell'esecuzione di un compito, il comportamento sul fronte della sicurezza, l'adeguatezza delle risposte di rifiuto (refusal), la robustezza, la fattualità, la presenza di bias, la latenza computazionale, i costi operativi o qualsiasi altro indicatore collegato a una decisione di produzione. Un enclave sicuro modifica la visibilità di test e pesi, ma non determina quali metriche siano rilevanti per l'applicazione finale.
Cos'è un prompt per il test di modelli AI?
È un input strutturato per fare emergere una capacità specifica o una determinata modalità di fallimento in condizioni rigorosamente controllate. Un prompt di test funzionale è associato a un risultato atteso o a una regola di scoring precisa e fa parte di un dataset isolato su cui il modello non è stato ottimizzato. In contesti ad alta criticità, il prompt può incorporare policy interne, vettori di minaccia o know-how proprietario che non devono assolutamente essere divulgati al fornitore del modello.
Se vuoi progettare un flusso di lavoro per la valutazione privata dei modelli allineato alle tue decisioni operative, alle tue esigenze probatorie e ai tuoi vincoli di sicurezza, scopri i sistemi di produzione AI.
3 set 2026







