Оценка моделей ИИ без раскрытия промптов и весов: разбор пилота Google DeepMind 2026

Пилот DeepMind защищает тестовые промпты и веса моделей. Что это меняет для аудита, закупок ИИ и бюджета защищенных вычислений.

Thursday, September 3, 2026Omid Saffari
Оценка моделей ИИ без раскрытия промптов и весов: разбор пилота Google DeepMind 2026

Да, модель ИИ теперь можно протестировать без передачи секретных тестовых промптов владельцу модели и без раскрытия проприетарных весов аудитору — по крайней мере, в рамках реального пилота. Google DeepMind поместила Gemini 2.5 Flash Lite и закрытые бенчмарк-промпты внутрь криптографически верифицированной GPU-среды, позволив выгружать наружу исключительно согласованные результаты. Чистые затраты на защищенные вычисления составляют около $7.08 в час по текущим спотовым ставкам в Iowa. Дорогая статья — это люди: в техническом отчете DeepMind указано, что юридическое согласование и ревью кода, а не аппаратные накладные расходы, стали главным узким местом. Это переводит конфиденциальное тестирование из абстрактных разговоров о доверии в понятный проект подтверждения надежности с четкими сроками и бюджетом.

Да, но это рабочий пилот, а не готовая кнопка в сервисе

Практический ответ — да, но с оговорками. Пилот Google DeepMind от 27 августа показал, что внешняя организация может тестировать закрытую модель, полностью изолируя два критически ценных актива:

  • Аудитор сохраняет в тайне от разработчика модели бенчмарк-промпты, правила скоринга и сценарии сбоев.
  • Владелец модели сохраняет в тайне от аудитора веса модели и код инференса — основу всей архитектуры.

Веса модели — это полученные в процессе обучения числовые параметры, определяющие поведение нейросети. Закрытый бенчмарк — это экзаменационный билет. Утечка любого из этих компонентов уничтожает ценность. Скомпрометированный бенчмарк рискует попасть в обучающую выборку, и будущие оценки вырастут без реального улучшения модели. Утечка весов грозит потерей интеллектуальной собственности и технологических преимуществ, которые бизнес стремится защитить.

Представьте этот пилот как изолированную экзаменационную комнату с двумя отдельными дверями. Модель входит через одну дверь. Тестовые задания подаются через другую. До того как двери откроются, обе стороны проверяют подписанный сертификат, гарантирующий параметры комнаты, замков и правил проверки. Тест проходит внутри. Комната отдает наружу согласованную ведомость оценок и бесследно уничтожается.

В пилоте использовались Google Cloud Confidential Space, виртуальная машина a3-highgpu-1g Confidential VM, защита оперативной памяти Intel TDX, один Confidential GPU NVIDIA H100 80GB и программный стек PySyft от OpenMined. Безопасный анклав — это и есть та самая изолированная комната, реализованная на уровне железа: память шифруется во время выполнения процесса, а подписанная аттестация позволяет обеим сторонам удостовериться в подлинности программного обеспечения до передачи данных.

Схема потоков данных: секретные веса модели и закрытые промпты поступают с разных сторон в верифицированный GPU-анклав
Владелец модели предоставляет веса, аудитор передает промпты, а из верифицированного анклава выходят только утвержденные результаты.

Это еще не общедоступный релиз. Анонс и технический отчет описывают первый пилотный эксперимент, а не self-service платформу с публичным прайс-листом или датой запуска.

Как устроена двойная слепая оценка моделей ИИ

Криптография здесь фундаментальна, но саму процедуру проще представить как цепочку из пяти последовательных согласований.

  1. Согласование интерфейса

    Владелец модели публикует мок-интерфейс. Аудитор готовит тестовый код под эту заглушку, не имея прямого доступа к настоящей нейросети. Стороны заранее утверждают правила вычислений и список метрик, разрешенных к выводу.

  2. Запуск изолированной среды

    Одна из сторон разворачивает конфиденциальную GPU-среду с утвержденной операционной системой, средой выполнения и контейнером PySyft. Хостинг машины дает право остановить процесс, но не позволяет перехватить чужие секреты.

  3. Верификация окружения

    Каждый участник запрашивает удаленную аттестацию (remote attestation) — цифровой отпечаток аппаратного и программного стека. Данные передаются только после подтверждения идентичности и актуальности запущенного окружения.

  4. Загрузка и авторизация

    Владелец модели загружает в анклав зашифрованные веса и код инференса. Аудитор передает зашифрованные промпты и логику скоринга по отдельному защищенному каналу. Обе стороны валидируют разрешенные пути исполнения кода и одобряют старт.

  5. Выполнение, вывод и очистка

    Анклав запускает бенчмарк, отдает исключительно те метрики, которые согласованы политикой экспорта (output policy), и уничтожается. Временные ключи шифрования памяти стираются при остановке инстанса.

В рамках эксперимента DeepMind провела две закрытые оценки. В первой применялись резервные промпты бенчмарка MLCommons AILuminate, охватывающего угрозы кибератак, материалов CBRNE, языка вражды, самоповреждения и подстрекательства к преступлениям. Во второй использовался набор данных Singapore AISI, сфокусированный на региональном деструктивном контенте. Организация AVERI отвечала за шифрование и расшифровку промптов и итоговых данных, а эксперты проводили оценку полученных ответов.

Эта деталь принципиальна. Двойная слепая процедура не означает, что никто ничего не видит. Тестировщик знает структуру собственного теста и может анализировать сгенерированные ответы модели. Главная гарантия строже: владелец модели не получает доступа к закрытому тесту, аудитор не видит весов, а облачная среда жестко ограничена на уровне аппаратного обеспечения и политик доступа.

Новая строка в бюджете на безопасность

Конфиденциальное тестирование не должно закупаться как очередная лицензия на инструмент мониторинга нейросетей. Его место — в аудите поставщиков, управлении модельными рисками, процедурах комплаенса или корпоративных закупках.

Обычные инструменты оценки показывают привычный уровень затрат на софт. Braintrust предлагает план Pro за $249 в месяц. LangSmith продает тариф Plus по цене $39 за рабочее место в месяц, то есть пять мест обходятся в $195 в месяц без учета расхода токенов. Такие платформы помогают командам администрировать повседневные тесты. Это ценовые ориентиры для стандартной разработки, но не замена независимому слепому аудиту.

Стоимость защищенной инфраструктуры вполне прозрачна. Google Cloud заявляет, что сервис Confidential Space не требует отдельной платы. В регионе Iowa цена на спотовый инстанс конфигурации a3-highgpu-1g составляет $6.636703068 в час, а наценка за конфиденциальные вычисления равна $0.4391592. Суммарно это около $7.08 в час, или $70.76 за 10-часовое окно тестирования без учета дисков и сетевого трафика.

Уровень затратЦеновой ориентирЧто входит в стоимость
Регулярное ПО для оценки$39 за место или $249 в месяцВнутренние тесты, скоринг, трейсинг и командные процессы
Конфиденциальная инфраструктура с 1x H100Около $7.08 в часИзолированная вычислительная среда пилота
10-часовое защищенное окноОколо $70.76Базовая виртуальная машина и конфиденциальная надбавка
Аудитор, интеграция модели, юристы, ревью кодаНет публичной цены пилотаЭкспертная работа, обеспечивающая юридическую силу
Сравнение затрат: подписки на софт для оценки, аренда защищенных GPU и стоимость экспертного ревью
Аренда аппаратного анклава легко поддается расчету. Однако отчет называет юридическое сопровождение и проверку кода главным узким местом.

В отчете указано, что накладные вычислительные расходы архитектуры анклава составляют менее 5 процентов, тогда как процедурные барьеры и человеческая координация остаются главным фактором задержек. В этом и заключается суть: железо стало достаточно дешевым, чтобы рассчитать смету за пару минут. Разработка архитектуры доверия таких ценников еще не имеет.

Реалистичный бюджет строится из пяти пунктов: гонорар аудитора, трудозатраты вендора на интеграцию, инфраструктура анклава, юридический договор и проверка кода с политикой экспорта данных. Если вам предлагают аудит, где учтены только часы GPU, это не план проверки. Если смета состоит только из консультационных часов — поинтересуйтесь, где слой криптографически защищенного исполнения.

Семь сценариев применения, ранжированных по выгоде

1. Регулируемые корпорации при закупке закрытых моделей

Банки, страховые гиганты и медицинские сети получают максимальную выгоду. Департамент закупок готовит закрытую выборку сценариев сбоев, основанную на внутренних регламентах компании. Разработчик предоставляет проприетарную модель. Независимый аудитор проводит запуск и возвращает верифицированный отчет без раскрытия активов сторон.

Результат — обоснованные выводы перед заключением многолетних контрактов. Заказчик тестирует реальные пограничные сценарии своего бизнеса вместо изучения публичных лидербордов. Разработчик не передает веса и не получает доступ к чувствительным внутренним данным заказчика.

2. Национальные институты безопасности искусственного интеллекта

Государственные регуляторы могут тестировать закрытые frontier-модели на устойчивость к генерации кибератак, биологических угроз или манипуляций, не раскрывая свои тестовые сценарии лабораториям. Это повторяет конфигурацию пилота, где Singapore AISI использовал закрытую региональную базу деструктивных промптов.

Результат — продление жизненного цикла бенчмарка и надежный инструмент надзора. Секретный тест остается объективным на протяжении многих релизов, поскольку гарантированно не утекает в интернет и обучающие выборки.

3. Независимые владельцы бенчмарков

Организации, составляющие бенчмарки, могут держать самые сложные задачи в закрытом пуле, публиковать лишь мок-интерфейс и прогонять модели вендоров через стандартизированный анклав. Они получают возможность отдавать агрегированные метрики, сохраняя сами задания в тайне.

Результат — сохранение эксклюзивности тестовых данных. Аналитики могут тестировать десятки закрытых нейросетей, не обесценивая свой главный датасет. Сложность смещается в сторону output policy: излишне детализированный отчет может косвенно выдать содержание самих задач.

4. ИИ-лаборатории, привлекающие независимый аудит

Разработчики моделей могут пригласить признанную аудиторскую группу протестировать закрытый чекпоинт без необходимости передавать саму нейросеть третьей стороне. Аудитор готовит стресс-тест, обе стороны заверяют анклав, а итоговый протокол служит доказательством надежности для корпоративных клиентов.

Результат — официальное подтверждение параметров надежности без физической передачи модели. Это критично, когда тестирование через открытый API несет риск утечки промптов аудитора во внутренние логи провайдера.

5. Команды кибербезопасности при анализе наступательного потенциала

Операторы критической инфраструктуры могут проверить, способна ли нейросеть находить уязвимости или проектировать векторы атак, используя реальные эксплойты, которые недопустимо отправлять в сторонние API. Модель остается изолированной, а боевые сценарии не покидают периметр службы безопасности.

Результат — взвешенное решение о внедрении без риска утечки векторов атак. Сама проверка требует жесткой песочницы: аппаратная изоляция вычислений не делает сгенерированный опасный код безопасным для внешнего использования.

6. Медицинские центры при валидации узкопрофильных систем

Клинические институты могут сформировать пул обезличенных сложных диагнозов и пограничных медицинских случаев для валидации закрытой модели без передачи этих кейсов в сторонние облака. Итоговый отчет может фокусироваться на корректности отказов, эскалации на врача и аргументации решений.

Результат — проверка модели по строгим медицинским протоколам без риска нарушения законов о персональных данных. При этом анклав является техническим средством защиты, а не автоматической индульгенцией регуляторов.

7. Технический аудит в сделках слияний и поглощений (M&A)

Инвестор или покупатель технологической компании может принести на аудит закрытые сценарии из deal room, а стартап — свою проприетарную разработку. Независимая сторона запускает сценарии и выдает лаконичное резюме соответствия заявленным показателям.

Результат — минимизация раскрытия коммерческой тайны до закрытия сделки и уход от слепого доверия к маркетинговым демо. Сложность развертывания делает этот подход актуальным для крупных сделок и стратегических партнерств.

Три перспективных продукта на базе технологии

Схема границ доверия: защищенные промпты, веса и память в сопоставлении с зависимостями от производителей оборудования, ключей подписи и ревью кода
Анклав изолирует активы, однако производители оборудования, центры сертификации и проверяющие код эксперты остаются внутри модели доверия.

1. Лаборатория конфиденциального аудита моделей для закупок

Управляемый сервис, где корпоративный заказчик загружает закрытые приемочные тесты, вендор передает защищенную модель, а система формирует верифицированный аудиторский отчет. Целевая аудитория — директора по рискам, подразделения model risk management, службы безопасности и тендерные комитеты.

Интерес рынка очевиден: запрос ai governance platform собирает 1,600 поисков в месяц в США при ставках за клик от $27.92 до $71.51. По данным поисковых подсказок, динамика выросла на 307 процентов в годовом исчислении. Бизнес ищет решения для контроля за ИИ. Платформа для закупок упаковывает этот запрос в четкую процедуру с юридически значимым результатом.

Минимальный жизнеспособный продукт (MVP) включает одну поддерживаемую модель, один закрытый набор тестов, фиксированный пакет метрик, верифицированный прогон и отчет для совета директоров. Начинать стоит как консалтинговый сервис с собственной платформой загрузки и отчетности. Основной барьер — доверие. Потребуются экспертиза в облачной безопасности, юридические шаблоны и репутация, которую невозможно сымитировать красивым дашбордом.

2. Панель управления аппаратной аттестацией для тестирования ИИ

Программный комплекс, трансформирующий криптографические хеши, одноразовые коды (nonces), идентификаторы образов и согласования политик в понятный аудиторский журнал. Клиентами выступают тестовые лаборатории и разработчики моделей, способные арендовать защищенные серверы, но не желающие превращать каждый аудит в сложный криптографический проект с нуля.

Запрос confidential computing насчитывает 880 поисков в месяц в США при цене за клик $30.80. Аудитория здесь уже, но она технически подкована и готова платить за готовые решения. Долгосрочная цель из отчета DeepMind — создать простой сигнал доверия, скрывающий сложность цепочек сертификации и ключей.

MVP должен проверять конфигурацию Google Cloud Confidential Space, фиксировать согласования обеих сторон, сопоставлять их с хешем запущенного ПО и формировать подписанный цифровой манифест. Барьер — привязка к конкретному оборудованию и облаку: интеграция нового типа анклавов меняет корень доверия (root of trust) и форматы свидетельств.

3. Биржа закрытых бенчмарков

Маркетплейс, где составители тестов описывают направленность проверок без публикации заданий, а разработчики нейросетей оплачивают защищенный прогон, получая утвержденные метрики. Авторы тестов монетизируют датасеты без риска их утечки. Вендоры подтверждают качество в независимой среде без риска раскрытия весов.

Запрос ai model evaluation генерирует 140 запросов в месяц в США при сложности KD 0 и росте интереса на 200 процентов в год. Для массового рынка этого мало, но для нишевого enterprise-решения вполне достаточно, особенно при продаже высокобюджетного доступа вместо дешевых подписок.

Для MVP достаточно одного партнера с бенчмарком, одного вендора модели, единого образа анклава и регламентированной output policy. Основной риск — раскрытие тестов через множественные прогоны. Большое число повторных запросов и гранулярных срезов позволяет вычислить исходные задачи. Ограничение частоты запросов и огрубление выдачи метрик — фундаментальные функции продукта, а не технические детали.

Лаборатория конфиденциального аудита для закупок — самый перспективный бизнес на старте: он решает задачу, под которую у бизнеса уже выделены бюджеты (одобрение, отклонение или торг по условиям контракта на закупку ИИ). Два других направления представляют собой инфраструктуру, которой для взрывного роста требуется сформированная экосистема.

Какие проблемы эта технология пока не решает

Эксперимент доказал жизнеспособность взаимной изоляции данных. Однако он не делает аудит моделей автоматическим, дешевым или независимым от третьих лиц.

  • Это не публичный SaaS-сервис. DeepMind не назвала дату релиза и не опубликовала коммерческие расценки.
  • Пока протестирована одна закрытая модель на одном GPU H100. В отчете указано, что поддержка крупных моделей на многоузловых кластерах H100 или B200 относится к будущим задачам.
  • Система не является абсолютно trustless. Архитектура опирается на предположение, что облачный провайдер и производитель чипов не действуют в сговоре. Проприетарные прошивки процессоров остаются в периметре доверия.
  • Google сохраняет роль валидатора. Пилот опирался на инфраструктуру подписи Google, а образы гостевой ОС не подлежали независимой воспроизводимой сборке из-за использования закрытых ключей подписи.
  • Часть кода модели оставалась закрытой. Инженерам не удалось сделать прозрачными все проприетарные методы исполнения. Организация AVERI приняла данное ограничение в рамках пилота.
  • Изоляция плохого теста не делает его хорошим. Анклав гарантирует тайну промптов и неизменность среды исполнения. Но он не доказывает, что тест релевантен бизнес-задаче или прогнозирует поведение модели в проде.
  • Выходные данные требуют отдельной цензуры. Слишком подробные результаты выдачи могут раскрыть как содержание бенчмарка, так и специфику работы весов.
  • Высокие затраты на людей никуда не делись. Отчет прямо указывает, что юридические договоры, аудит кода и координация между участниками стали главным сдерживающим фактором.

Для команд, выбирающих стек тестирования сегодня, наше руководство по аудиту бенчмарков нейросетей описывает базовый инструментарий. Двойная слепая оценка применяется уровнем выше — когда модель или тестовые данные слишком чувствительны для стандартного тестирования через API.

Мой вывод однозначен: перед нами надежный паттерн аудита, но пока еще не сформированный продуктовый сегмент. Первыми его заказчиками станут организации с высокими ставками принимаемых решений, где цена ошибки при внедрении модели многократно превосходит затраты на сложную координацию.

План действий на понедельник

Если вы курируете закупку нейросетей, управление модельными рисками или кибербезопасность, выберите одно решение по внедрению ИИ, запланированное на ближайшие 30 дней. Составьте одностраничный бриф закрытой оценки: согласуйте модель, одну группу критических сбоев, владельца промптов, держателя весов, финальную метрику для экспорта и управленческое решение, зависящее от этой цифры.

Затем запросите у внешней лаборатории и разработчика модели раздельную оценку по пяти пунктам: техническая интеграция, экспертные часы аудиторов, юридический договор, проверка кода и политик вывода, а также защищенная инфраструктура. Используйте ставку около $7.08 за GPU-час только как ориентир «железа». Ваша цель — увидеть полную смету процесса верификации, а не тешить себя иллюзией, что 10-часовая аренда виртуалки за $71 покроет весь аудит.

Не пытайтесь строить универсальную инфраструктуру с нуля. Проверьте на практике, способна ли одна изолированная оценка повлиять на конкретную закупку или запуск системы. Если гипотеза подтвердится, у вас появится рабочий фундамент для системного масштабирования процессов.

Как оценивается производительность и надежность модели ИИ?

Определите управленческое решение, которому должен служить аудит, и подготовьте отложенную тестовую выборку реальных сценариев. Зафиксируйте пороговые метрики отказов до запуска, изолируйте обучающие данные от тестовых и задокументируйте версию модели, программное окружение, промпты, алгоритмы скоринга и политику экспорта. Применяйте двойную слепую схему, если передача тестов или весов несет коммерческие или регуляторные риски.

Что представляет собой аудитор моделей ИИ?

Это эксперт, специализированная организация или программная система, проверяющая поведение нейросети на соответствие установленным правилам и тестам. В пилоте DeepMind сторонние организации готовили закрытые тестовые наборы и анализировали метрики, пока проприетарная модель оставалась изолированной внутри доверенного анклава.

Что именно измеряет оценка моделей ИИ?

Она измеряет точность выполнения задач, безопасность генерации, корректность отказов на небезопасные запросы, устойчивость к атакам, фактологическую точность, галлюцинации, задержки и стоимость инференса. Безопасный анклав лишь разграничивает видимость данных между сторонами, но выбор метрик остается за человеком.

Что такое тестовый промпт для нейросетей?

Это входной запрос, спроектированный для проверки конкретной способности модели или выявления критических сбоев в контролируемых условиях. Качественный тестовый промпт содержит эталонный критерий оценки и входит в закрытый датасет, на котором модель не дообучалась. В чувствительных проверках такой промпт может содержать внутренние регламенты, векторы кибератак или ноу-хау компании.

Если вам требуется организовать защищенный процесс тестирования моделей с четкими границами доверия и проверяемыми метриками, изучите архитектуру production-систем ИИ.

Последнее обновление

3 сент. 2026 г.

КатегорияAI

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.