ИИ-агенты для работы с компьютером: лучшие модели 2026 года

Выбираем модель для ИИ-агентов, работающих с компьютером в 2026 году: GPT-5.6 Sol, Claude Opus 5, Gemini 3.7 Flash и DeepSeek — цены и риски.

Wednesday, September 2, 2026Omid Saffari
ИИ-агенты для работы с компьютером: лучшие модели 2026 года

GPT-5.6 Sol — лучшая универсальная модель, если нужны ИИ-агенты для работы с компьютером в 2026 году. Но для задачи с 50,000 входных и 5,000 выходных токенов ее нормализованная стоимость без учета остальной инфраструктуры составит $0.40. При той же структуре токенов Gemini 3.7 Flash обойдется в $0.05625, а DeepSeek V4-Flash-Vision-Exp — в $0.0143–$0.0286. Выбирайте вариант с минимальной стоимостью принятой задачи, а не с самой низкой ценой токена.

ИИ-агенты для работы с компьютером: лучшие мультимодальные ИИ-модели

Эти четыре мультимодальные ИИ-модели решают разные задачи управления компьютером. GPT-5.6 Sol, Claude Opus 5 и Gemini 3.7 Flash предлагают специальный инструмент с готовым циклом действий. DeepSeek V4-Flash-Vision-Exp дает визуальную модель и обычный вызов инструментов, однако сами компьютерные действия, исполнитель, подтверждения и восстановление после ошибок придется реализовать в приложении.

Цены проверены 22 августа 2026 года. Под «начальной ценой» понимается прямой тариф API за миллион токенов в формате «вход/выход». Если не указано иное, сюда не входят хостинг исполнителя, плата за инструменты, повторные попытки и проверка человеком.

ИнструментДля чего подходит лучше всегоНачальная ценаБесплатный пробный доступ
GPT-5.6 SolЛучший заявленный результат в управлении компьютером$5/$30 за млн токеновБесплатного API-тарифа нет
Claude Opus 5Управляемая корпоративная автоматизация браузера и рабочего стола$5/$25 за млн токеновНебольшой кредит для новых пользователей
Gemini 3.7 FlashСамый дешевый вариант с готовым инструментом управления компьютером$0.75/$3.75 за млн токенов до 31 дек.Для Computer Use — нет
DeepSeek V4-Flash-Vision-ExpБюджетные агентные системы с собственной обвязкой$0.22/$0.66 вне пиковых часовНе заявлен

Итоговый рейтинг:

  1. GPT-5.6 Sol — лучший универсальный выбор, если цена ошибки высока и нужен самый сильный из опубликованных результатов по управлению компьютером в этой подборке.
  2. Claude Opus 5 лучше подходит для корпоративного контроля, когда структура страницы, автоматическое подтверждение при инъекции промпта, работа с данными или допустимость в регулируемой среде важнее лидерства в бенчмарке.
  3. Gemini 3.7 Flash — самый выгодный вариант с готовым инструментом для обратимой автоматизации в браузере, на мобильных устройствах и рабочем столе. Сама модель имеет статус GA, но Computer Use по-прежнему находится в Preview.
  4. DeepSeek V4-Flash-Vision-Exp задает нижнюю границу цены для технической команды, у которой уже есть исполнитель и система оценки. Это экспериментальное визуальное ядро, а не готовая система управления компьютером.

Не стоит покупать модель лишь потому, что она умеет найти кнопку на скриншоте. Промышленный агент должен распознать состояние, предложить разрешенное действие, выполнить его в изолированной среде, увидеть результат, восстановиться после ошибки и остановиться для подтверждения перед действием с последствиями. Лучшей будет модель, которая замыкает весь этот цикл с минимальным приемлемым риском.

Выбор за минуту

Для дорогостоящих задач сначала пробуйте GPT-5.6 Sol: одно неверно распознанное состояние, ошибочная координата или неудачное восстановление могут отнять у оператора несколько минут. OpenAI сообщает о результате Sol 62.6% в OSWorld 2.0. Это опубликованный самим разработчиком бенчмарк, а не гарантия такой же работы в вашей CRM, системе обработки страховых случаев или настольном приложении. Тем не менее среди этих четырех актуальных вариантов показатель самый высокий.

Выбирайте Claude Opus 5, если уровень контроля — часть самого продукта. Текущий набор инструментов Anthropic включает 17 действий, выполняемых на стороне клиента, умеет объединять несколько действий в один ход, добавляет отдельный браузерный инструмент для чтения структуры страницы и автоматически проверяет скриншоты на возможную инъекцию промпта. Computer Use теперь имеет статус GA в Claude API, поэтому один существенный барьер для закупки исчез. Но средой и выполнением действий по-прежнему управляет ваше приложение.

Для обратимого процесса, где нужна готовая схема действий, а цена должна оставаться у нижней границы, берите Gemini 3.7 Flash. При принятой здесь нагрузке его нормализованная стоимость токенов гораздо ниже, чем у Sol. Google также возвращает намерение действия и решение системы безопасности — полезные сигналы для подтверждения и журналирования. Компромисс связан со статусом: Gemini 3.7 Flash уже GA, но функция Computer Use остается в Preview, и Google не рекомендует использовать ее для чувствительных или необратимых операций без тщательного надзора.

DeepSeek V4-Flash-Vision-Exp имеет смысл лишь тогда, когда необходимость «самостоятельно построить недостающий контур управления» звучит как преимущество. Даже пиковая цена токенов ниже текущего Standard-тарифа Gemini, а 100 скриншотов максимального размера на входе стоят не более $0.016896 в пиковые часы без учета текста и выхода. Низкая цена действительно важна — как и отсутствие фирменного инструмента компьютерных действий. Команда без готовой браузерной или настольной обвязки должна считать разработку и безопасность самостоятельным продуктом, а не первоначальной настройкой.

Схема выбора между GPT-5.6, Claude, Gemini и DeepSeek для задач управления компьютером
Сначала оцените риск задачи и необходимый уровень контроля, а затем выбирайте модель.

Тест 22 секунд: почему цена токена не равна цене задачи

Агент, работающий по скриншотам, — это цикл, а не единичный инференс. Приложение отправляет снимок экрана и состояние. Модель отвечает одним действием или короткой последовательностью. Исполнитель запускает ее, после чего приложение фиксирует новое состояние и снова обращается к модели. Каждый ход может добавлять токены изображений, описания инструментов, результаты действий, задержку и еще одну возможность для восстановления.

Поэтому опубликованная цена входных токенов — лишь нижняя граница. Для закупки важна другая метрика:

Стоимость принятой задачи = (токены модели + плата за инструменты + время исполнителя + проверка человеком + повторы) / число принятых результатов.

Ключевое слово здесь — «принятая». Задача не считается завершенной только потому, что так заявила модель. Результат должен пройти детерминированную проверку или соответствовать четкому стандарту человеческого контроля. При заполнении формы это может означать, что каждое поле совпадает с исходной записью, а финальная отправка ожидает подтверждения. Для визуального QA — что целевой сценарий пройден, ожидаемый элемент появился, а подтверждающий скриншот сохранен.

Чтобы сопоставить тарифы API, возьмем одну нормализованную задачу с 50,000 суммарных тарифицируемых входных токенов и 5,000 выходных токенов. Во входной объем включены скриншоты, определения инструментов, предыдущие состояния и результаты. Это не прогноз для любого процесса, а единая линейка сравнения.

  • Токены GPT-5.6 Sol стоят $0.40.
  • Claude Opus 5 — $0.375.
  • Gemini 3.7 Flash на тарифе Standard Paid — $0.05625 до 31 декабря 2026 года.
  • DeepSeek V4-Flash-Vision-Exp — $0.0143 вне пиковых часов или $0.0286 в пиковые часы для входа без попадания в кеш.

Для 1,000 отправленных задач нижняя граница составит $400 у Sol, $375 у Opus 5, $56.25 у Gemini и от $14.30 до $28.60 у DeepSeek. Сюда не входят исполнитель и отдельные тарифы провайдеров на инструменты. Кроме того, расчет предполагает одинаковый тарифицируемый объем токенов, но не одинаковую долю успеха.

Столбчатая диаграмма нормализованной стоимости токенов моделей для управления компьютером
Стоимость только модели для 50K тарифицируемых входных и 5K выходных токенов. Для DeepSeek взят пиковый тариф.

Теперь учтем трудозатраты. При полной стоимости работы оператора $60 в час одна минута стоит $1. Наценка Sol в $0.3714 относительно пикового тарифа DeepSeek равна 22.284 секунды работы. Для Claude разница составляет 20.784 секунды, для Gemini — 1.659 секунды.

В этом и состоит тест 22 секунд: если Sol экономит 22 секунды проверки, переделки или восстановления после сбоя на каждую отправленную задачу, наценка за его токены относительно пиковой цены DeepSeek исчезает. На 1,000 задач Sol потребует на $371.40 больше токенов и должен сэкономить около 6.19 часа работы оператора для выхода в ноль. Одно вмешательство нередко занимает больше времени: человеку нужно открыть журнал, разобраться в состоянии, исправить ошибку и перезапустить процесс.

Тест не доказывает, что Sol действительно сэкономит эти секунды. Он показывает, что именно нужно измерять. Бенчмарк способен обосновать пилот, но бюджет подтвердит только ваш журнал времени восстановления.

Дополнительные расходы конкретных провайдеров меняют нижнюю границу:

  • Если задача OpenAI вызывает 20 тарифицируемых компьютерных действий, текущий тариф $2.50 за 1,000 вызовов добавит $0.05 еще до оплаты хостинга исполнителя.
  • Стандартный набор компьютерных инструментов Claude Opus 5 добавляет около 4,520 входных токенов к запросу без кеша — это $0.0226 по базовому входному тарифу. Около 6,610 токенов браузерного набора стоят $0.03305. Кеширование промпта может сократить повторные расходы, но ориентироваться следует на фактически тарифицированное использование, а не на предположение, что кеш сработает в каждом ходе.
  • Gemini тарифицирует Computer Use по обычным ставкам выбранной модели, включая выходные токены и токены рассуждений. Долгое обдумывание может сделать выходную часть больше, чем в простой линейке из 5,000 токенов.
  • DeepSeek ограничивает каждое изображение 384 входными токенами, но ваша схема действий, ответы исполнителя, повторы и проверки безопасности все равно требуют денег и инженерного времени вне этой строки.

Для более общей маршрутизации по цене изучите сравнение самых дешевых ИИ-API, где разобраны модели без управления экраном. Для Computer Use нужен отдельный бюджет: скриншоты, переходы между состояниями и восстановления накапливаются с каждым ходом.

1. GPT-5.6 Sol: лучший выбор, когда ошибки обходятся дорого

GPT-5.6 Sol — передовая мультимодальная модель OpenAI и лучший отправной вариант, если восстановление после ошибок компьютерного агента связано с ощутимыми затратами. Алиас gpt-5.6 направляет запросы в Sol. Модель принимает изображения, поддерживает контекстное окно в 1,050,000 токенов и работает с актуальным инструментом computer в Responses API.

Документация OpenAI по управлению компьютером с GPT-5.6
Управление компьютером с GPT-5.6 Sol

OpenAI сообщает для Sol результат 62.6% в OSWorld 2.0, тогда как у Terra — 50.2%, а у Luna — 45.6%. OSWorld оценивает агента, который работает с настольными программами, поэтому этот бенчмарк ближе к рассматриваемой покупке, чем общая проверка чата. Но результат все равно получен в тестовой среде OpenAI. Используйте его как повод включить Sol в пилот, а не как разрешение отказаться от собственных приемочных тестов.

Сильные стороны Sol

Главное преимущество текущей интеграции OpenAI — гибкость. Модель может изучать скриншоты и возвращать компьютерные действия через встроенный инструмент либо работать с пользовательскими инструментами и контуром выполнения кода. Поэтому техническая команда способна начать с браузера Playwright, а затем перейти к полноценной виртуальной машине, когда процесс затронет нативные настольные приложения.

В актуальном руководстве уровню безопасности уделено должное внимание. OpenAI рекомендует изолированный браузер или VM, пустое унаследованное окружение, по возможности отключенные расширения и доступ к локальной файловой системе, а также явное подтверждение действий с последствиями. Агенту предписано останавливаться, если содержимое экрана похоже на инъекцию промпта. Это инструкции по реализации, а не автоматическая защита, но они задают более безопасные исходные условия для пилота.

Оптимальный сценарий — ценный, обратимый процесс со сложными интерфейсами. Например, финансовой команде средней компании нужно собрать данные из трех веб-порталов, сверить их с исходной записью и подготовить проводку к подтверждению. Наценка Sol оправданна, если более уверенное отслеживание состояния и восстановление устраняют хотя бы небольшую часть ручной доработки. Для стабильной формы с неизменными элементами, данные в которую можно передать через API, платить ее невыгодно.

Тарифы OpenAI

У OpenAI есть три актуальных уровня GPT-5.6 с поддержкой управления компьютером:

  • GPT-5.6 Sol: $5.00 за миллион входных токенов, $0.50 за миллион кешированных входных токенов и $30.00 за миллион выходных токенов.
  • GPT-5.6 Terra: $2.00 за миллион входных токенов, $0.20 за миллион кешированных входных токенов и $12.00 за миллион выходных токенов.
  • GPT-5.6 Luna: $0.20 за миллион входных токенов, $0.02 за миллион кешированных входных токенов и $1.20 за миллион выходных токенов.

Инструмент управления компьютером может добавить $2.50 за 1,000 тарифицируемых вызовов, а токены встроенных инструментов оплачиваются по ставке выбранной модели. Поддерживаемого бесплатного API-тарифа для Sol нет.

Линейка позволяет удобно распределять задачи по цене и качеству. Сначала установите верхнюю планку с Sol. Затем повторите тот же набор принятых задач на Terra. Переносите класс задач на Terra, только если показатели выполнения и проверки остаются в заданных пределах. Luna гораздо дешевле, однако заявленный разработчиком результат OSWorld у нее ниже. Ее стоит использовать для ограниченных и обратимых процессов после проверки критериев приемки, а не назначать по умолчанию лишь из-за значительно более дешевых входных токенов.

Как безопасно провести пилот Sol

  1. Выберите один ограниченный процесс

    Возьмите задачу с четким начальным состоянием, детерминированной проверкой результата и отсутствием необратимых действий до подтверждения. Подойдут QA браузера, сбор доказательств и подготовка записи к проверке. На первой оценке не разрешайте покупки, удаление, публикацию или окончательную отправку.

  2. Зафиксируйте среду

    Используйте изолированный профиль браузера, контейнер или VM. Удалите унаследованные переменные окружения, по возможности отключите расширения и доступ к локальным файлам, внесите обязательные домены в список разрешенных и предоставьте только необходимые задаче учетные данные.

  3. Определите подтверждения до запуска

    Заранее перечислите действия, которые всегда должен одобрять человек: например, отправку сообщения, принятие условий, изменение данных аккаунта или финансовое обязательство. Паузу обеспечивает исполнитель, а не текст модели.

  4. Журналируйте состояние и приемку

    Сохраняйте исходное состояние, каждый скриншот, предложенное и выполненное действие, результат инструмента, остановку по безопасности, финальное состояние и результат приемки. Заключительное сообщение модели само по себе проверкой не считается.

  5. Переходите на более дешевую модель только после успеха Sol

    С помощью Sol определите достижимый уровень выполнения и проверки. Затем сравните Terra и Luna на тех же задачах, в той же среде и с теми же правилами подтверждения. Оставьте Sol маршрутом эскалации для сценариев, на которых более дешевые уровни не справляются.

Лучше всего для: Ценной многошаговой работы в браузере или на рабочем столе, где восстановление после сбоя обходится дорого.
Главное преимущество: OpenAI сообщает о 62.6% в OSWorld 2.0 — лучшем опубликованном актуальном результате для управления компьютером среди этих четырех вариантов.
Цена: Sol $5/$30, Terra $2/$12 и Luna $0.20/$1.20 за миллион входных/выходных токенов плюс применимые тарифы на вызовы инструментов.
Бесплатный пробный доступ: Поддерживаемого бесплатного API-тарифа для Sol нет.

Сильные стороны
Что получается хорошо
8 points

  • Самый сильный опубликованный результат в бенчмарке управления компьютером среди этих четырех вариантов.
  • Единая схема инструмента в Responses API для всей линейки GPT-5.6 упрощает маршрутизацию между качеством и ценой.
  • Актуальные рекомендации охватывают изолированное исполнение, инъекции промпта, списки разрешенных ресурсов и подтверждение действий с последствиями.
  • Sol, Terra и Luna дают широкий ценовой диапазон без замены окружающей обвязки.
  • В этом сравнении Sol имеет самую высокую нормализованную стоимость задачи на уровне модели.
  • Вызовы компьютерного инструмента могут тарифицироваться отдельно.
  • Клиенту все равно нужно создать или подключить браузер, VM, исполнитель действий, приемочные проверки и журналы.
  • Лидерство во внутреннем бенчмарке провайдера не доказывает надежность в закрытом приложении.

Кому не подойдет: Не назначайте Sol исполнителем по умолчанию, когда есть детерминированный API, задача дешевая и крайне однообразная либо Terra, Luna или Gemini проходят тот же порог приемки. Не стоит платить за передовую модель, чтобы нажимать стабильный элемент, с которым обычная автоматизация справится безопаснее.

2. Claude Opus 5: лучший для управляемой корпоративной автоматизации

Claude Opus 5 — лучший выбор, если уровень контроля при работе с компьютером не менее важен, чем качество самой модели. Anthropic перевела Computer Use в общую доступность Claude API 20 августа 2026 года и одновременно представила новый инструмент Browser Use. Текущий computer_toolset_20260801 предоставляет 17 инструментов, выполняемых на стороне клиента, через одно объявление и не требует бета-заголовка.

Документация Claude Platform по актуальному набору инструментов управления компьютером
Управление компьютером с Claude Opus 5

Разница между Computer Use и Browser Use имеет практическое значение. Первый инструмент воспринимает скриншоты и управляет полноценным рабочим столом через мышь и клавиатуру. Второй дополнительно читает структуру страницы и взаимодействует с конкретными веб-элементами, поэтому лучше подходит для процессов внутри веб-приложений. Структурные данные помогают точнее найти поле или кнопку, чем одни координаты экрана.

Оба инструмента по-прежнему исполняются на стороне клиента. Claude не подключается к рабочему столу самостоятельно. Ваше приложение запускает каждое действие в контейнере, VM или управляемом браузере, возвращает результат и снова вызывает модель. Сейчас Computer Use недоступен внутри Claude Managed Agents, поэтому ожидать от Anthropic хостинга всей настольной сессии — значит ошибиться в границах продукта.

Почему Claude лидирует по контролю

Claude может вернуть несколько компьютерных действий за один ход модели. Исполнитель запускает их последовательно и останавливается при первой ошибке. Это сокращает повторные обращения к модели для безопасной цепочки вроде «нажать, ввести, посмотреть». Но пакетное выполнение не годится там, где между действиями нужно проверить состояние. Если нажатие может открыть не тот аккаунт, агент должен увидеть результат до начала ввода.

Anthropic также применяет классификаторы скриншотов: они могут обнаружить предполагаемую инъекцию промпта и попросить модель запросить подтверждение перед следующим действием. От этого механизма можно отказаться через поддержку, но настройка по умолчанию полезна при работе с недоверенными страницами. Классификатор — дополнительный слой защиты, а не замена разрешенным доменам, границам доступа к учетным данным или подтверждению на уровне исполнителя.

С данными теперь тоже проще, чем во время бета-тестирования. Клиент управляет хранением скриншотов, действий и файлов, а Anthropic указывает, что Computer Use поддерживает режим нулевого хранения данных. Функцию также можно использовать для рабочих нагрузок, регулируемых HIPAA, в рамках BAA Anthropic. Само по себе это не делает приложение соответствующим требованиям, но может снять ограничение на уровне модели при закупке для здравоохранения.

Такой набор хорошо подходит для страховых случаев, страхования, финансов и операционных процессов, где системе приходится работать с программой без удобного API, а заказчику нужны подтверждения каждого действия. Anthropic приводит пример клиента Asteroid: его самый длинный процесс обработки страхового случая сократился с 32 минут до 13 минут, стоимость задачи снизилась примерно на 30%, а завершение достигло 100% без изменений промпта. Это результат конкретного клиента, а не ожидаемый показатель новой системы. Но он демонстрирует полезную для измерения связь: меньше ходов цикла и более точное наведение способны изменить операционные расходы, а не только оценку модели.

В подробном разборе стоимости нескольких действий Claude объясняется, когда пакет действий экономит деньги, а когда между ними по-прежнему обязательно наблюдение.

Тарифы Claude

Актуальный набор инструментов поддерживает Sonnet 5, Opus 5, Fable 5, доступный ограниченному кругу Mythos 5 и Opus 4.8. Текущая линейка выглядит так:

  • Claude Sonnet 5: $2 за миллион базовых входных токенов и $10 за миллион выходных. Запись в кеш на 5 минут стоит $2.50, на 1 час — $4, а попадание в кеш — $0.20 за миллион токенов.
  • Claude Opus 5: $5 за миллион базовых входных токенов и $25 за миллион выходных. Запись в кеш на 5 минут стоит $6.25, на 1 час — $10, а попадание в кеш — $0.50 за миллион токенов.
  • Claude Fable 5 и Claude Mythos 5: $10 за миллион базовых входных токенов и $50 за миллион выходных. Доступ к Mythos 5 ограничен.
  • Режим Opus 5 Fast: $10 за миллион входных токенов и $50 за миллион выходных.
  • Opus 5 Batch: $2.50 за миллион входных токенов и $12.50 за миллион выходных. Batch полезен для асинхронной работы модели, но интерактивный цикл управления компьютером все равно должен последовательно наблюдать и действовать.

Новые пользователи API получают небольшой бесплатный кредит без указания точной суммы. Для расширенного корпоративного тестирования Anthropic предлагает обратиться в отдел продаж.

Скрытая статья расходов — объем определения инструментов. Стандартный компьютерный набор добавляет к запросу около 4,520 входных токенов для Opus 5 и 4,590 для Sonnet 5. Отключение масштабирования убирает примерно 410 токенов. Браузерный набор больше: около 6,610 токенов для Opus 5 и 6,670 для Sonnet 5, а включение всех четырех дополнительных браузерных компонентов прибавляет примерно 880 токенов.

По базовой входной ставке Opus 5 один компьютерный набор без кеша стоит около $0.0226 — еще до скриншота, контекста задачи, результата действия и выхода. Браузерный набор на той же основе стоит примерно $0.03305. В короткой задаче объявление доступного управления может обойтись дороже самих бизнес-данных. Кешируйте стабильные инструкции и определения инструментов, когда процесс это допускает, отключайте неиспользуемые компоненты и доверяйте фактическому объему в ответе, а не оценке.

Лучше всего для: Корпоративных процессов в браузере и на рабочем столе, которым нужны явные средства контроля, аудиторские доказательства и поддерживаемый путь миграции.
Главное преимущество: Computer Use со статусом GA, 17 действиями на стороне клиента и последовательными пакетами действий, а также отдельный браузерный инструмент, учитывающий структуру страницы.
Цена: Sonnet 5 $2/$10, Opus 5 $5/$25, Fable 5 и доступный ограниченному кругу Mythos 5 $10/$50 за миллион базовых входных/выходных токенов.
Бесплатный пробный доступ: Небольшой API-кредит для новых пользователей, сумма не указана; корпоративное тестирование согласовывается с отделом продаж.

Сильные стороны
Что получается хорошо
9 points

  • Computer Use имеет статус GA в Claude API, а текущему набору инструментов не нужен бета-заголовок.
  • Browser Use добавляет структуру страницы для веб-процессов и не полагается исключительно на пиксельные координаты.
  • Автоматическое подтверждение при инъекции промпта, исполнение под контролем клиента и поддержка ZDR помогают выстроить серьезную систему контроля.
  • Безопасные пакеты действий способны сократить количество ходов модели и общее время.
  • Sonnet 5 предлагает тот же актуальный набор инструментов по более низкой цене.
  • Определения компьютерного и браузерного наборов добавляют к запросу тысячи входных токенов.
  • Computer Use недоступен внутри Claude Managed Agents.
  • Песочница, исполнитель, учетные данные, подтверждения, журналы и восстановление после ошибок остаются на стороне вашего приложения.
  • В документации Claude отмечены задержки, ошибки координат, проблемы прокрутки и снижение надежности в нишевых или нескольких приложениях.

Кому не подойдет: Не используйте полный рабочий стол, если задача целиком находится на веб-странице и ее решает Browser Use. Откажитесь от обоих вариантов, когда доступен стабильный API. Если нужна лишь самая дешевая обратимая работа с интерфейсом, начните с Gemini; если весь контур действий уже создан, оцените DeepSeek как ядро модели.

3. Gemini 3.7 Flash: лучший недорогой вариант с готовым Computer Use

Gemini 3.7 Flash — рекомендуемая Google модель для Computer Use и самый выгодный вариант в этой подборке с готовым циклом действий от разработчика. Сама модель имеет статус GA, контекстное окно в 1 миллион токенов и максимальный выход в 64,000 токенов. Computer Use остается в Preview.

Документация Google Gemini API по управлению браузером, мобильным устройством и рабочим столом
Computer Use с Gemini 3.7 Flash

Google поддерживает три целевые среды: браузер, мобильное устройство и рабочий стол. Приложение отправляет промпт, среду и скриншот. Gemini возвращает вызов функции для действия в интерфейсе. Клиент масштабирует координаты, выполняет действие, фиксирует новый экран и отправляет его обратно. Безопасная VM или контейнер и клиентский обработчик действий по-прежнему обязательны; в примерах Google используется Playwright.

В Gemini 3.x появились два сигнала, особенно полезных для уровня подтверждений. Каждое действие может содержать intent — краткое объяснение, почему модель его выбрала. Отдельное safety decision помечает действие как разрешенное, требующее подтверждения или заблокированное. Намерение не доказывает правильность действия, но дает политике и проверяющему больше контекста, чем одни координаты нажатия.

Систему безопасности можно настраивать по категориям политик, а распознавание инъекции промпта на скриншотах включается отдельно. Поэтому Gemini интересна продуктовым командам, которые создают собственный интерфейс подтверждения. Приложение может одновременно показать предлагаемое действие, намерение модели, решение политики и текущий скриншот, привлекая человека только там, где этого требует риск процесса.

Для каких задач подходит Gemini

Gemini — разумная отправная точка для обратимых процессов в разных средах. Команда мобильного продукта может одной моделью проверить регистрацию в браузере и мобильной сборке, собрать скриншоты и отметить расхождения в пути пользователя. Отдел поддержки — собрать публичную информацию с разрешенных сайтов и подготовить запись, не нажимая кнопку окончательной отправки.

При нормализованной структуре токенов текущая нижняя граница Gemini Standard Paid равна $0.05625 за задачу, или $56.25 за 1,000 задач. Это на $0.02765 за задачу дороже DeepSeek в пиковые часы. При ставке $60 в час Gemini достаточно сэкономить всего 1.659 секунды инженерного труда или проверки, чтобы покрыть наценку модели. Готовая схема действий, решение безопасности или отсутствие необходимости в собственном адаптере быстро преодолевают этот порог.

Главное предупреждение связано со статусом, а не с мелким шрифтом. Google сообщает, что Computer Use может содержать ошибки и уязвимости, и не советует применять его для критических решений, конфиденциальных данных или серьезных необратимых действий без тщательного надзора. Статус GA модели не делает инструмент в Preview общедоступной стабильной функцией. При закупке, оценке риска и выборе масштаба запуска нужно ориентироваться именно на статус инструмента.

Тарифы Gemini

Google предлагает четыре режима обработки Gemini 3.7 Flash. До 31 декабря 2026 года действуют следующие цены:

  • Standard: $0.75 за миллион входных токенов, $3.75 за миллион выходных и $0.075 за миллион кешированных токенов.
  • Batch: $0.375 за миллион входных токенов, $1.875 за миллион выходных и $0.0375 за миллион кешированных токенов.
  • Flex: $0.375 за миллион входных токенов, $1.875 за миллион выходных и $0.0375 за миллион кешированных токенов.
  • Priority: $1.35 за миллион входных токенов, $6.75 за миллион выходных и $0.135 за миллион кешированных токенов.

С 1 января 2027 года Standard подорожает до $1.50/$7.50, а кешированный вход — до $0.15. Batch и Flex будут стоить $0.75/$3.75, кешированный вход — $0.075. Priority вырастет до $2.70/$13.50, кешированный вход — до $0.27.

Бесплатный Standard-тариф модели предоставляет входные и выходные токены, однако Computer Use недоступен на Free tier. В Paid Google тарифицирует Computer Use как обычные токены модели. Это различие важно для плана тестирования: эксперимент с базовой моделью в AI Studio не равен бесплатной промышленной проверке цикла управления компьютером.

Для интерактивного агента обычно важнее Standard или Priority, чем асинхронная экономика Batch. Flex может быть выгоден для планируемых задач, если его свойства подходят циклу. Не переносите самый дешевый режим в бизнес-кейс, не убедившись, что сквозное взаимодействие и задержка соответствуют процессу.

Лучше всего для: Обратимой автоматизации в браузере, на мобильных устройствах и рабочем столе, где при низкой цене токенов нужна готовая схема действий.
Главное преимущество: Одна рекомендуемая модель для трех сред с намерением действия, настраиваемыми политиками безопасности, решениями о подтверждении и дополнительным распознаванием инъекций промпта.
Цена: Standard $0.75/$3.75 до 31 декабря 2026 года; Batch и Flex $0.375/$1.875; Priority $1.35/$6.75 за миллион входных/выходных токенов.
Бесплатный пробный доступ: У модели есть Free tier, но Computer Use работает только в Paid.

Сильные стороны
Что получается хорошо
8 points

  • Самая низкая текущая цена токенов среди трех вариантов с готовым инструментом управления компьютером от разработчика.
  • Поддержка браузера, мобильных устройств и рабочего стола удобна для QA продукта в разных средах.
  • Намерение действия и решения безопасности упрощают интерфейсы подтверждения и аудита.
  • На странице тарифов для Paid Computer Use нет отдельной платы за вызов — только обычная тарификация токенов модели.
  • Computer Use остается в Preview, хотя Gemini 3.7 Flash уже GA.
  • Google прямо предостерегает от чувствительных, критических и необратимых задач без тщательного надзора.
  • Низкая вводная цена действует только до конца 2026 года.
  • Распознавание инъекции промпта на скриншотах нужно включать, а исполнитель и песочница остаются на стороне клиента.

Кому не подойдет: Не используйте Gemini Computer Use для регулируемого или необратимого промышленного процесса, который не допускает риска Preview. Этот вариант также не годится, если одного браузера недостаточно, а целевой рабочий стол нельзя изолировать. Когда ошибки качества отнимают у оператора заметное время, сравните Sol и Claude, прежде чем оптимизировать цену токенов.

4. DeepSeek V4-Flash-Vision-Exp: лучший для бюджетных систем с собственной обвязкой

DeepSeek V4-Flash-Vision-Exp — самое дешевое модельное ядро в рейтинге и наименее законченный продукт для управления компьютером. DeepSeek выпустила экспериментальную мультимодальную модель 21 августа 2026 года с точным идентификатором API deepseek-v4-flash-vision-exp.

Документация API DeepSeek V4 Flash Vision Exp с форматами и ограничениями изображений
Визуальный API DeepSeek V4-Flash-Vision-Exp

Модель принимает текст и изображения, поддерживает обычные вызовы инструментов и работает через совместимые с OpenAI интерфейсы Chat Completions и Responses API, а также через Anthropic-совместимый интерфейс. У нее контекстное окно в 1 миллион токенов, максимальный выход в 384,000 токенов, режимы с рассуждением и без него, а заявленный лимит параллельных запросов составляет 2,500.

Все это — полезные составляющие компьютерного агента, но не фирменный инструмент действий. DeepSeek объясняет, как отправлять скриншоты и вызывать обычные инструменты, однако не документирует встроенную схему управления браузером или рабочим столом, исполнитель, решения о подтверждении и рабочую среду. Поэтому определение модельное ядро — редакционный вывод из границ продукта.

На практике команде придется определить такие инструменты, как click, type, scroll, screenshot, wait и запрос подтверждения. Затем нужно валидировать аргументы, сопоставлять координаты, выполнять действия в изолированном браузере или VM, возвращать новое состояние, обнаруживать циклы, останавливаться при ошибках и все журналировать. Зрелая команда автоматизации может счесть такой контроль преимуществом. Для команды, которая покупает первого компьютерного агента, это разработка приложения.

Почему цена заслуживает внимания

DeepSeek тарифицирует V4-Flash-Vision-Exp по тому же расписанию пиковых и непиковых ставок, которое указано для маршрута Flash:

  • Вне пиковых часов: $0.007 за миллион входных токенов при попадании в кеш, $0.22 за миллион входных токенов без попадания в кеш и $0.66 за миллион выходных токенов.
  • В пиковые часы: $0.014 за миллион входных токенов при попадании в кеш, $0.44 за миллион входных токенов без попадания в кеш и $1.32 за миллион выходных токенов.

Пиковыми считаются интервалы с 01:00 до 04:00 UTC и с 06:00 до 10:00 UTC. В остальное время действует непиковая ставка. С 23 августа 2026 года по пекинскому времени непиковые цены распространяются на всю субботу и воскресенье по пекинскому времени.

На странице тарифов не заявлены бесплатный уровень или пробный доступ. Но практическая стоимость оценки все равно крайне мала. При нормализованной структуре из 50,000 входных и 5,000 выходных токенов модель стоит $0.0143 вне пиковых часов или $0.0286 в пиковые часы. Команда может позволить себе большой объем экспериментов до того, как токены станут главной статьей расходов. Однако разработка, проверка и ошибочное действие от этого дешевыми не становятся.

Правило тарификации изображений сформулировано необычно четко. Большие изображения уменьшаются примерно до бюджета 800 на 800 пикселей, а каждое изображение ограничено 384 входными токенами. По пиковому тарифу без попадания в кеш 100 скриншотов максимального размера стоят не более $0.016896 во входных токенах. Вне пика — $0.008448. Текст, выход, повторная история, обычные вызовы инструментов и повторы в этот расчет не входят.

Такое ограничение одновременно снижает цену и ухудшает восприятие. В плотной таблице, маленьком диалоге или многостолбцовом дашборде при сжатии до бюджета изображения могут пропасть важные детали. При необходимости отправляйте выделенную область или используйте документированный режим детализации original, а затем проверяйте, как сервис меняет размер. Дешевые токены изображений не гарантируют точного распознавания мелкого текста.

DeepSeek принимает JPEG, PNG, GIF и WebP. Можно передать base64, публичный URL или ссылку Files API. Сервис допускает до 600 изображений в запросе, максимум 8,192 пикселя по каждой стороне, а при 15 и более изображениях — 4,096 пикселей по стороне. Изображения в base64 и по URL могут занимать до 32 MiB, через Files API — до 64 MiB, а тело встроенного запроса — до 48 MiB.

Эти пределы заметно выше потребностей обычного цикла скриншотов, поэтому ограничением становится не число загрузок, а собственный контур управления. Команда должна доказать, что схема действий, сопоставление координат, подтверждения и восстановление дают принятые результаты. Способность увидеть кнопку еще не дает модели права ее нажать.

Более широкое сравнение поставщиков вне сценариев управления экраном есть в материале DeepSeek против ChatGPT.

Лучше всего для: Опытных команд, которым нужно недорогое визуальное ядро в собственной браузерной или настольной обвязке.
Главное преимущество: До 384 входных токенов на изображение и тариф $0.22/$0.66 за вход без попадания в кеш/выход вне пиковых часов.
Цена: $0.22/$0.66 вне пика или $0.44/$1.32 в пиковые часы за миллион входных токенов без попадания в кеш/выходных токенов; попадание в кеш стоит $0.007 вне пика или $0.014 в пик.
Бесплатный пробный доступ: На актуальной странице тарифов бесплатный уровень или пробный период не заявлены.

Сильные стороны
Что получается хорошо
10 points

  • Самая низкая нормализованная стоимость токенов модели среди четырех вариантов.
  • Совместимость с OpenAI, Responses API и Anthropic уменьшает объем работы над адаптером модели.
  • Обычные вызовы инструментов позволяют опытной команде самой задать набор действий и границы политики.
  • Предсказуемый предел в 384 токена на изображение упрощает оценку стоимости скриншотов.
  • Большие пределы контекста, выхода, конкурентности и числа изображений оставляют пространство для сложных пользовательских процессов.
  • Экспериментальный статус модели создает вопросы об изменениях и рисках промышленного использования.
  • Нет документированных фирменных инструментов компьютерных действий, исполнителя, решения безопасности или уровня подтверждений.
  • Автоматическое уменьшение изображений может стереть мелкие детали интерфейса.
  • Расписание пиковых и непиковых часов усложняет прогнозирование трафика, который нельзя поставить в очередь.
  • Низкая цена токенов способна скрыть гораздо более крупные расходы на разработку, оценку и проверку.

Кому не подойдет: Не выбирайте DeepSeek, если нужен готовый цикл действий, решение безопасности от поставщика либо отсутствует изолированный исполнитель и система оценки. Не используйте его и для экранов с мелким текстом или высокой плотностью, пока сфокусированные скриншоты не пройдут репрезентативный визуальный тест.

Какой вариант кому подойдет

Основателю стартапа с финансированием, который автоматизирует обратимое исследование конкурентов, стоит начать с Gemini 3.7 Flash. Модель дает готовый цикл действий, охватывает браузер и рабочий стол и удерживает нижнюю границу цены на уровне, позволяющем провести широкую оценку. Выбор меняется в пользу Sol, если проверка и восстановление после сбоев занимают больше времени, чем предполагает приблизительный тест 22 секунд. Claude становится предпочтительнее, если сложнее всего работать с недоверенным веб-контентом и проектировать подтверждения.

Техническому директору средней компании, который переносит данные через регулируемое или устаревшее приложение, лучше начать с Claude Opus 5 или Sonnet 5. Computer Use имеет статус GA в Claude API, классификаторы скриншотов могут запросить подтверждение, среда остается под контролем клиента, а функция поддерживает ZDR. Возможность использовать ее для HIPAA-нагрузок в рамках BAA важна при оценке модели, но процессу все равно нужны учетные данные с минимальными привилегиями, защищенные журналы и человек перед окончательной отправкой. Если все шаги выполняются на веб-страницах, выбирайте Browser Use вместо полноценного Computer Use.

Опытному оператору, который автоматизирует ценный и сложный процесс на рабочем столе, следует начать с GPT-5.6 Sol. Заявленное разработчиком лидерство Sol в OSWorld и небольшой порог окупаемости труда оправдывают первоначальную проверку верхнего уровня качества. Когда критерий приемки станет понятен, стабильные типы задач можно направить в Terra, Luna или Gemini. Ошибка — начать с самого дешевого уровня и так и не выяснить, сколько восстановлений устраняет более сильная модель.

Техническому разработчику с готовым исполнителем действий, сервисом политик и набором оценок стоит включить DeepSeek V4-Flash-Vision-Exp в сравнение. При таком уровне зрелости собственная схема действий уже не является отдельным проектом, а непиковая ставка способна изменить стоимость масштабной оценки и пакетных нагрузок. Для экранов с мелким текстом, неоднозначных состояний и повторяющихся ошибок сохраните более сильный маршрут.

Выбор зависит от четырех вопросов:

  1. Есть ли стабильный API? Используйте его. Управление экраном — запасной путь для интерфейсов без надежного программного доступа.
  2. Можно ли отменить неверное действие? Если нет, требуйте подтверждения и выбирайте вариант, чей статус, контроль и условия закупки соответствуют последствиям.
  3. У вас уже есть исполнитель? Если нет, экономия на токенах DeepSeek не превращается в готовое решение.
  4. Сколько секунд проверки экономит наценка? Выбирайте Sol, Claude, Gemini или DeepSeek по журналам принятых задач, а не по одному прайс-листу.

Как отбирались модели

Рейтинг построен на пяти критериях, связанных с решением о покупке:

  • Полнота Computer Use: Предоставляет ли поставщик готовый цикл действий или только визуальную модель и обычные вызовы инструментов?
  • Актуальные доказательства: Есть ли на сегодня проверяемый результат профильного бенчмарка, статус продукта или деталь реализации?
  • Экономика принятой задачи: Сколько стоит единая структура токенов и сколько человеческого времени должна сэкономить премиальная модель?
  • Граница промышленной готовности: Что остается клиенту — песочница, исполнитель, подтверждения, защита от инъекций промпта или журналирование?
  • Устойчивость цены: Является ли ставка постоянной, временной, зависящей от часов пик или связанной с функцией в Preview?

Продукты сравнивались по актуальной документации, страницам тарифов, страницам моделей и именованным примерам поставщиков 22 августа 2026 года. В ходе подготовки их не запускали в общей браузерной обвязке, поэтому материал не заявляет собственных результатов теста. Модель затрат — оригинальный анализ зафиксированных тарифов. Описанный ниже протокол на 240 запусков позволяет покупателю получить доказательства для своего процесса.

В подборке четыре варианта, потому что каждый представляет отдельное решение о покупке: максимальная надежность, управляемая корпоративная эксплуатация, дешевая эластичность или экономика собственной системы. У каждого есть актуальное отличие, тарифы, путь реализации и честно обозначенное ограничение. Старые модели упоминаются ниже только там, где покупатель может встретить их во время миграции.

Партнерские отношения не повлияли на рейтинг, а неуместные коммерческие партнеры не добавлялись. Коммерческая доступность не меняла позицию модели.

Какие варианты лучше исключить

Не начинайте новую интеграцию с OpenAI computer-use-preview

Текущая GA-схема запросов OpenAI использует GPT-5.5 или более новую модель с tools: [{ type: "computer" }]. Старые модель computer-use-preview и инструмент computer_use_preview имеют другую схему действий и требуют устаревших настроек запроса. Оставляйте их только на время миграции существующего приложения. Новый проект на устаревшем пути заранее создает работу по замене.

Не выбирайте Gemini 2.5 Computer Use Preview, если доступна 3.7

Google помечает Gemini 2.5 Computer Use Preview как устаревшую модель. При объеме промпта до 200,000 токенов включительно она стоит $1.25 за миллион входных токенов и $10 за миллион выходных, а свыше 200,000 — $2.50/$15. Для Computer Use Google рекомендует Gemini 3.7 Flash, которая стоит $0.75/$3.75 до 31 декабря 2026 года. Сохраняйте 2.5 только ради измеренной зависимости совместимости, которую пока нельзя устранить.

Не маскируйте текстовые модели DeepSeek визуальным прокси

На официальном API DeepSeek изображения принимает только deepseek-v4-flash-vision-exp. Другие модели DeepSeek отвечают ошибкой 400 на входное изображение. Сторонний адаптер может попросить другую модель описать скриншот и передать текст DeepSeek, но тогда оценивается система из двух моделей, а не визуальный Computer Use DeepSeek. Меняются цена, задержка, потери информации и работа с данными. Указывайте прокси отдельным компонентом либо используйте точную визуальную модель.

Не используйте экранного агента без приемочного теста

Фраза «модель дошла до конца» не описывает бизнес-результат. Браузерный агент может попасть не в тот аккаунт, ввести данные не в то поле или остановиться после изменения страницы, не распознав ошибку. Если для задачи нет детерминированной проверки или четкого стандарта проверяющего, ни одна из этих моделей не готова выполнять ее автономно.

Промышленный чек-лист важнее названия модели

Модель — лишь один компонент управляемой системы. До наращивания объема промышленная проверка должна ответить на следующие вопросы:

  • Среда: Изолированы ли браузер или рабочий стол от хоста, личных аккаунтов, локальных файлов и посторонних учетных данных?
  • Границы: Ограничены ли домены, приложения и разрешенные действия рамками процесса?
  • Секреты: Получает ли каждая задача только необходимый объем доступа и не попадают ли секреты на скриншоты или в журналы?
  • Последствия: Какие действия всегда требуют подтверждения человека и действительно ли это правило обеспечивает исполнитель?
  • Инъекции: Что происходит, когда страница, изображение, документ или диалог предлагает агенту проигнорировать задачу?
  • Состояние: Может ли система до действия доказать, с каким аккаунтом, записью, окном и этапом она работает?
  • Восстановление: Останавливает ли ошибочное действие пакет, сохраняет ли доказательства и возвращает ли достаточно состояния для безопасного повтора или эскалации?
  • Приемка: Какая машинная проверка или решение проверяющего отмечает задачу завершенной?
  • Экономика: Фиксируются ли токены модели, вызовы инструментов, время исполнения, повторы и секунды проверки для каждого принятого результата?
  • Изменения: Может ли команда повторить тот же набор задач после смены снимка модели, цены, браузера или целевого интерфейса?

Смена модели должна быть рутинной. Интерфейс действий, политика безопасности, журналы и приемочный тест остаются прежними, а модель меняется за ними. Если переход между поставщиками требует переписать весь контур управления, система перепутала формат инструментов одного поставщика с архитектурой продукта.

Практический шаг на понедельник: сравните 240 запусков

Не планируйте абстрактный «пилот ИИ-агента». Выберите один класс задач и уже на следующей неделе примите одно решение о маршрутизации. Возьмите 20 репрезентативных задач, четыре варианта из рейтинга и выполните по три попытки на каждый вариант. Получится 240 запусков. Трех повторов достаточно, чтобы заметить отдельные удачные совпадения, не выдавая выборку за универсальный бенчмарк.

  1. Понедельник: зафиксируйте задачу и правило приемки

    Выберите 20 задач из одного процесса: обычные случаи, состояния с мелкими элементами, всплывающие окна, неоднозначные элементы управления и один безопасный сценарий инъекции промпта. Уберите необратимые финальные действия. Запишите точное условие успеха и ситуации, требующие проверки.

  2. Вторник: не меняйте среду

    Запустите каждый вариант при одинаковых области просмотра, образе браузера или VM, списке разрешенных доменов, исходном состоянии, наборе доступных учетных данных, словаре действий, лимите времени и политике подтверждений. Для DeepSeek сопоставьте собственные инструменты с теми же базовыми действиями исполнителя, которые используют готовые варианты.

  3. Среда: соберите полную стоимость запусков

    Фиксируйте тарифицируемый вход, кешированный вход, выход, оплачиваемые вызовы инструментов, время исполнителя, прошедшее время, попытки, остановки системы безопасности и секунды человеческой проверки. Сохраняйте первое состояние ошибки и итоговое доказательство принятой задачи.

  4. Четверг: рассчитайте цену принятой задачи

    Сложите цену модели, плату за инструменты, расходы на исполнителя, труд проверяющего по согласованной почасовой ставке и стоимость повторов. Разделите сумму на число принятых результатов. Отдельно покажите долю задач, принятых без правок, принятых после исправления, безопасно отклоненных и завершившихся небезопасной ошибкой.

  5. Пятница: выберите маршрут и сохраните эскалацию

    Выберите самый дешевый вариант, который проходит порог приемки и безопасности. Оставьте более сильную модель для эскалации при повторе действия, неуверенном состоянии, подозрении на инъекцию, провале валидации или тяжелых последствиях. Запишите идентификатор модели и дату цены, чтобы решение можно было воспроизвести.

Этот план намеренно невелик. Один измеренный класс задач дает обоснованную строку бюджета. Широкая демонстрация дает лишь коллекцию скриншотов без правила маршрутизации.

Частые вопросы

Какой ИИ лучше всего управляет компьютером?

GPT-5.6 Sol — лучшая отправная точка для дорогостоящих ошибок благодаря опубликованному результату 62.6% в OSWorld 2.0 и небольшому времени, необходимому для окупаемости наценки за токены. Claude Opus 5 лучше подходит для управляемой корпоративной среды, Gemini 3.7 Flash — для экономичного маршрута, а DeepSeek V4-Flash-Vision-Exp — для команд с готовой обвязкой действий.

Какая мультимодальная модель ИИ лучше?

Для управления компьютером лучшей будет мультимодальная модель, которая достаточно хорошо видит целевой интерфейс, работает с необходимыми действиями и подтверждениями и минимизирует стоимость принятой задачи. Одно визуальное мышление не дает безопасного исполнителя, политики безопасности или проверки завершения.

Какая модель ИИ сейчас самая мощная?

Ни один бенчмарк не подтверждает такое звание для всех задач. OpenAI сообщает о 62.6% GPT-5.6 Sol в OSWorld 2.0, Anthropic позиционирует Opus 5 как сильную модель для управления компьютером, а Google рекомендует Gemini 3.7 Flash для своего инструмента. По этим данным составьте короткий список, а затем ранжируйте модели по принятым результатам, времени восстановления и безопасности в собственном процессе.

Скачайте карту ИИ-инструментов для владельцев бизнеса и превратите этот короткий список в недельное сравнение моделей для управления компьютером.

Последнее обновление

2 сент. 2026 г.

КатегорияAI

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.