Лучшие LLM-модели 2026: рейтинг 8 моделей с открытыми весами

Сравниваем лучшие LLM-модели 2026 года: GLM-5.2, DeepSeek V4, Qwen3 и другие. Цены, лицензии, локальный запуск и выбор под разные задачи бизнеса.

Friday, September 4, 2026Omid Saffari
Лучшие LLM-модели 2026: рейтинг 8 моделей с открытыми весами

Лучшие LLM-модели 2026 года уже не обязательно создаются в США, а открытые веса больше не означают компромисс. GLM-5.2 опережает GPT-5.5 в SWE-bench Pro, распространяется по лицензии MIT и стоит фиксированные $18 в месяц. Передовой уровень, который раньше можно было только арендовать, теперь доступен для скачивания.

Лучшие LLM-модели 2026: итоговый выбор

Если нужна одна открытая модель для серьёзных агентных задач и программирования, выбирайте GLM-5.2. Для недорогой обработки больших объёмов лучше подойдёт DeepSeek V4 Flash. Если всё должно работать на собственном оборудовании с одной GPU, берите gpt-oss-120b. А когда для юристов важнее всего прозрачная лицензия, безопасным вариантом по умолчанию станут Qwen3 или Mistral с Apache 2.0.

Модель с открытыми весами позволяет скачать обученные параметры и запустить их самостоятельно, а не только арендовать доступ через API. Это полностью меняет экономику продуктов на базе ИИ: расходы на модель контролируете вы, вместо того чтобы круглосуточно оплачивать счётчик токенов. Ниже — рейтинг моделей по тому, что они действительно дают на практике.

МодельЛучше всего подходит дляЛицензияКонтекстЦена (за 1M, вход/выход)Главное преимущество
GLM-5.2Агентные задачи + программированиеMIT1M~$1.40 / ~$4.40 (или план за $18/мес.)Лучшая открытая модель для длительных задач программирования
DeepSeek V4 FlashНедорогая обработка больших объёмовMIT1M$0.14 / $0.28Почти передовой уровень за минимальную цену
DeepSeek V4 ProСложные рассуждения при низкой ценеMIT1M$0.435 / $0.871.6T MoE с выводом дешевле доллара
Kimi K2.7 CodeГруппы агентов-программистовМодифицированная MIT256K$0.95 / $4.00Модель на 1T параметров, настроенная для агентов-разработчиков
Qwen3-235BГибкое применение без жёстких ограниченийApache 2.0256KБесплатные веса119 языков, настоящий открытый исходный код
MiniMax M3Мультимодальность с длинным контекстомCommunity (с ограничениями)1M$0.30 / $1.20Текст, изображения и видео на входе, контекст 1M
gpt-oss-120bЛокальный запуск на одной GPUApache 2.0ДлинныйБесплатные весаРаботает на одной 80GB H100
Mistral Small 4Хранение данных в ЕСОткрытаяДлинныйБесплатные весаЕвропейская модель с гибридным рассуждением
Llama 4Экосистема + инструментыCommunity (с ограничениями)ДлинныйБесплатные весаСамая широкая поддержка инструментов

Важное уточнение по ценам в таблице: для скачиваемой модели стоимость токена определяется тарифом самого дешёвого хостинга, поскольку веса бесплатны. Здесь указаны собственные API-тарифы разработчиков, зафиксированные на этой неделе. При локальном размещении плата за токены сменяется расходами на GPU.

Почему открытые веса перестали быть компромиссом

Последние два года под «открытой моделью» подразумевали вариант «достаточно хороший, если настоящая модель не по карману». Теперь это уже не так, и один бенчмарк показывает перемену особенно наглядно. В SWE-bench Pro, где оценивается способность модели решать реальные задачи из разработки ПО, GLM-5.2 набирает 62.1 балла. GPT-5.5 получает 58.6, а Gemini 3.1 Pro — 54.2. Заметно впереди остаётся лишь Claude Opus 4.8 с результатом 69.2. Открытая модель под лицензией MIT от компании, выросшей из Tsinghua, теперь превосходит две из трёх западных передовых лабораторий в самом важном для инженерной работы тесте.

Именно от этого зависит, сможете ли вы вообще использовать модель, однако почти ни в одном сравнении разница не объясняется прямо: «открытые веса» и «открытый исходный код» — не одно и то же обещание. Открытые веса означают, что параметры можно скачать. Открытый исходный код в практическом для бизнеса смысле означает ещё и право развёртывать, изменять и продавать созданный продукт без отдельного разрешения. DeepSeek, GLM и Qwen используют действительно свободные лицензии MIT или Apache 2.0: модель можно применять как угодно, в том числе коммерчески. У Llama и MiniMax действуют «лицензии сообщества» со скрытыми в условиях ограничениями. Это не академический нюанс, а разница между выпуском продукта и претензией от юристов через три месяца после запуска.

GLM-5.2 — главный ориентир среди открытых моделей

GLM-5.2 от китайской лаборатории Z.ai (ранее Zhipu) — самая сильная в мире модель с открытыми весами для длительных инженерных задач, поэтому начинать стоит именно с неё. Она вышла в середине июня 2026 года и получила действительно полезное контекстное окно на 1M токенов вместо 200K в предыдущей версии. При этом качество сохраняется по всей длине окна, а модель не просто формально принимает такой объём. Контекстное окно — это объём текста, который модель одновременно удерживает в рабочей памяти; окно на 1M позволяет видеть целиком кодовую базу среднего размера вместе с тестами и принятыми в проекте соглашениями.

Главная страница GLM-5.2 от Z.ai
Z.ai — лаборатория, создавшая GLM-5.2

В Terminal-Bench 2.1, который проверяет, способна ли модель управлять настоящим терминалом и доводить задачу до конца, GLM-5.2 набирает 81.0. Это всего на несколько баллов меньше результата Claude Opus 4.8 с 85.0 и больше, чем у Gemini 3.1 Pro с 74.0. По собственным тестам Z.ai модель заняла первое место среди решений с открытым исходным кодом во всех проведённых ими испытаниях на длительных задачах. Лицензия MIT позволяет стартапу из 12 человек развернуть модель у себя, дообучить на собственном коде и встроить в платный продукт без разрешений и лицензионных отчислений.

Главное ограничение — оборудование. В этой модели около 745 млрд параметров, поэтому для качественного локального запуска нужна серьёзная система с несколькими GPU. Большинство команд не станут развёртывать её самостоятельно и выберут API, где опубликованный тариф составляет около $1.40 за миллион входных токенов и $4.40 за миллион выходных, либо фиксированный GLM Coding Plan примерно за $18 в месяц. Для основателя компании, привыкшего платить по передовым API-тарифам, именно этот план становится главным аргументом: месяц программирования на уровне передовых моделей обходится примерно как две чашки кофе, а при необходимости усилить контроль над данными веса позднее можно перенести внутрь компании.

DeepSeek V4 задаёт недостижимый для конкурентов минимум цены

DeepSeek V4 невозможно игнорировать при расчёте затрат: почти передовое качество здесь предлагается по цене, близкой к нулю. Модель китайской лаборатории DeepSeek вышла в апреле 2026 года в двух версиях. Обе распространяются по лицензии MIT и поддерживают контекст на 1M токенов. V4-Pro — MoE-модель на 1.6 трлн параметров, а V4-Flash — облегчённая версия на 284 млрд. В модели типа mixture-of-experts для каждого токена активируется лишь небольшая часть параметров, поэтому обслуживать столь крупную систему удаётся недорого.

Главная страница DeepSeek
DeepSeek — разработчик семейства моделей V4

Здесь всё решает цена. В собственном API DeepSeek версия V4-Flash стоит $0.14 за миллион входных токенов и $0.28 за миллион выходных. Даже тяжёлая V4-Pro обходится всего в $0.435 на входе и $0.87 на выходе. Чтобы оценить разницу: нагрузка, которая на закрытой передовой модели стоит несколько сотен долларов в месяц, часто укладывается в несколько десятков долларов на V4-Flash — при той же задаче и качестве результата, которое большинство пользователей не отличит в повседневной работе. Обе версии поддерживают режим размышления для сложных задач и вызов инструментов для агентных сценариев.

Важно понимать пределы модели. DeepSeek отлично справляется с рассуждением, математикой и кодом, но для самых сложных мультимодальных задач или самых длительных агентных сессий программирования лучше выбрать GLM-5.2 или Kimi. V4-Flash стоит сделать основной моделью для массовой классификации, извлечения данных, суммаризации и подготовки черновиков, оставив более дорогой вариант для тех 5% задач, где он действительно необходим.

Kimi K2.7 Code создана для агентов, которые пишут код

Kimi K2.7 Code от Moonshot AI — открытая модель, специально разработанная для агентов-программистов, способных работать часами. Она вышла в июне 2026 года. Это MoE-модель на 1 трлн параметров с нативным мультимодальным вводом: наряду с текстом она воспринимает изображения и видео, а её контекстное окно составляет 256K токенов. GLM-5.2 — универсальная модель, которая к тому же отлично пишет код; Kimi же настроена именно на длинные многоэтапные циклы, используемые современными инструментами программирования.

Kimi от Moonshot AI
Kimi — модель Moonshot AI для программирования

По опубликованным Moonshot результатам предыдущая K2.6 показала 80.2% в SWE-bench Verified — на уровне закрытых передовых моделей. В официальном API K2.7 Code стоит $0.95 за миллион входных токенов и $4.00 за миллион выходных. При кешировании промпта вход обходится намного дешевле — $0.19, что особенно важно для агентов, которые на каждом шаге повторно отправляют один и тот же большой контекст. Модель выпущена по модифицированной лицензии MIT, поэтому коммерческое самостоятельное размещение возможно.

Компромисс — узкая специализация. Kimi сильна в программировании и выполнении агентных задач, но уступает более универсальным моделям в текстовой работе и анализе общего назначения. Если ваш продукт — агент-программист или внутренний инструмент разработки, это один из лучших вариантов. Для единой модели на все случаи GLM-5.2 или DeepSeek дадут более сбалансированный результат. О том, как такие модели используются в запускающих их инструментах, читайте в материале о лучших ИИ-агентах для программирования.

Qwen3 — самая свободная из серьёзных открытых моделей

Qwen3 от Alibaba стоит выбрать, если прозрачность лицензии и поддержка языков важнее первого места в отдельном бенчмарке. Открытая флагманская версия Qwen3-235B-A22B — MoE-модель на 235 млрд параметров, из которых активно 22 млрд. Она поддерживает контекст на 256K токенов и 119 языков. Главное — лицензия Apache 2.0, самая свободная во всём рейтинге: поэтому Qwen3 становится вариантом по умолчанию для компаний, чьи юристы настороженно относятся к нестандартным условиям.

Интерфейс чата Qwen
Qwen — семейство моделей с открытыми весами от Alibaba

В одной модели можно переключаться между режимом размышления для сложных задач и более быстрым режимом без рассуждений для обычного общения. Поэтому платить вычислительными ресурсами за ненужное обдумывание не придётся. Веса скачиваются бесплатно, а запускать их можно через Alibaba Cloud или у любого хостинг-провайдера, который их предлагает.

Маркетинг размывает важную границу: новейшая флагманская Qwen3.7-Max закрыта и доступна только через API. По-настоящему открыты опубликованные модели среднего уровня и версия с весами 235B, но не Max. Для нетехнического специалиста, принимающего решение о закупке, правило простое: чтобы владеть моделью, выбирайте конкретную открытую версию Qwen, а не линейку Max. Открытая 235B немного уступает GLM-5.2 и DeepSeek V4 в самых сложных бенчмарках программирования, зато свободная лицензия и широкая языковая поддержка делают её самым безопасным суверенным вариантом для глобального продукта.

MiniMax M3 выводит мультимодальность на передовой уровень открытых моделей

MiniMax M3 заслуживает внимания, если в работе сочетаются текст, изображения и видео, а также нужен огромный контекст. Это самая новая модель в списке: она вышла 1 июня 2026 года. MoE-модель содержит 428 млрд параметров, из которых активно 23 млрд, поддерживает контекст на 1M токенов и нативный мультимодальный ввод. Для удешевления работы с длинным контекстом используется архитектура внимания, которую лаборатория называет MiniMax Sparse Attention.

Главная страница платформы MiniMax
MiniMax — разработчик модели M3

Цена весьма агрессивная: в собственном API MiniMax модель M3 стоит $0.30 за миллион входных токенов и $1.20 за миллион выходных с постоянно действующей скидкой 50%. Результат 93.0 в GPQA Diamond ставит её в один ряд с сильнейшими моделями рассуждения — как открытыми, так и закрытыми.

Но есть оговорка в лицензии. Веса M3 можно скачать, однако коммерческое использование модели или её производных требует отдельного соглашения сверх стандартной MiniMax Community License. Проще говоря, модель отлично подходит для экспериментов, но до создания бизнеса на её основе коммерческие условия следует получить в письменном виде. Именно этот пункт опускает M3 ниже моделей с MIT и Apache для тех, кто выпускает продукт.

gpt-oss запускается на собственной GPU

gpt-oss, семейство моделей с открытыми весами от OpenAI, создано для случаев, когда принципиально важно работать на контролируемом оборудовании без целого кластера. Старшая gpt-oss-120b содержит 117 млрд параметров, но активирует лишь 5.1 млрд, и рассчитана на запуск на одной GPU с 80GB памяти, например NVIDIA H100. Младшая gpt-oss-20b работает с 16GB памяти — столько может предложить хорошо оснащённая рабочая станция. Обе используют Apache 2.0.

gpt-oss от OpenAI
gpt-oss — модели OpenAI с открытыми весами

Это практичный вариант для локального развёртывания. Для организации с жёстким регулированием — больницы, банка или оборонного подрядчика, которым нельзя отправлять данные во внешние API, — формулировка «помещается на одной H100» фактически определяет выбор. Интенсивность рассуждений настраивается: модель можно переключать между быстрым и дешёвым либо медленным и тщательным режимом, а полный доступ к цепочке рассуждений помогает при отладке. Агентные возможности здесь настоящие: нативный вызов функций, веб-поиск и выполнение Python.

Если говорить прямо, gpt-oss не стремится возглавить бенчмарки, как GLM-5.2 или DeepSeek V4, и вышла раньше остальных моделей в этой группе. Её выбирают не как самый умный вариант, а за сценарий развёртывания: это способная модель под прозрачной лицензией, которая работает на уже имеющемся оборудовании.

Mistral — европейский открытый вариант

Mistral, французская лаборатория, подходит компаниям, для чьих клиентов важны хранение данных в Европе и привычный западный поставщик. В открытую линейку входят Mistral Small 4 — эффективная гибридная модель, объединяющая выполнение инструкций, рассуждение и программирование, — а также передовая мультимодальная Mistral Medium 3.5 и предназначенная для агентов-программистов Devstral 2.

Главная страница Mistral AI
Mistral — европейская лаборатория открытых моделей

Европейской компании, работающей с европейскими заказчиками, проще согласовать закупку у поставщика из Парижа, чем из Пекина, независимо от реальных возможностей весов. Модели Mistral меньше и легче гигантских китайских MoE. Это преимущество, когда важна эффективность, и ограничение, когда нужен абсолютный максимум в рейтингах программирования. Перед нами удобный и соответствующий требованиям вариант, а не лидер бенчмарков.

Llama 4 выигрывает экосистемой, а не качеством моделей

Llama 4 от Meta уже не выбирают ради победы в бенчмарках, однако у неё по-прежнему самая развитая экосистема инструментов и самое широкое сообщество. Текущее поколение вышло в 2025 году и включает Scout и Maverick — нативно мультимодальные MoE-модели с 17 млрд активных параметров. Всего в Maverick 400 млрд параметров, распределённых между 128 экспертами. Крупнейшая модель Behemoth пока так и не вышла.

Главная страница Meta Llama
Llama от Meta — самая широкая экосистема открытых моделей

Главное преимущество Llama в 2026 году — эффект притяжения: для неё существует больше дообученных версий, квантований и руководств по развёртыванию, а специалистов с таким опытом проще найти, чем для любой другой открытой модели. Если команда уже использует Llama и модель справляется с задачами, срочно переходить не нужно. Но важно точно понимать условия. Llama распространяется по лицензии сообщества Meta, а не Apache или MIT, и в ней есть коммерческие ограничения, которых нет у настоящих open-source-лицензий. Если лицензирование нового продукта ещё не определено, более свежие китайские модели с MIT и Apache одновременно превосходят Llama по возможностям и предлагают более прозрачные условия.

Какую модель выбрать под конкретную задачу

Лучшая модель определяется вашим ограничением, а не единым победителем. Найдите свой сценарий в таблице.

Ваша ситуацияВыборПочему
Агентное программирование, расходы уже высокиGLM-5.2Лучшая открытая модель для кода, MIT, план за $18/мес.
Массовые задачи через API при ограниченном бюджетеDeepSeek V4 Flash$0.14/$0.28 за 1M, почти передовое качество
Разработка продукта с агентом-программистомKimi K2.7 CodeНастроена на длинные циклы агентов, дешёвый кешированный ввод
Глобальный продукт, юристы обеспокоеныQwen3-235BApache 2.0, 119 языков, действительно открытая модель
Обязательный локальный запуск на одной GPUgpt-oss-120bПомещается на одной 80GB H100, Apache 2.0
Необходимо хранить данные в ЕСMistralЕвропейский поставщик, открытые и эффективные модели
Мультимодальность + огромный контекстMiniMax M3Текст, изображения и видео на входе, контекст 1M, низкая цена
Уже стала корпоративным стандартомLlama 4Самый широкий набор инструментов, менять незачем

Честный расчёт стоимости

Для бизнеса всё это имеет значение из-за итогового счёта, поэтому посчитаем расходы без лишнего шума. Платить за открытую модель можно тремя способами, и каждый подходит для своего масштаба.

  1. Арендовать API — минимальные обязательства

    Вы обращаетесь к модели через API разработчика и платите за токены. По тарифам DeepSeek V4-Flash миллион выходных токенов стоит 28 центов. Команда, обрабатывающая несколько сотен миллионов токенов в месяц — вполне реальная нагрузка для активного продукта, — заплатит десятки долларов, а не тысячи. Почти всем стоит начинать именно с этого варианта.

  2. Купить фиксированный план — предсказуемые расходы

    При интенсивном программировании подписка наподобие GLM Coding Plan примерно за $18 в месяц полностью снимает тревогу из-за каждого токена. Цена остаётся фиксированной, и считать токены больше не приходится. Это оптимальный вариант для небольшой инженерной команды, которая весь день пишет код с помощью ИИ.

  3. Развернуть веса самостоятельно — максимум усилий, минимум переменных расходов

    Вы скачиваете веса под лицензией MIT или Apache и запускаете их на собственных GPU. Вместо оплаты каждого токена появляется фиксированный счёт за GPU и затраты рабочего времени инженеров. Это окупается только при стабильно высокой нагрузке либо когда полный контроль над данными не обсуждается. Реалистичная отправная точка — gpt-oss-120b на одной H100; для MoE-моделей с триллионом параметров нужен кластер.

Распространённое утверждение о том, что команда может сократить ежемесячные расходы с $10,000 на закрытую модель до $1,000–$2,000 на открытую, в целом верно и легко проверяется по ценам выше: при сопоставимой работе GLM-5.2 и DeepSeek V4 обходятся примерно в пять–десять раз дешевле передовых закрытых API. Экономия реальна. Но это сравнение не учитывает инженерные расходы на качественную собственную инфраструктуру для инференса. Поэтому для большинства команд API и фиксированные планы выгоднее локального размещения, пока объёмы не станут большими. Сопоставление этих открытых моделей с закрытыми Claude, GPT и Gemini именно в программировании — в материале про [лучшие модели ИИ для программирования](/blog/best-ai-model-for-coding-2026).

Главное правило выбора

Всё решение меняет одно ограничение. Если API использовать можно, выбор сводится к балансу цены и возможностей: GLM-5.2 для сложной агентной работы или DeepSeek V4 Flash для любых массовых задач. Если API использовать нельзя из-за требований к размещению данных, регулирования или изолированной инфраструктуры, важен только запуск на доступном оборудовании. Тогда выбирайте gpt-oss-120b для одной GPU или Qwen3 для чуть более мощной системы. Сначала решите вопрос с API — всё остальное зависит от него.

Какие лучшие LLM-модели 2026 года доступны с открытыми весами?

Для серьёзных агентных задач и программирования — GLM-5.2: она лидирует во всех открытых бенчмарках длительных задач, использует лицензию MIT и доступна по фиксированному плану за $18 в месяц. Для недорогой обработки больших объёмов DeepSeek V4 Flash с тарифами $0.14 за вход и $0.28 за выход на миллион токенов не имеет равных по цене.

Открытые веса и открытый исходный код — одно и то же?

Нет, и эта разница может дорого обойтись. Открытые веса означают возможность скачать модель. Открытый исходный код в бизнес-контексте также разрешает развёртывать модель и продавать созданный продукт. DeepSeek, GLM, Qwen и gpt-oss используют свободные лицензии MIT или Apache 2.0. У Llama и MiniMax действуют ограниченные лицензии сообщества, которые перед коммерческим использованием должен изучить юрист.

Можно ли запустить эти модели на собственном оборудовании?

Некоторые — без труда. gpt-oss-120b помещается на одной 80GB H100, а gpt-oss-20b работает с 16GB памяти. Для самостоятельного качественного запуска гигантских MoE-моделей DeepSeek V4, GLM-5.2 и Kimi K2.7 нужен кластер с несколькими GPU, поэтому большинство команд арендуют их через API.

Безопасны ли китайские открытые модели для американской компании?

Скачанные веса полностью работают внутри вашей инфраструктуры и никуда не отправляют данные, поэтому самостоятельное размещение полностью снимает вопрос их территориального хранения. Он возникает лишь при обращении к API разработчика, когда данные уходят на его серверы. Если это критично, разверните открытые веса самостоятельно или выберите западного хостинг-провайдера, который предлагает эти модели.

Какую открытую LLM лучше запустить локально на обычном компьютере?

gpt-oss-20b, которой достаточно 16GB памяти, либо модель Qwen3 среднего размера. Оба варианта дают способную модель со свободной лицензией на одной рабочей станции без какой-либо аренды.

Нужна полная картина для бизнеса — не только модели, но и агенты, инструменты и технологические стеки, превращающие их в продукты? Получите карту ИИ-инструментов для владельцев бизнеса и короткий еженедельный обзор того, что действительно вышло и как на это реагировать.

Последнее обновление

4 сент. 2026 г.

КатегорияAI

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.