AI-мощности·15 мин·20 июля 2026

Чем заменить ChatGPT в России в 2026: GigaChat, YandexGPT и T-Pro на реальных задачах

Разбор по цифрам: где российские нейросети реально работают, где проваливаются и почему они дороже зарубежных. MERA-лидерборд на 20.07.2026 и шесть независимых прикладных тестов за июнь–июль.

Команда autollab
Чем заменить ChatGPT в России в 2026: GigaChat, YandexGPT и T-Pro на реальных задачах
Коротко

На русскоязычном бенчмарке MERA российские модели выглядят достойно: GigaChat 3.1 Ultra с 0.712 стоит выше GPT-5.2 (0.707) и заметно выше GPT-4o (0.642). Но на прикладных задачах картина переворачивается. В тесте из 12 рабочих задач (15.07.2026) GigaChat и YandexGPT не выиграли ни одной. В агентном аудите файрвола GigaChat Max нашёл 0 из 7 заложенных уязвимостей там, где Claude Opus 4.8 нашёл все 7 — и стоил при этом в три раза дороже. На российском праве GigaChat даёт 0.48 против 0.90 у GPT-5.4 Pro. Причина не в «плохих моделях», а в разрыве между бенчмарком и работой: короткий контекст (32K у YandexGPT), ненадёжный function calling, отсутствие мультимодальности. При этом есть задачи, где российские решения объективно лучше: эмбеддинги на разговорном русском, голосовые агенты с латентностью 330 мс против 740 мс у OpenAI, и всё, что упирается в 152-ФЗ. Правильная стратегия на 2026 — не «заменить всё», а развести задачи по двум контурам.

В июле 2026 года на русскоязычном бенчмарке MERA произошло то, чего не было раньше: языковая модель обошла человека. Claude Opus 4.6 набрал 0.862 против человеческого бенчмарка 0.852. Лучшая российская модель в том же списке — GigaChat 3.1 Ultra с 0.712, двадцать третье место.

Казалось бы, вывод очевиден. Но тот же лидерборд говорит, что GigaChat 3.1 Ultra стоит выше GPT-5.2 (0.707) и заметно выше GPT-4o (0.642). А это уже не сходится с обыденным опытом: мало кто всерьёз утверждает, что ГигаЧат работает лучше GPT-4o.

Эта статья — про то, где проходит настоящая граница. Мы свели MERA-лидерборд по состоянию на 20 июля 2026 года с шестью независимыми прикладными тестами, вышедшими в марте–июле, и получили довольно неудобную, но полезную картину: место в бенчмарке почти не переносится на рабочие задачи — и переносится в обе стороны.

Что вообще есть на рынке в июле 2026

За последний год российский AI-ландшафт перестал быть «двумя моделями от банков». Сейчас это четыре независимые линейки, и три из них выкладывают открытые веса.

МодельРазработчикРазмерЛицензияКонтекст
GigaChat 3.5 UltraСбер432B / 28B активных (MoE)MIT~280K (расчётно)
GigaChat 3.1 UltraСбер702B / 36B активных (MoE)MIT131K
GigaChat 3.1 LightningСбер10B / 1.8B активных (MoE)MIT256K
Alice AI LLMЯндекс235B / ~7.3B активных (MoE)закрытая, только API128K
YandexGPT Pro 5.1Яндексне раскрытзакрытая, только API32K
YandexGPT 5 LiteЯндекс8Bсвоя лицензия32K
T-Pro 2.1Т-Технологии33BApache 2.032K (до 128K через RoPE)
T-SearchТ-Технологии36B (MoE)Apache 2.0
Cotype Pro 3MTS AI27Bзакрытая
BerryLM-XLRWB (Wildberries & Russ)358Bзакрытая

Два релиза здесь совсем свежие. GigaChat 3.5 Ultra Сбер анонсировал 6 июля 2026 — 432 млрд параметров против 702 млрд у версии 3.1, то есть модель стала примерно на 40% компактнее при сопоставимом качестве, с гибридным attention (часть слоёв MLA, часть — линейные на GatedDeltaNet) и KV-кешем примерно вчетверо меньше на токен. Веса выложены под MIT — это, без преувеличения, самая либеральная лицензия среди всех крупных открытых моделей в мире.

T-Search от Т-Технологий вышел 17 июля 2026 — за три дня до написания этой статьи. Это не чат-модель: это агент-ретривер для многошагового поиска по корпоративным базам знаний, который возвращает не ответ, а ранжированный список фрагментов-доказательств. По заявлению компании, разработка обошлась в 70 млн рублей.

Важная деталь про лицензии, которую почти все упускают. Сбер выкладывает GigaChat под MIT, Т-Технологии — под Apache 2.0. Обе разрешают коммерческое использование без ограничений. А вот открытая YandexGPT-5-Lite-8B идёт под собственной лицензией Яндекса с потолком 10 млн выходных токенов в месяц — при превышении вы обязаны связаться с Яндексом в течение 30 дней. Если планируете продуктовую нагрузку на открытых весах — читайте LICENSE, а не пресс-релиз.

MERA: что показывает главный русскоязычный бенчмарк

MERA (Multimodal Evaluation for Russian-language Architectures) курируется Сбером совместно с Альянсом в сфере ИИ и академическими партнёрами. Это фактический стандарт для оценки моделей на русском языке. Вот срез текстового лидерборда на 20 июля 2026 года — всего в нём 371 строка.

МестоМодельБалл
1Claude Opus 4.60.862
2Человек (Human Benchmark)0.852
3BerryLM-XL (Wildberries & Russ)0.835
4Cotype Pro 3 (MTS AI)0.824
6GPT-5.40.821
8GLM-5.10.804
23GigaChat 3.1 Ultra0.712
27GPT-5.20.707
30DeepSeek V4 Pro0.687
40GigaChat 2 Max0.670
42T-Pro 2.00.660
45GPT-4o0.642
54A-vibe (Авито)0.618
151GigaChat 3.1 Lightning0.501

Три наблюдения, каждое из которых стоит отдельно.

Первое. Топ-3 русскоязычного бенчмарка — это Claude, человек и модель Wildberries. Что модель маркетплейса стоит выше и Сбера, и Яндекса, и большинства зарубежных флагманов — сюрприз даже для отрасли. Правда, BerryLM закрытая: весов нет, API публично не продаётся, потрогать её нельзя.

Второе, и оно важнее. YandexGPT в MERA отсутствует полностью. Мы проверили все 371 строку — ни одной модели Яндекса, ни YandexGPT любого поколения, ни Alice AI. Яндекс свои модели в MERA не подаёт. Это значит, что любое «сравнение YandexGPT по MERA», которое вы встретите в выдаче, — выдумка SEO-текста. Публичных независимых замеров моделей Яндекса не существует: есть только собственные метрики компании с префиксом «(ya)» и попарные слепые сравнения в процентах.

Третье. Разброс внутри одного поколения GigaChat аномально велик: Ultra на 23-м месте (0.712), Lightning — на 151-м (0.501). Это разные весовые категории (702B против 10B), но для практики это значит, что «работает на GigaChat» — бессмысленная фраза без указания конкретной модели.

Где бенчмарк перестаёт работать: четыре прикладных теста

Дальше начинается интересное. За последние четыре месяца вышли четыре независимых теста на реальных задачах — не на бенчмарочных датасетах. Результаты расходятся с MERA настолько, что это требует объяснения.

Тест 1. Двенадцать рабочих задач (15 июля 2026)

Самый свежий и самый детальный. Двенадцать задач — не синтетика, а то, что реально делают в работе: суммаризация технической документации, анализ датасета, генерация кода, стилизация текста, поиск противоречий в длинном тексте. Пять моделей: три версии Claude Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1. Всё гонялось через единый API, чтобы интерфейс не давал преимущества.

Итог: Sonnet 5 выиграл 7 задач из 12, Sonnet 4.6 — ещё 2. Российские модели — ноль.

Но интереснее не счёт, а характер провалов:

  • Длинный контекст. YandexGPT Pro 5.1 просто не смог принять задачу — «не влезает в контекстное окно». Его лимит 32 000 токенов, и на анализе технической спецификации в 250 тысяч знаков это приговор. Так он потерял четыре задачи из двенадцати, даже не начав.
  • Суммаризация 127 тысяч знаков. GigaChat справился по фактам, но обошёлся в 70,49 ₽ против 21,07 ₽ у Sonnet 5 — в 3,3 раза дороже. На сравнении двух спецификаций GigaChat выставил счёт на 198,99 ₽ и при этом ошибся в атрибуции: назвал новой функцию, которая существовала в предыдущей версии.
  • Анализ датасета на 14,4 тысячи строк. Sonnet 5 нашёл все 26 пропусков и все 9 аномалий. GigaChat выдал ошибку генерации. YandexGPT — переполнение контекста.
  • Генерация кода. Sonnet 5 написал рабочие браузерные шахматы за 15,62 ₽. GigaChat 2 MAX выдал заглушки-комментарии вместо логики. YandexGPT Pro отказался писать код вообще, ответив советами по планированию проекта.
  • Изображения. GigaChat 2 MAX не читает изображения, YandexGPT Pro 5.1 не поддерживает их в принципе. Две задачи провалены по отсутствию функциональности.
  • Галлюцинации. На запросе про несуществующего человека GigaChat сочинил правдоподобную биографию — годы жизни 1928–2012, биофак МГУ, реальные названия институтов. Всё выдумано. YandexGPT отказался, но со слабым хеджированием. Все три Sonnet отказались корректно.

И один результат в обратную сторону, который честно стоит назвать: на «загруженной загадке» — задаче с ловушкой на заученный ответ — GigaChat и YandexGPT справились, а Sonnet 4.6 и 4.5 провалились, выдав заученный шаблон и потом рационализировав противоречие. Российские модели меньше «переучены» на популярные головоломки.

Тест 2. Агентный аудит файрвола (15 июня 2026)

Российский вендор NGFW проверял, может ли модель провести аудит безопасности конфигурации: 104 правила, среди которых заложены 2 критические и 5 высокоопасных уязвимостей.

Первое, что выяснилось: полноценный агентный сценарий пришлось упростить, потому что GigaChat не смог надёжно выполнять tool calls и упал на первом же шаге. Данные пришлось выгрузить в CSV заранее.

Claude Opus 4.8GigaChat Max
Работа в агентном режимеупал на первом шаге
Найдено critical (заложено 2)20
Найдено high (заложено 5)50
Ложные срабатываниянет~4 000
Токенов~105–130 тыс.~700 тыс.
Стоимость сессии~100–180 ₽455 ₽

Вердикт GigaChat дословно: «Небезопасных правил не обнаружено, все соответствуют политике безопасности» — при заложенном правиле drop any→any и гостевом доступе к админ-сервисам. Opus не только нашёл всё, но и отметил, что часть небезопасных правил «технически замаскирована порядком следования», и порекомендовал удаление вместо опоры на порядок.

Это ключевая слабость, и она архитектурная, а не «модель поглупее»: российские модели пока плохо держат состояние между вызовами инструментов. Для чат-бота это неважно. Для любого агентного сценария — блокирующе.

Тест 3. Российское право (9 марта 2026)

Тридцать кейсов из сложных постановлений Верховного суда РФ, факты анонимизированы и переписаны, чтобы модель не могла ответить по памяти. Двойное независимое судейство.

МодельИтоговый балл
GPT-5.4 Pro0.90
Claude Opus 4.60.85
Gemini 3.1 Pro0.62
Qwen 3.5 Plus0.58
GigaChat 2 Max0.48
YandexGPT Pro 5.10.39

Это самый контринтуитивный результат из всех. На российском праве — там, где у отечественных моделей должно быть домашнее преимущество, — разрыв почти двукратный. Обучение на русскоязычном корпусе не даёт автоматического понимания российской правовой логики.

Тест 4. Финансы (9 июля 2026)

Восемь датасетов, 3 993 вопроса, экзаменационные задачи уровня CFA и трейдинг.

МодельЭкзаменационныеТрейдинг / теханализ
GPT-5.50.9060.876
Claude Opus 4.80.860
T-Pro 2.00.7790.726
YandexGPT Pro 5.10.6430.629
GigaChat0.4690.497

Здесь важен не только разрыв, но и порядок внутри российской тройки: T-Pro от Т-Технологий уверенно обходит и Сбер, и Яндекс — модель на 33 млрд параметров против моделей на сотни миллиардов. И вывод самих авторов бенчмарка стоит процитировать: у российских моделей провал в 0,30+ балла между публичными бенчмарками и прикладными задачами. То есть проблема ровно та, с которой мы начали.

Не угадывать, а проверить на своих данных

Мы подбираем модель под конкретную задачу и считаем стоимость на вашем реальном объёме — включая российский контур для персональных данных.

Обсудить задачу

Где российские модели объективно выигрывают

Если бы статья заканчивалась на предыдущем разделе, она была бы нечестной. Есть классы задач, где отечественные решения не «догоняют», а прямо лучше — и их стоит знать, потому что именно там импортозамещение окупается без компромиссов.

Эмбеддинги на разговорном русском

Тест на 10 019 категориях товаров Ozon с иерархическими путями. Сравнивали GigaChat EmbeddingsGigaR, локальный Qwen3-Embedding-0.6B и OpenAI text-embedding-3-small.

ЗапросGigaChatQwen3OpenAI
«велик»Велосипед (0.89)Щётка для массажа (0.55)Товары для взрослых (0.24)
«у меня протекает кран»Сантехника (0.79)Отопление (0.50)Канцелярия (0.25)
«gaming mouse»0.900.730.28

Разрыв не косметический — он решает, работает поиск или нет. Причина в том, что OpenAI-эмбеддинги оптимизированы под длинные английские документы и проседают на коротких русских иерархических путях, а GigaChat обучен на русской разговорной речи. Плата за это — латентность: 168 мс у GigaChat API против 22,8 мс у локального Qwen3 на своей GPU.

Голосовые агенты

Замер латентности от конца речи пользователя до первого звука ответа: Яндекс Realtime — около 330 мс, OpenAI Realtime — около 740 мс, причём OpenAI мерили через VPN, потому что прямой доступ из России закрыт. Разница более чем вдвое, и в голосовом интерфейсе она ощущается физически. Плюс OpenAI даёт заметный английский акцент на русском и путается в согласовании по роду; Яндекс — родная русская речь с нативной поддержкой перебивания.

Для колл-центра, голосового бота или ассистента в приложении это не «на 20% лучше» — это разница между «работает» и «раздражает».

Всё, что упирается в 152-ФЗ

Это не про качество модели, а про то, что качество вообще перестаёт быть аргументом. Если через модель проходят персональные данные клиентов — ФИО, телефоны, паспорта, медицинские или платёжные сведения — отправка их в зарубежный API создаёт трансграничную передачу со всеми вытекающими. Штрафы за обработку без надлежащих оснований в 2025 году подняли до 700 тысяч рублей, и это до всякого разбирательства о трансграничности.

Добавьте к этому законопроект Минцифры о регулировании ИИ со сроком вступления 1 сентября 2027 года: для сервисов с аудиторией свыше 500 тысяч пользователей в сутки предполагается хранение данных россиян на территории РФ не менее трёх лет.

Практический вывод: контур персональных данных должен быть российским, и вопрос «а GigaChat хуже на 15% по бенчмарку» здесь просто не задаётся. Либо российская модель, либо открытые веса на своём железе — благо GigaChat под MIT и T-Pro под Apache 2.0 это прямо разрешают.

Неприятная правда про цену

Распространённое убеждение: российские модели дешевле, потому что «без валюты и посредников». Это неверно, и разрыв не в пользу отечественных.

Расчёт на типовой задаче — обработать 1 000 отзывов, по 300 входных и 60 выходных токенов на каждый:

8,43 ₽
DeepSeek V3
75,3 ₽
GPT-5
186 ₽
YandexGPT 5.1 Pro
234 ₽
GigaChat Max

GigaChat Max дороже DeepSeek V3 примерно в 28 раз и дороже GPT-5 втрое. Официальные прайсы это подтверждают: у Сбера для юрлиц Max стоит 0,65 ₽ за 1 000 токенов, Pro — 0,5 ₽, Lite — 0,065 ₽, причём тарифицируются вход и выход суммарно, включая системный промпт. У Яндекса YandexGPT Pro 5.1 — 0,8 ₽ за 1 000 токенов в синхронном режиме и 0,41 ₽ в асинхронном.

Два способа реально сэкономить, о которых редко пишут. Первый — асинхронный режим у Яндекса: он примерно вдвое дешевле синхронного, и для пакетной обработки (разбор отзывов, классификация заявок, генерация описаний) синхронность не нужна вообще. Второй — GigaChat Lite за 0,065 ₽ вместо Max за 0,65 ₽: десятикратная разница в цене, а на простой классификации и разметке разница в качестве близка к нулю. Основная переплата в российских проектах — это Max там, где хватило бы Lite.

Отдельная арифметика — зарубежные модели через российских посредников. Мы посчитали наценку сами, взяв прайс агрегатора и разделив на официальную цену Anthropic по курсу ЦБ (77,49 ₽/$ на 14.07.2026). Получилось: у ProxyAPI на Opus 4.8 — ×3,9, у AITunnel на Sonnet 4.6 — ×2,4. При этом рынок продаёт себя с формулировкой «наценка 5–15%». Это верно разве что для самых дешёвых моделей.

И ещё один фактор, который в 2026 году стал решающим для разработчиков: 15 мая 2026 года OpenRouter отключил Россию — причём не по IP, а по billing address и признакам аккаунта, заблокировав и карты, и криптоплатежи. Схема «гоняем всё через один универсальный роутер» перестала существовать.

Семь ошибок при выборе модели

1. Выбирать по месту в бенчмарке

Главный вывод этой статьи. GigaChat 3.1 Ultra стоит в MERA выше GPT-5.2 — и находит 0 уязвимостей там, где Opus находит 7. Бенчмарк меряет знания и рассуждение на коротких задачах; работа требует длинного контекста, инструментов и устойчивости. Это разные способности.

2. Не проверять размер контекста

32 000 токенов у YandexGPT Pro 5.1 — это примерно 50–60 страниц текста. Договор, техзадание, спецификация, выгрузка из CRM туда не помещаются. Причём в выдаче регулярно встречается цифра «128 000 токенов» для этой же модели — она неверна, 128K относится к Alice AI LLM. Проверяйте по документации, а не по обзорам.

3. Планировать агентный сценарий на российской модели

Пока function calling и удержание состояния между вызовами — слабое место и Сбера, и Яндекса. Если у вас агент, который ходит по API, дёргает инструменты и принимает решения по результатам — закладывайте зарубежную модель либо готовьтесь к серьёзной инженерии вокруг.

4. Считать, что отечественное дешевле

Не дешевле. GigaChat Max дороже GPT-5 втрое. Экономия появляется только на Lite-моделях и в асинхронном режиме.

5. Брать Max, где хватит Lite

Десятикратная разница в цене между GigaChat Lite и Max. На классификации обращений, разметке, извлечении полей из шаблонных документов Lite даёт практически то же качество.

6. Гонять персональные данные через зарубежный API

Штрафы до 700 тысяч рублей, а с 2027 года ландшафт ужесточается. Разделяйте контуры: персданные — в российском или локальном, обезличенное — где угодно.

7. Ждать одну модель на все задачи

Её не будет. Оптимальная конфигурация 2026 года — три-четыре модели под разные классы задач, с единым слоем маршрутизации. Это дешевле и надёжнее любого монолита.

Чек-лист: как выбрать под свою задачу

  • Есть ли в данных персональные данные? Если да — российский контур или локальные веса, вопрос качества вторичен.
  • Какой объём одного запроса в токенах? Больше 30K — YandexGPT отпадает сразу.
  • Нужны ли инструменты и многошаговость? Если да — зарубежная модель или готовность вкладываться в обвязку.
  • Нужны ли изображения? GigaChat 2 MAX и YandexGPT Pro 5.1 их не поддерживают.
  • Задача про поиск и эмбеддинги на русском? Берите GigaChat — здесь он объективно лучше OpenAI.
  • Задача голосовая? Яндекс Realtime, 330 мс против 740 мс.
  • Задача простая и массовая? GigaChat Lite в асинхронном режиме, не Max.
  • Посчитали стоимость на реальном объёме? Не на тарифе за 1 000 токенов, а на месячной нагрузке.
  • Прогнали хотя бы 20 своих примеров? Любой бенчмарк — не про ваши данные.
  • Проверили лицензию, если берёте открытые веса? MIT у GigaChat, Apache 2.0 у T-Pro, ограничение 10 млн токенов у YandexGPT Lite.

Итого

Правильная постановка вопроса в 2026 году — не «чем заменить ChatGPT», а «какие задачи вынести в российский контур, а какие оставить снаружи». Ответ «заменить всё» проваливается на агентных сценариях, длинных документах и любой работе, где нужны инструменты. Ответ «ничего не менять» проваливается на 152-ФЗ и на том, что доступ к зарубежным сервисам из России в 2026 году — постоянно движущаяся мишень: OpenRouter отключил РФ в мае, наценки посредников доходят до четырёхкратных, аккаунты блокируются.

Рабочая конфигурация выглядит примерно так. Российский контур — всё с персональными данными, эмбеддинги и семантический поиск на русском, голосовые интерфейсы, массовая простая обработка на Lite-моделях. Внешний контур — агенты с инструментами, длинные документы, код, юридический и финансовый анализ, мультимодальность. Между ними — слой маршрутизации, который выбирает модель по типу задачи, а не по привычке.

И последнее, что стоит держать в голове: за четыре месяца этот ландшафт изменился сильнее, чем за предыдущие два года. GigaChat 3.5 вышел 6 июля, T-Search — 17 июля. Любое сравнение моделей, включая это, — снимок, а не константа. Что не меняется — так это метод: проверять на своих задачах, считать на своих объёмах и не путать место в бенчмарке с результатом в работе.

Подобрать модель под задачу — без экспериментов вслепую

Разберём ваш сценарий, посчитаем стоимость на реальном объёме и соберём контур с учётом 152-ФЗ. Первая консультация бесплатно.

Оставить заявку

Похожие статьи