Чем заменить ChatGPT в России в 2026: GigaChat, YandexGPT и T-Pro на реальных задачах
Разбор по цифрам: где российские нейросети реально работают, где проваливаются и почему они дороже зарубежных. MERA-лидерборд на 20.07.2026 и шесть независимых прикладных тестов за июнь–июль.
На русскоязычном бенчмарке MERA российские модели выглядят достойно: GigaChat 3.1 Ultra с 0.712 стоит выше GPT-5.2 (0.707) и заметно выше GPT-4o (0.642). Но на прикладных задачах картина переворачивается. В тесте из 12 рабочих задач (15.07.2026) GigaChat и YandexGPT не выиграли ни одной. В агентном аудите файрвола GigaChat Max нашёл 0 из 7 заложенных уязвимостей там, где Claude Opus 4.8 нашёл все 7 — и стоил при этом в три раза дороже. На российском праве GigaChat даёт 0.48 против 0.90 у GPT-5.4 Pro. Причина не в «плохих моделях», а в разрыве между бенчмарком и работой: короткий контекст (32K у YandexGPT), ненадёжный function calling, отсутствие мультимодальности. При этом есть задачи, где российские решения объективно лучше: эмбеддинги на разговорном русском, голосовые агенты с латентностью 330 мс против 740 мс у OpenAI, и всё, что упирается в 152-ФЗ. Правильная стратегия на 2026 — не «заменить всё», а развести задачи по двум контурам.
В июле 2026 года на русскоязычном бенчмарке MERA произошло то, чего не было раньше: языковая модель обошла человека. Claude Opus 4.6 набрал 0.862 против человеческого бенчмарка 0.852. Лучшая российская модель в том же списке — GigaChat 3.1 Ultra с 0.712, двадцать третье место.
Казалось бы, вывод очевиден. Но тот же лидерборд говорит, что GigaChat 3.1 Ultra стоит выше GPT-5.2 (0.707) и заметно выше GPT-4o (0.642). А это уже не сходится с обыденным опытом: мало кто всерьёз утверждает, что ГигаЧат работает лучше GPT-4o.
Эта статья — про то, где проходит настоящая граница. Мы свели MERA-лидерборд по состоянию на 20 июля 2026 года с шестью независимыми прикладными тестами, вышедшими в марте–июле, и получили довольно неудобную, но полезную картину: место в бенчмарке почти не переносится на рабочие задачи — и переносится в обе стороны.
Что вообще есть на рынке в июле 2026
За последний год российский AI-ландшафт перестал быть «двумя моделями от банков». Сейчас это четыре независимые линейки, и три из них выкладывают открытые веса.
| Модель | Разработчик | Размер | Лицензия | Контекст |
|---|---|---|---|---|
| GigaChat 3.5 Ultra | Сбер | 432B / 28B активных (MoE) | MIT | ~280K (расчётно) |
| GigaChat 3.1 Ultra | Сбер | 702B / 36B активных (MoE) | MIT | 131K |
| GigaChat 3.1 Lightning | Сбер | 10B / 1.8B активных (MoE) | MIT | 256K |
| Alice AI LLM | Яндекс | 235B / ~7.3B активных (MoE) | закрытая, только API | 128K |
| YandexGPT Pro 5.1 | Яндекс | не раскрыт | закрытая, только API | 32K |
| YandexGPT 5 Lite | Яндекс | 8B | своя лицензия | 32K |
| T-Pro 2.1 | Т-Технологии | 33B | Apache 2.0 | 32K (до 128K через RoPE) |
| T-Search | Т-Технологии | 36B (MoE) | Apache 2.0 | — |
| Cotype Pro 3 | MTS AI | 27B | закрытая | — |
| BerryLM-XL | RWB (Wildberries & Russ) | 358B | закрытая | — |
Два релиза здесь совсем свежие. GigaChat 3.5 Ultra Сбер анонсировал 6 июля 2026 — 432 млрд параметров против 702 млрд у версии 3.1, то есть модель стала примерно на 40% компактнее при сопоставимом качестве, с гибридным attention (часть слоёв MLA, часть — линейные на GatedDeltaNet) и KV-кешем примерно вчетверо меньше на токен. Веса выложены под MIT — это, без преувеличения, самая либеральная лицензия среди всех крупных открытых моделей в мире.
T-Search от Т-Технологий вышел 17 июля 2026 — за три дня до написания этой статьи. Это не чат-модель: это агент-ретривер для многошагового поиска по корпоративным базам знаний, который возвращает не ответ, а ранжированный список фрагментов-доказательств. По заявлению компании, разработка обошлась в 70 млн рублей.
Важная деталь про лицензии, которую почти все упускают. Сбер выкладывает GigaChat под MIT, Т-Технологии — под Apache 2.0. Обе разрешают коммерческое использование без ограничений. А вот открытая YandexGPT-5-Lite-8B идёт под собственной лицензией Яндекса с потолком 10 млн выходных токенов в месяц — при превышении вы обязаны связаться с Яндексом в течение 30 дней. Если планируете продуктовую нагрузку на открытых весах — читайте LICENSE, а не пресс-релиз.
MERA: что показывает главный русскоязычный бенчмарк
MERA (Multimodal Evaluation for Russian-language Architectures) курируется Сбером совместно с Альянсом в сфере ИИ и академическими партнёрами. Это фактический стандарт для оценки моделей на русском языке. Вот срез текстового лидерборда на 20 июля 2026 года — всего в нём 371 строка.
| Место | Модель | Балл |
|---|---|---|
| 1 | Claude Opus 4.6 | 0.862 |
| 2 | Человек (Human Benchmark) | 0.852 |
| 3 | BerryLM-XL (Wildberries & Russ) | 0.835 |
| 4 | Cotype Pro 3 (MTS AI) | 0.824 |
| 6 | GPT-5.4 | 0.821 |
| 8 | GLM-5.1 | 0.804 |
| 23 | GigaChat 3.1 Ultra | 0.712 |
| 27 | GPT-5.2 | 0.707 |
| 30 | DeepSeek V4 Pro | 0.687 |
| 40 | GigaChat 2 Max | 0.670 |
| 42 | T-Pro 2.0 | 0.660 |
| 45 | GPT-4o | 0.642 |
| 54 | A-vibe (Авито) | 0.618 |
| 151 | GigaChat 3.1 Lightning | 0.501 |
Три наблюдения, каждое из которых стоит отдельно.
Первое. Топ-3 русскоязычного бенчмарка — это Claude, человек и модель Wildberries. Что модель маркетплейса стоит выше и Сбера, и Яндекса, и большинства зарубежных флагманов — сюрприз даже для отрасли. Правда, BerryLM закрытая: весов нет, API публично не продаётся, потрогать её нельзя.
Второе, и оно важнее. YandexGPT в MERA отсутствует полностью. Мы проверили все 371 строку — ни одной модели Яндекса, ни YandexGPT любого поколения, ни Alice AI. Яндекс свои модели в MERA не подаёт. Это значит, что любое «сравнение YandexGPT по MERA», которое вы встретите в выдаче, — выдумка SEO-текста. Публичных независимых замеров моделей Яндекса не существует: есть только собственные метрики компании с префиксом «(ya)» и попарные слепые сравнения в процентах.
Третье. Разброс внутри одного поколения GigaChat аномально велик: Ultra на 23-м месте (0.712), Lightning — на 151-м (0.501). Это разные весовые категории (702B против 10B), но для практики это значит, что «работает на GigaChat» — бессмысленная фраза без указания конкретной модели.
Где бенчмарк перестаёт работать: четыре прикладных теста
Дальше начинается интересное. За последние четыре месяца вышли четыре независимых теста на реальных задачах — не на бенчмарочных датасетах. Результаты расходятся с MERA настолько, что это требует объяснения.
Тест 1. Двенадцать рабочих задач (15 июля 2026)
Самый свежий и самый детальный. Двенадцать задач — не синтетика, а то, что реально делают в работе: суммаризация технической документации, анализ датасета, генерация кода, стилизация текста, поиск противоречий в длинном тексте. Пять моделей: три версии Claude Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1. Всё гонялось через единый API, чтобы интерфейс не давал преимущества.
Итог: Sonnet 5 выиграл 7 задач из 12, Sonnet 4.6 — ещё 2. Российские модели — ноль.
Но интереснее не счёт, а характер провалов:
- Длинный контекст. YandexGPT Pro 5.1 просто не смог принять задачу — «не влезает в контекстное окно». Его лимит 32 000 токенов, и на анализе технической спецификации в 250 тысяч знаков это приговор. Так он потерял четыре задачи из двенадцати, даже не начав.
- Суммаризация 127 тысяч знаков. GigaChat справился по фактам, но обошёлся в 70,49 ₽ против 21,07 ₽ у Sonnet 5 — в 3,3 раза дороже. На сравнении двух спецификаций GigaChat выставил счёт на 198,99 ₽ и при этом ошибся в атрибуции: назвал новой функцию, которая существовала в предыдущей версии.
- Анализ датасета на 14,4 тысячи строк. Sonnet 5 нашёл все 26 пропусков и все 9 аномалий. GigaChat выдал ошибку генерации. YandexGPT — переполнение контекста.
- Генерация кода. Sonnet 5 написал рабочие браузерные шахматы за 15,62 ₽. GigaChat 2 MAX выдал заглушки-комментарии вместо логики. YandexGPT Pro отказался писать код вообще, ответив советами по планированию проекта.
- Изображения. GigaChat 2 MAX не читает изображения, YandexGPT Pro 5.1 не поддерживает их в принципе. Две задачи провалены по отсутствию функциональности.
- Галлюцинации. На запросе про несуществующего человека GigaChat сочинил правдоподобную биографию — годы жизни 1928–2012, биофак МГУ, реальные названия институтов. Всё выдумано. YandexGPT отказался, но со слабым хеджированием. Все три Sonnet отказались корректно.
И один результат в обратную сторону, который честно стоит назвать: на «загруженной загадке» — задаче с ловушкой на заученный ответ — GigaChat и YandexGPT справились, а Sonnet 4.6 и 4.5 провалились, выдав заученный шаблон и потом рационализировав противоречие. Российские модели меньше «переучены» на популярные головоломки.
Тест 2. Агентный аудит файрвола (15 июня 2026)
Российский вендор NGFW проверял, может ли модель провести аудит безопасности конфигурации: 104 правила, среди которых заложены 2 критические и 5 высокоопасных уязвимостей.
Первое, что выяснилось: полноценный агентный сценарий пришлось упростить, потому что GigaChat не смог надёжно выполнять tool calls и упал на первом же шаге. Данные пришлось выгрузить в CSV заранее.
| Claude Opus 4.8 | GigaChat Max | |
|---|---|---|
| Работа в агентном режиме | ✓ | упал на первом шаге |
| Найдено critical (заложено 2) | 2 | 0 |
| Найдено high (заложено 5) | 5 | 0 |
| Ложные срабатывания | нет | ~4 000 |
| Токенов | ~105–130 тыс. | ~700 тыс. |
| Стоимость сессии | ~100–180 ₽ | 455 ₽ |
Вердикт GigaChat дословно: «Небезопасных правил не обнаружено, все соответствуют политике безопасности» — при заложенном правиле drop any→any и гостевом доступе к админ-сервисам. Opus не только нашёл всё, но и отметил, что часть небезопасных правил «технически замаскирована порядком следования», и порекомендовал удаление вместо опоры на порядок.
Это ключевая слабость, и она архитектурная, а не «модель поглупее»: российские модели пока плохо держат состояние между вызовами инструментов. Для чат-бота это неважно. Для любого агентного сценария — блокирующе.
Тест 3. Российское право (9 марта 2026)
Тридцать кейсов из сложных постановлений Верховного суда РФ, факты анонимизированы и переписаны, чтобы модель не могла ответить по памяти. Двойное независимое судейство.
| Модель | Итоговый балл |
|---|---|
| GPT-5.4 Pro | 0.90 |
| Claude Opus 4.6 | 0.85 |
| Gemini 3.1 Pro | 0.62 |
| Qwen 3.5 Plus | 0.58 |
| GigaChat 2 Max | 0.48 |
| YandexGPT Pro 5.1 | 0.39 |
Это самый контринтуитивный результат из всех. На российском праве — там, где у отечественных моделей должно быть домашнее преимущество, — разрыв почти двукратный. Обучение на русскоязычном корпусе не даёт автоматического понимания российской правовой логики.
Тест 4. Финансы (9 июля 2026)
Восемь датасетов, 3 993 вопроса, экзаменационные задачи уровня CFA и трейдинг.
| Модель | Экзаменационные | Трейдинг / теханализ |
|---|---|---|
| GPT-5.5 | 0.906 | 0.876 |
| Claude Opus 4.8 | 0.860 | — |
| T-Pro 2.0 | 0.779 | 0.726 |
| YandexGPT Pro 5.1 | 0.643 | 0.629 |
| GigaChat | 0.469 | 0.497 |
Здесь важен не только разрыв, но и порядок внутри российской тройки: T-Pro от Т-Технологий уверенно обходит и Сбер, и Яндекс — модель на 33 млрд параметров против моделей на сотни миллиардов. И вывод самих авторов бенчмарка стоит процитировать: у российских моделей провал в 0,30+ балла между публичными бенчмарками и прикладными задачами. То есть проблема ровно та, с которой мы начали.
Не угадывать, а проверить на своих данных
Мы подбираем модель под конкретную задачу и считаем стоимость на вашем реальном объёме — включая российский контур для персональных данных.
Где российские модели объективно выигрывают
Если бы статья заканчивалась на предыдущем разделе, она была бы нечестной. Есть классы задач, где отечественные решения не «догоняют», а прямо лучше — и их стоит знать, потому что именно там импортозамещение окупается без компромиссов.
Эмбеддинги на разговорном русском
Тест на 10 019 категориях товаров Ozon с иерархическими путями. Сравнивали GigaChat EmbeddingsGigaR, локальный Qwen3-Embedding-0.6B и OpenAI text-embedding-3-small.
| Запрос | GigaChat | Qwen3 | OpenAI |
|---|---|---|---|
| «велик» | Велосипед (0.89) | Щётка для массажа (0.55) | Товары для взрослых (0.24) |
| «у меня протекает кран» | Сантехника (0.79) | Отопление (0.50) | Канцелярия (0.25) |
| «gaming mouse» | 0.90 | 0.73 | 0.28 |
Разрыв не косметический — он решает, работает поиск или нет. Причина в том, что OpenAI-эмбеддинги оптимизированы под длинные английские документы и проседают на коротких русских иерархических путях, а GigaChat обучен на русской разговорной речи. Плата за это — латентность: 168 мс у GigaChat API против 22,8 мс у локального Qwen3 на своей GPU.
Голосовые агенты
Замер латентности от конца речи пользователя до первого звука ответа: Яндекс Realtime — около 330 мс, OpenAI Realtime — около 740 мс, причём OpenAI мерили через VPN, потому что прямой доступ из России закрыт. Разница более чем вдвое, и в голосовом интерфейсе она ощущается физически. Плюс OpenAI даёт заметный английский акцент на русском и путается в согласовании по роду; Яндекс — родная русская речь с нативной поддержкой перебивания.
Для колл-центра, голосового бота или ассистента в приложении это не «на 20% лучше» — это разница между «работает» и «раздражает».
Всё, что упирается в 152-ФЗ
Это не про качество модели, а про то, что качество вообще перестаёт быть аргументом. Если через модель проходят персональные данные клиентов — ФИО, телефоны, паспорта, медицинские или платёжные сведения — отправка их в зарубежный API создаёт трансграничную передачу со всеми вытекающими. Штрафы за обработку без надлежащих оснований в 2025 году подняли до 700 тысяч рублей, и это до всякого разбирательства о трансграничности.
Добавьте к этому законопроект Минцифры о регулировании ИИ со сроком вступления 1 сентября 2027 года: для сервисов с аудиторией свыше 500 тысяч пользователей в сутки предполагается хранение данных россиян на территории РФ не менее трёх лет.
Практический вывод: контур персональных данных должен быть российским, и вопрос «а GigaChat хуже на 15% по бенчмарку» здесь просто не задаётся. Либо российская модель, либо открытые веса на своём железе — благо GigaChat под MIT и T-Pro под Apache 2.0 это прямо разрешают.
Неприятная правда про цену
Распространённое убеждение: российские модели дешевле, потому что «без валюты и посредников». Это неверно, и разрыв не в пользу отечественных.
Расчёт на типовой задаче — обработать 1 000 отзывов, по 300 входных и 60 выходных токенов на каждый:
GigaChat Max дороже DeepSeek V3 примерно в 28 раз и дороже GPT-5 втрое. Официальные прайсы это подтверждают: у Сбера для юрлиц Max стоит 0,65 ₽ за 1 000 токенов, Pro — 0,5 ₽, Lite — 0,065 ₽, причём тарифицируются вход и выход суммарно, включая системный промпт. У Яндекса YandexGPT Pro 5.1 — 0,8 ₽ за 1 000 токенов в синхронном режиме и 0,41 ₽ в асинхронном.
Два способа реально сэкономить, о которых редко пишут. Первый — асинхронный режим у Яндекса: он примерно вдвое дешевле синхронного, и для пакетной обработки (разбор отзывов, классификация заявок, генерация описаний) синхронность не нужна вообще. Второй — GigaChat Lite за 0,065 ₽ вместо Max за 0,65 ₽: десятикратная разница в цене, а на простой классификации и разметке разница в качестве близка к нулю. Основная переплата в российских проектах — это Max там, где хватило бы Lite.
Отдельная арифметика — зарубежные модели через российских посредников. Мы посчитали наценку сами, взяв прайс агрегатора и разделив на официальную цену Anthropic по курсу ЦБ (77,49 ₽/$ на 14.07.2026). Получилось: у ProxyAPI на Opus 4.8 — ×3,9, у AITunnel на Sonnet 4.6 — ×2,4. При этом рынок продаёт себя с формулировкой «наценка 5–15%». Это верно разве что для самых дешёвых моделей.
И ещё один фактор, который в 2026 году стал решающим для разработчиков: 15 мая 2026 года OpenRouter отключил Россию — причём не по IP, а по billing address и признакам аккаунта, заблокировав и карты, и криптоплатежи. Схема «гоняем всё через один универсальный роутер» перестала существовать.
Семь ошибок при выборе модели
1. Выбирать по месту в бенчмарке
Главный вывод этой статьи. GigaChat 3.1 Ultra стоит в MERA выше GPT-5.2 — и находит 0 уязвимостей там, где Opus находит 7. Бенчмарк меряет знания и рассуждение на коротких задачах; работа требует длинного контекста, инструментов и устойчивости. Это разные способности.
2. Не проверять размер контекста
32 000 токенов у YandexGPT Pro 5.1 — это примерно 50–60 страниц текста. Договор, техзадание, спецификация, выгрузка из CRM туда не помещаются. Причём в выдаче регулярно встречается цифра «128 000 токенов» для этой же модели — она неверна, 128K относится к Alice AI LLM. Проверяйте по документации, а не по обзорам.
3. Планировать агентный сценарий на российской модели
Пока function calling и удержание состояния между вызовами — слабое место и Сбера, и Яндекса. Если у вас агент, который ходит по API, дёргает инструменты и принимает решения по результатам — закладывайте зарубежную модель либо готовьтесь к серьёзной инженерии вокруг.
4. Считать, что отечественное дешевле
Не дешевле. GigaChat Max дороже GPT-5 втрое. Экономия появляется только на Lite-моделях и в асинхронном режиме.
5. Брать Max, где хватит Lite
Десятикратная разница в цене между GigaChat Lite и Max. На классификации обращений, разметке, извлечении полей из шаблонных документов Lite даёт практически то же качество.
6. Гонять персональные данные через зарубежный API
Штрафы до 700 тысяч рублей, а с 2027 года ландшафт ужесточается. Разделяйте контуры: персданные — в российском или локальном, обезличенное — где угодно.
7. Ждать одну модель на все задачи
Её не будет. Оптимальная конфигурация 2026 года — три-четыре модели под разные классы задач, с единым слоем маршрутизации. Это дешевле и надёжнее любого монолита.
Чек-лист: как выбрать под свою задачу
- Есть ли в данных персональные данные? Если да — российский контур или локальные веса, вопрос качества вторичен.
- Какой объём одного запроса в токенах? Больше 30K — YandexGPT отпадает сразу.
- Нужны ли инструменты и многошаговость? Если да — зарубежная модель или готовность вкладываться в обвязку.
- Нужны ли изображения? GigaChat 2 MAX и YandexGPT Pro 5.1 их не поддерживают.
- Задача про поиск и эмбеддинги на русском? Берите GigaChat — здесь он объективно лучше OpenAI.
- Задача голосовая? Яндекс Realtime, 330 мс против 740 мс.
- Задача простая и массовая? GigaChat Lite в асинхронном режиме, не Max.
- Посчитали стоимость на реальном объёме? Не на тарифе за 1 000 токенов, а на месячной нагрузке.
- Прогнали хотя бы 20 своих примеров? Любой бенчмарк — не про ваши данные.
- Проверили лицензию, если берёте открытые веса? MIT у GigaChat, Apache 2.0 у T-Pro, ограничение 10 млн токенов у YandexGPT Lite.
Итого
Правильная постановка вопроса в 2026 году — не «чем заменить ChatGPT», а «какие задачи вынести в российский контур, а какие оставить снаружи». Ответ «заменить всё» проваливается на агентных сценариях, длинных документах и любой работе, где нужны инструменты. Ответ «ничего не менять» проваливается на 152-ФЗ и на том, что доступ к зарубежным сервисам из России в 2026 году — постоянно движущаяся мишень: OpenRouter отключил РФ в мае, наценки посредников доходят до четырёхкратных, аккаунты блокируются.
Рабочая конфигурация выглядит примерно так. Российский контур — всё с персональными данными, эмбеддинги и семантический поиск на русском, голосовые интерфейсы, массовая простая обработка на Lite-моделях. Внешний контур — агенты с инструментами, длинные документы, код, юридический и финансовый анализ, мультимодальность. Между ними — слой маршрутизации, который выбирает модель по типу задачи, а не по привычке.
И последнее, что стоит держать в голове: за четыре месяца этот ландшафт изменился сильнее, чем за предыдущие два года. GigaChat 3.5 вышел 6 июля, T-Search — 17 июля. Любое сравнение моделей, включая это, — снимок, а не константа. Что не меняется — так это метод: проверять на своих задачах, считать на своих объёмах и не путать место в бенчмарке с результатом в работе.
Подобрать модель под задачу — без экспериментов вслепую
Разберём ваш сценарий, посчитаем стоимость на реальном объёме и соберём контур с учётом 152-ФЗ. Первая консультация бесплатно.