Своё железо вместо API: какую открытую модель реально запустить локально в 2026
MoE изменил математику: 35 млрд параметров при 3 млрд активных влезают в одну карту на 24 ГБ. Разбираем, что реально работает на своём железе, что требует датацентра и насколько это отстаёт от закрытого фронтира.
За год расклад в открытых моделях перевернулся дважды. Во-первых, Meta ушла из open-weights: 8 апреля 2026 года вышла проприетарная Muse Spark, а никакой «Llama 5» не существует — это выдумка контент-ферм. Лидерство в открытых весах целиком перешло к Китаю: DeepSeek V4, GLM-5.2, Qwen 3.6, Kimi. Во-вторых, архитектура MoE изменила экономику: Qwen3.6-35B-A3B активирует всего 3 млрд параметров из 35 и в 4-битной квантизации помещается в одну карту на 24 ГБ, давая MMLU-Pro 85.2 и SWE-bench Verified 73.4. Но важно не обманываться: настоящий открытый фронтир — DeepSeek V4-Pro на 1.6 трлн, GLM-5.2 на 753 млрд, Kimi K2.7 на триллион — скачать можно, а запустить дома нельзя, это multi-GPU датацентр. Реалистичный локальный выбор — крепкий средний класс, и он отстаёт от закрытых моделей примерно на 6 пунктов Intelligence Index и около 200 дней, причём разрыв сконцентрирован в тяжёлом рассуждении, а не в типовых задачах.
Год назад совет по локальному запуску звучал просто: берите модель на 7–13 миллиардов параметров, квантуйте в 4 бита, и она влезет в игровую видеокарту. Всё, что крупнее, — датацентр. Мы сами писали примерно это в разборе H100 vs A100 vs RTX 4090.
Это правило больше не работает. Qwen3.6-35B-A3B — модель на 35 миллиардов параметров, которая при генерации каждого токена задействует всего 3 миллиарда. В четырёхбитной квантизации она весит 23–24 ГБ, то есть помещается в одну RTX 5090, а по знаниевым тестам даёт MMLU-Pro 85.2 и GPQA 86.0. Для сравнения: GPT-4o на русскоязычном бенчмарке MERA набирает 0.642, а эта модель — 0.792.
Одновременно случилось второе, о чём почти не пишут по-русски: Meta ушла из открытых весов. Разберём, что теперь реально запускается на своём железе, что только притворяется запускаемым, и где проходит честная граница между локальной моделью и закрытым API.
Что произошло за год: две новости
Meta вышла из игры
8 апреля 2026 года Meta Superintelligence Labs выпустила Muse Spark — и впервые за всю историю линейки сделала это без открытых весов. Это проприетарная модель, доступная только через API. 9 июля вышло обновление Muse Spark 1.1. Meta заявляет о намерении открыть будущие версии, но пока это только заявление.
Если вы встретите статью про «Llama 5 с контекстом 5 миллионов токенов» — это выдумка. Такой модели не существует. На официальной странице Meta на HuggingFace последнее, что есть, — Llama 4 Scout и Maverick от мая 2025 года. «Llama 5» тиражируют AI-генерированные контент-фермы, и по этой теме их особенно много: они уверенно публикуют несуществующие модели с правдоподобными цифрами. Признак подделки в данном случае бросается в глаза — такие статьи сравнивают «Llama 5» с Gemini 2.0, моделью декабря 2024 года.
Практическое следствие: лидерство в открытых весах полностью перешло к Китаю. DeepSeek, Alibaba (Qwen), Z.ai (GLM), Moonshot (Kimi), MiniMax. Со стороны США в открытом доступе остались gpt-oss от OpenAI, Gemma от Google и Nemotron от Nvidia — и gpt-oss с августа 2025 года не обновлялся ни разу.
MoE сделал большие модели дешёвыми в работе
Mixture of Experts — не новость сама по себе, но в 2026 году на неё перешли практически все. Модель делится на десятки или сотни «экспертов», и на каждый токен активируется лишь несколько. Считать нужно только их.
Насколько это радикально:
- Qwen3.6-35B-A3B — 256 экспертов, на токен работает 9. Активных параметров 3 млрд из 35.
- DeepSeek V4-Pro — 1.6 трлн параметров, активных 49 млрд. Это 3% модели на токен.
- Kimi K3 — 16 экспертов из 896 на запрос, то есть меньше 2%.
- GigaChat 3.1 Lightning от Сбера — 10 млрд параметров, активных 1.8 млрд.
Здесь кроется главная ошибка, которую совершают почти все. MoE экономит вычисления, но не память. Все эксперты обязаны лежать в VRAM, даже если на конкретном токене работают трое. Qwen3.6-35B-A3B требует памяти как модель на 35 млрд параметров, а считает как модель на 3 млрд. То есть MoE даёт вам скорость маленькой модели при аппетите большой — и именно поэтому она влезает в 24 ГБ только в квантизации, а не в родном формате.
Честная граница: что скачивается и что запускается
Формула для прикидки VRAM простая. Умножьте число параметров на число байт на параметр: BF16 — 2 байта, FP8 — 1 байт, 4-битная квантизация — примерно 0.55 байта с учётом накладных расходов. Сверху прибавьте KV-кеш под нужную длину контекста — на длинном контексте он легко съедает больше самой модели.
Отсюда получается расклад по трём классам железа. Оценки VRAM ниже — расчётные по этой формуле, для 4-битной квантизации и умеренного контекста.
Класс 1. Одна карта, 24–32 ГБ (RTX 3090 / 4090 / 5090)
Самый массовый сценарий — и он перестал быть «игрушечным». Размеры ниже — не расчётные, а фактические веса готовых GGUF-квантизаций.
| Модель | Параметры | Активных | Лицензия | Q4_K_M |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | 3B | Apache 2.0 | 23–24 ГБ |
| Qwen3.6-27B | 27B | 27B | Apache 2.0 | 16.8 ГБ |
| Gemma 4 26B-A4B | 26B | 4B | Apache 2.0 | 18 ГБ |
| T-Pro 2.1 (Т-Технологии) | 33B | 33B | Apache 2.0 | 19.8 ГБ |
| gpt-oss-20b | 20B | — | Apache 2.0 | ~16 ГБ |
| GigaChat 3.1 Lightning | 10B | 1.8B | MIT | ~6 ГБ |
Здесь важная ловушка. Qwen3.6-35B-A3B в Q4 весит 23–24 ГБ — формально «влезает» в карту на 24 ГБ, но не оставляет ни гигабайта под KV-кеш, то есть на практике не работает ни с каким осмысленным контекстом. Ей нужна RTX 5090 на 32 ГБ.
Для карты на 24 ГБ честный выбор — Qwen3.6-27B в Q4 (16.8 ГБ): остаётся 7 ГБ под контекст и запас. Это тот случай, когда «модель влезла» и «модель работает» — разные вещи, и разница выясняется на первом же длинном запросе.
Отдельно про русский язык: контекста меньше, чем кажется
Тут есть эффект, который почти нигде не проговаривают, а для русскоязычных задач он решающий. Русский текст расходует токены заметно быстрее английского. У токенизатора Qwen это примерно в 1,44 раза на обычном тексте и в 1,64 раза на деловом и техническом — том самом, ради которого модель обычно и разворачивают.
Сложите это с ограничением по KV-кешу. Qwen3-32B в Q4 на карте 24 ГБ оставляет место под примерно 14 500 токенов контекста. С поправкой на русский это около 22 страниц текста — не 128 тысяч токенов из спецификации и не «сто страниц договора».
Практический вывод: если задача — анализ длинных русских документов, планируйте не по заявленному окну модели, а по формуле «свободная VRAM минус веса, делённая на KV-кеш, минус 40% на русский». Либо квантуйте кеш до q8, либо берите карту на 32 ГБ.
Плотная T-Pro 2.1 на 33 млрд считает заметно медленнее при том же объёме памяти (у неё активны все параметры), но она специально дообучена под русский и агентские сценарии — и её токенизатор к русскому заметно щадящее, чем у базового Qwen. GigaChat 3.1 Lightning стоит отдельного внимания: 1.8 млрд активных параметров и контекст до 256 тысяч токенов означают, что она пойдёт даже на скромной карте, а лицензия MIT снимает любые вопросы о коммерческом использовании.
Класс 2. Серверная карта 80–141 ГБ (RTX PRO 6000 / A100 / H100 / H200)
| Модель | Параметры | Активных | Лицензия |
|---|---|---|---|
| gpt-oss-120b | 120B | — | Apache 2.0 |
| Nemotron 3 Super | 120B | 12B | уточнять |
| Mistral Medium 3.5 | 128B (dense) | 128B | Modified MIT |
| Mistral Large 3 | 675B | 41B | Apache 2.0 (нужен offload) |
По заявлению OpenAI, gpt-oss-120b рассчитан ровно на одну карту с 80 ГБ и по уровню сопоставим с o4-mini. Для многих корпоративных задач этого более чем достаточно.
Класс 3. Настоящий открытый фронтир — и он не для вашего железа
Вот тут нужно быть честными. Лучшие открытые модели 2026 года скачиваются свободно, но не запускаются нигде, кроме multi-GPU-стойки.
| Модель | Параметры | Активных | Лицензия | ~VRAM в Q4 |
|---|---|---|---|---|
| DeepSeek V4-Pro | 1.6T | 49B | MIT | ~880 ГБ |
| Kimi K2.7-Code | 1T | 32B | Modified MIT | ~550 ГБ |
| GLM-5.2 | 753B | ~40B | MIT | ~415 ГБ |
| GigaChat 3.5 Ultra | 432B | 28B | MIT | ~240 ГБ |
| DeepSeek V4-Flash | 284B | 13B | MIT | ~156 ГБ |
DeepSeek V4-Pro даёт SWE-bench Verified 80.6 — по данным Artificial Analysis это лучший результат среди всех открытых моделей, вровень с Gemini 3.1 Pro. GLM-5.2 берёт AIME 2026 на 99.2 и GPQA-Diamond на 91.2. Всё это прекрасно — и всё это требует от четырёх до одиннадцати H100.
Практический вывод: «на своём железе доступен весь открытый фронтир» — верно для скачивания, но не для запуска. Реалистичный локальный выбор — крепкий средний класс из первых двух таблиц. Хорошая новость в том, что этот средний класс стал по-настоящему сильным.
Единственная модель из третьей таблицы, доступная в разумной конфигурации, — DeepSeek V4-Flash: 156 ГБ в Q4 укладываются в две H100, а качество (SWE Verified 79.0) почти догоняет старшую модель.
Сколько это реально выдаёт: измеренные цифры
Теория — теорией, но вот замеры с официального scoreboard llama.cpp и открытых стендов. Методика единая и задокументированная: llama-bench, промпт 512 токенов, генерация 128, Flash Attention включён.
Сначала сами карты на одной модели (Llama-2 7B в Q4_0), токенов в секунду на генерации:
| Карта | VRAM | Генерация, t/s |
|---|---|---|
| RTX 5090 | 32 ГБ | 300.4 |
| RTX PRO 6000 Blackwell | 96 ГБ | 281.1 |
| RTX 4090 | 24 ГБ | 189.0 |
| RTX 3090 | 24 ГБ | 161.9 |
Обратите внимание: RTX PRO 6000 с её 96 ГБ не быстрее 5090 на маленькой модели — декодирование упирается в пропускную способность памяти, а не в объём. Смысл этой карты в том, что в неё влезает, а не в скорости.
А вот главное подтверждение всему, что сказано выше про MoE. Одна и та же карта RTX PRO 6000, разные модели:
| Модель | Тип | Квантизация | Генерация, t/s |
|---|---|---|---|
| Qwen3 30B-A3B | MoE, 3B активных | Q4_K_M | 251.6 |
| gpt-oss-120b | — | Q8_0 | 193.3 |
| Mistral Nemo 12B | плотная | Q4_K_M | 163.3 |
| Llama 3.3 70B | плотная | Q4_K_M | 34.1 |
| Llama 3.1 405B | плотная | IQ2_XXS | 2.7 |
MoE-модель на 30 миллиардов параметров работает в 7,4 раза быстрее плотной на 70 миллиардов — и даже быстрее плотной на 12 миллиардов. Вот что на самом деле означает «3 миллиарда активных параметров». Плотная модель на 405 млрд в предельной квантизации выдаёт 2,7 токена в секунду, то есть формально запускается, а практически неюзабельна.
Важная оговорка к этим числам: все замеры сделаны на коротком контексте — 512 токенов промпта. Это верхняя граница. На реальных агентских нагрузках с контекстом в десятки тысяч токенов скорость будет заметно ниже, а KV-кеш начнёт съедать память. Планируйте с запасом и меряйте на своей длине запросов.
Два практических следствия из тех же стендов. Первое: ограничение мощности почти бесплатно. На той же карте при снижении лимита с 600 до 350 ватт генерация упала всего с 279 до 275 t/s — меньше 2%. Если карта стоит в офисе, а не в стойке, это решает вопросы с питанием и шумом почти без потерь.
Второе: батчинг решает больше, чем карта. На vLLM с одновременной обработкой запросов та же карта отдавала 1 090 токенов в секунду при 32 параллельных запросах и 3 451 при 512. Один пользователь никогда не увидит этих чисел — а сервис на сотню сотрудников увидит.
Посчитать конфигурацию под вашу задачу
Подберём модель и железо под реальный объём запросов, посчитаем окупаемость против API и развернём контур с учётом 152-ФЗ.
Насколько локальная модель отстаёт от закрытого API
Это тот вопрос, на котором большинство статей про опенсорс начинают приукрашивать. Цифры такие.
По сводному Intelligence Index от Artificial Analysis (замер от 30 апреля 2026) лучшие открытые модели набирают 54 пункта, лидер среди проприетарных — GPT-5.5. Разрыв — около 6 пунктов. Звучит скромно, но он распределён крайне неравномерно:
| Задача | Открытые | GPT-5.5 |
|---|---|---|
| HLE (сложные экспертные вопросы) | 34–36% | 44% |
| CritPt (исследовательская физика) | 4–12% | 27% |
| TerminalBench Hard (агентский кодинг) | 43–46% | 61% |
Плюс открытые модели заметно чаще галлюцинируют — это отдельно фиксируется в Omniscience-метрике.
По времени отставание оценивают в 6–9 месяцев. Конкретная арифметика: между выходом Claude Opus 4.5 и GLM-5.2, которая сравнялась с ней по ряду задач, прошло 204 дня. Epoch AI на конец мая 2026 давала оценку около четырёх месяцев и отмечала, что разрыв вырос по сравнению с осенью 2025-го.
Как это читать практически. На типовых задачах — классификация, извлечение полей, суммаризация, RAG по своим документам, генерация описаний, чат-бот поддержки — разрыв между хорошей открытой моделью и закрытым флагманом близок к неразличимому. На сложном многошаговом рассуждении, исследовательских задачах и длинных автономных агентских сценариях он остаётся реальным и заметным.
Где в этом раскладе российские модели
Здесь локальный запуск даёт неожиданный поворот. Если данные и так остаются внутри периметра, вопрос «российская модель или зарубежная» теряет юридический смысл — остаётся чистое качество. А по качеству на русском картина такая (текстовый лидерборд MERA, срез на 20 июля 2026):
| Модель | MERA | Открытая |
|---|---|---|
| Claude Opus 4.6 | 0.862 | нет |
| Человек | 0.852 | — |
| GPT-5.4 | 0.821 | нет |
| GLM-5.1 | 0.804 | да |
| Qwen3.6-35B-A3B | 0.792 | да |
| GigaChat 3.1 Ultra | 0.712 | да |
| T-Pro 2.0 | 0.660 | да |
| GPT-4o | 0.642 | нет |
Обратите внимание на строку с Qwen: открытая модель на 35 млрд параметров с 3 млрд активных обходит российский флагман на 702 млрд и оставляет GPT-4o далеко позади. На русском языке, на российском же бенчмарке.
Это не аргумент против отечественных моделей — у них есть свои сильные стороны, мы разбирали их в статье про замену ChatGPT в России. Но если вы разворачиваете модель локально и выбираете по качеству, честный ответ в июле 2026-го: начинайте с Qwen 3.6, а российские модели берите там, где важна лицензионная простота или специфика русского языка.
Из российских для локального запуска лучшие кандидаты — GigaChat 3.1 Lightning (10B/1.8B, MIT, влезает почти куда угодно) и T-Pro 2.1 (33B, Apache 2.0, заточена под агентские сценарии на русском). Свежая GigaChat 3.5 Ultra от 6 июля под MIT впечатляет как факт — 432 млрд параметров с открытыми весами и максимально либеральной лицензией, — но требует примерно 240 ГБ VRAM. И на момент публикации её вдобавок нельзя запустить ни на одном стабильном релизе движка: патчи в llama.cpp и vLLM ещё не приняты, карточка модели предлагает собирать из непринятого пул-реквеста. Это нормальная ситуация для модели, вышедшей две недели назад, но планировать на неё сейчас нельзя.
Когда локальный инференс — не оптимизация, а единственный вариант
Всё вышесказанное — про выбор. Но есть класс задач, где выбора нет.
Если через модель проходят персональные данные — ФИО, телефоны, паспортные, медицинские или платёжные сведения, — отправка их в зарубежный API образует трансграничную передачу со всеми обязанностями по 152-ФЗ. Штрафы за обработку без надлежащих оснований подняли до 700 тысяч рублей. Добавьте законопроект Минцифры о регулировании ИИ со сроком вступления 1 сентября 2027 года, который для крупных сервисов предполагает хранение данных россиян в РФ не менее трёх лет.
Локальный инференс закрывает вопрос радикально: данные физически не покидают ваш контур. Это, пожалуй, главный практический драйвер локального развёртывания в России — сильнее, чем экономия.
Рабочая схема, которую применяют чаще всего — не «всё локально», а маршрутизация по чувствительности: запросы с персданными идут в локальную модель, обезличенные и сложные — во внешний API. Слой роутинга ставится перед моделями и решает по типу запроса.
Экономика: когда своё железо окупается
Здесь придётся разочаровать: честный ответ — «реже, чем вам кажется». И начать надо не с цен, а с одной цифры.
Цифра, которая обесценивает большинство расчётов окупаемости
В июне 2026 года российская команда опубликовала реальные замеры on-premise-развёртывания: две RTX PRO 6000 Blackwell (192 ГБ суммарно), модель gpt-oss-120b, 1 080 запросов по десяти сценариям.
Калькулятор пропускной способности обещал 4 696 токенов в секунду. Фактически получилось 880,8 — расхождение в 5,3 раза. Замер независимо подтверждён сторонним бенчмарком.
Это самая практически важная цифра во всей теме. Подавляющее большинство расчётов окупаемости своего железа — и в интернете, и в презентациях вендоров — построено на теоретической пропускной способности. Если реальность отличается в пять раз, то и выгода self-host завышена примерно во столько же. Прежде чем считать ROI, потребуйте замер на вашей нагрузке, а не цифру из калькулятора.
Ставки аренды у российских провайдеров, ₽/час
Сняты с прайсов 20 июля 2026 года. Часть значений пересчитана из месячных тарифов.
| GPU | Selectel | Immers.cloud | HOSTKEY* |
|---|---|---|---|
| H200 141 ГБ | 587,67 | 423 | — |
| H100 80 ГБ | нет в облаке | 341,77 | ~199 |
| A100 80 ГБ | 292,02 | 211,77 | ~164 |
| RTX 6000 PRO 96 ГБ | 215,70 | — | 240–253 |
| RTX 5090 32 ГБ | — | 130,76 | 63–66 |
| RTX 4090 24 ГБ | 75,40 | 82,76 | 38–59 |
| RTX 3090 24 ГБ | — | 66,76 | 34–40 |
* пересчёт из месячного тарифа. Помесячное обязательство выходит примерно в 1,7 раза дешевле почасовой аренды — это премия за гибкость, а не ошибка.
Два наблюдения. Первое: у Selectel H100 в облаке уже нет — остались только H200, при этом на A30 и A100 висят промо-скидки. Похоже на вымывание поколения Hopper с российского рынка. Второе: разброс цен на одну и ту же карту между провайдерами доходит до двух раз, так что сравнивать стоит не «облако против железа», а конкретные предложения.
А если покупать: розничные цены в России
| Карта | VRAM | Цена в РФ | Наличие |
|---|---|---|---|
| RTX 5080 | 16 ГБ | 135 000 – 169 000 ₽ | в наличии |
| RTX 5090 | 32 ГБ | 420 000 – 528 000 ₽ | в наличии |
| RTX PRO 6000 Blackwell | 96 ГБ | от 1 050 000 ₽ | под заказ |
| A100 | 80 ГБ | 1 130 000 – 1 570 000 ₽ | в наличии |
| H100 | 80 ГБ | 2 160 000 – 3 060 000 ₽ | в наличии |
| H200 | 141 ГБ | 3 090 000 – 4 940 000 ₽ | лотерея |
RTX 4090 из российской розницы исчезла — в каталоге DNS серии RTX 40 нет даже в фильтрах. Все советы «возьмите 4090» относятся теперь к вторичному рынку и аренде.
Наценка на игровые карты кратно выше, чем на серверные: RTX 5090 при рекомендованной цене 1 999 долларов идёт с наценкой около 200%, серверные — 15–50%. Отсюда неочевидный вывод: RTX PRO 6000 Blackwell на 96 ГБ стоит вдвое дешевле H100 и всего вдвое дороже RTX 5090, при этом памяти в ней больше, чем в H100. Для инференса, где всё упирается в объём VRAM, это сейчас лучшая позиция на российском рынке по гигабайтам на рубль.
Гарантия на серверное железо в России идёт от продавца, а не от NVIDIA — по всем признакам это параллельный импорт: OEM-маркировка, фиксация цены по курсу на дату платежа, сроки поставки до 40–60 рабочих дней. Продление гарантии до пяти лет у некоторых продавцов стоит до четверти цены карты.
Контекст рынка: ножницы
Две новости, которые надо читать вместе. Ввоз GPU-серверов в Россию упал с тысяч штук в 2024 году до сотен в 2025 и десятков в 2026 — на два порядка за два года. При этом, по данным на июль 2026, потребление облачных GPU у одного из провайдеров выросло на 507% за полугодие, а средний чек на GPU-сервер — на 64%, до 2,3 млн рублей.
Предложение сжимается, спрос растёт впятеро. Для решения «купить или арендовать» это разворачивает старый аргумент: раньше дефицит был доводом «брать сейчас, пока есть», теперь он работает против покупки — её просто может не случиться в разумный срок.
Для масштаба: вся установленная база в России — чуть более 10 тысяч GPU в коммерческих ЦОД и около 8 тысяч на локальных площадках.
А если покупать: цены в России на 20 июля 2026
Мы прошлись по прайсам российских продавцов. Картина такая.
| Карта | VRAM | Цена в РФ | Наличие |
|---|---|---|---|
| RTX 5080 | 16 ГБ | 135 000 – 169 000 ₽ | в наличии |
| RTX 5090 | 32 ГБ | 420 000 – 528 000 ₽ | в наличии |
| RTX PRO 6000 Blackwell | 96 ГБ | от 1 050 000 ₽ | под заказ |
| A100 | 80 ГБ | 1 130 000 – 1 570 000 ₽ | в наличии |
| H100 | 80 ГБ | 2 160 000 – 3 060 000 ₽ | в наличии |
| H200 | 141 ГБ | 3 090 000 – 4 940 000 ₽ | лотерея |
| HGX B200 (плата на 8 GPU) | 8×180 ГБ | ~34 500 000 ₽ | под заказ |
Несколько наблюдений, которые меняют планирование.
RTX 4090 из российской розницы исчезла. В каталоге DNS её нет вообще — серия RTX 40 отсутствует даже в фильтрах. Все советы «возьмите 4090» относятся теперь только ко вторичному рынку и к аренде.
Наценка на игровые карты кратно выше, чем на серверные. RTX 5090 при рекомендованной цене в 1 999 долларов продаётся с наценкой около 200%. А вот серверные карты идут с наценкой примерно 15–50% — дефицит игровых в России острее.
Отсюда неочевидный вывод: RTX PRO 6000 Blackwell на 96 ГБ стоит около миллиона рублей — вдвое дешевле H100 и всего вдвое дороже RTX 5090, при этом памяти в ней больше, чем в H100. Для инференса, где всё упирается в объём VRAM, это сейчас лучшая позиция на российском рынке по соотношению «гигабайты на рубль».
H100 реально лежит на складах, а вот H200 — уже как повезёт: у одних поставщиков в наличии, у других срок поставки 40–60 рабочих дней, то есть два-три месяца.
Гарантия на всё серверное железо в России идёт от продавца, а не от NVIDIA — по всем признакам это параллельный импорт: OEM-маркировка, партномера NVIDIA, фиксация цены по курсу ЦБ на дату платежа. Сроки гарантии разбегаются от 12 месяцев до 5 лет, а продление до пяти лет у некоторых продавцов стоит до четверти цены самой карты. Закладывайте это в бюджет и не считайте карту «купленной навсегда».
Простая арифметика окупаемости
Возьмём реалистичный сценарий: Qwen3.6-35B-A3B на арендованной RTX 4090 по 0.5 доллара в час. Круглосуточно это 360 долларов в месяц, примерно 28 тысяч рублей по курсу ЦБ.
Теперь сравните со своим счётом за API. GigaChat Max для юрлиц стоит 650 ₽ за миллион токенов (вход и выход считаются суммарно). Чтобы 28 тысяч рублей на своё железо окупились, нужно прожигать около 43 миллионов токенов в месяц. Для большинства компаний это много: если у вас чат-бот поддержки на пару сотен обращений в день, API дешевле в разы, и минимальный платёж у Сбера — всего 600 ₽ в месяц.
Ключевая мысль: своё железо выигрывает на постоянной равномерной нагрузке и проигрывает на редкой пиковой. Простаивающая карта стоит денег каждый час, а API не стоит ничего, пока к нему не обращаются. Считайте не пиковую производительность, а среднюю утилизацию — именно она определяет, окупится ли конфигурация.
Самая недооценённая статья расходов — не железо, а человек. Медиана Senior MLOps-инженера на рынке РФ — около 390 тысяч рублей на руки. С учётом НДФЛ и страховых взносов работодателю это обходится примерно в 510 тысяч рублей в месяц, то есть свыше 6 миллионов в год — сопоставимо со стоимостью самой H100. В расчётах TCO, где эта строка присутствует, локальный инференс регулярно проигрывает API там, где «двухстрочный» расчёт из цены GPU и электричества уверенно выигрывал.
Добавьте к этому обслуживание: модели обновляются раз в один-два месяца, и апдейты ломаются. Реальные примеры 2026 года — падение производительности с 300 до 30 токенов в секунду после обновления одного лишь контейнерного образа, и открытый баг-репорт с заголовком «до 1300% медленнее» после минорного апдейта Ollama. Это не редкость, а норма эксплуатации.
Практический вывод: если у вас нет выделенного инженера, аренда GPU почти всегда выгоднее покупки, а API — выгоднее обоих.
Софт: на чём это запускать
- Ollama и LM Studio — минимальный порог входа, ставится за пять минут, годится для прототипа и одного пользователя. В продакшене под нагрузкой не держит. Важная деталь: на MoE-моделях Ollama нередко отдаёт в 2–3 раза меньше токенов, чем llama.cpp на тех же весах — на RTX 4060 это 16 против 45 токенов в секунду. Обычно причина в том, что свежая архитектура ещё не поддержана и модель уходит в режим совместимости. Если скорость выглядит подозрительно низкой, первым делом проверьте на llama.cpp напрямую.
- llama.cpp — король квантизации и запуска на скромном железе, включая CPU-инференс и offload части слоёв в RAM. Незаменим, когда модель почти влезает.
- vLLM и SGLang — то, что нужно для продакшена: continuous batching, эффективный KV-кеш, высокая пропускная способность при многих одновременных запросах. Разница с наивным запуском через Transformers — кратная.
- TensorRT-LLM — максимальная выжимка из карт Nvidia ценой существенно более сложной настройки.
Практическое правило: прототип — на Ollama, продакшен — на vLLM. Промежуточные варианты обычно оборачиваются переписыванием.
Шесть ошибок при переходе на локальный инференс
1. Считать, что MoE экономит память
Самое частое заблуждение. 3 млрд активных параметров не означают 3 млрд в памяти. Все эксперты лежат в VRAM целиком.
2. Забыть про KV-кеш
Модель влезла — и всё упало на длинном контексте. При 256 тысячах токенов кеш может занять больше самих весов. Считайте память под реальную длину запросов, а не под пустую модель.
3. Скачать модель, которую невозможно запустить
DeepSeek V4-Pro лежит в открытом доступе и весит как небольшой датацентр. Открытая лицензия не равна выполнимости на вашем железе.
4. Верить в несуществующие модели
Выдача по этой теме забита AI-генерированными фермами. «Llama 5» не существует, Qwen 4 Coder не подтверждается, DeepSeek R2 не найден. Проверяйте по HuggingFace: если весов там нет, модели нет.
5. Брать плотную модель там, где подойдёт MoE
Плотная модель на 33 млрд занимает столько же памяти, сколько MoE на 35 млрд, но считает в разы медленнее. При прочих равных MoE в 2026-м предпочтительнее.
6. Не проверить лицензию под свой сценарий
MIT у GigaChat и GLM, Apache 2.0 у Qwen, T-Pro, Gemma и Mistral — разрешают коммерческое использование без оговорок. У Kimi лицензия модифицированная, у Llama — собственная, у открытой YandexGPT-5-Lite стоит потолок в 10 млн выходных токенов в месяц. Читайте файл LICENSE, а не пресс-релиз.
Чек-лист перед развёртыванием
- Посчитали VRAM по формуле — параметры × байты на параметр + KV-кеш под реальный контекст?
- Проверили, что это MoE или плотная модель? От этого зависит скорость при одинаковой памяти.
- Модель есть на HuggingFace? Если нет — вероятно, её не существует.
- Прочитали LICENSE, а не пересказ лицензии в новости?
- Прогнали 20–30 своих реальных запросов, а не доверились бенчмаркам?
- Оценили тип нагрузки — равномерная или пиковая? От этого зависит покупка против аренды.
- Заложили KV-кеш и запас хотя бы 15% сверх расчёта?
- Выбрали движок под задачу — Ollama для прототипа, vLLM для продакшена?
- Есть человек на поддержку? Если нет — берите аренду или API.
- Понятно, какие данные вообще обязаны остаться локально? Это определяет архитектуру, а не наоборот.
Итого
Главная новость 2026 года для локального инференса не в том, что открытые модели догнали закрытые — они не догнали. Она в том, что MoE радикально снизил порог входа: модель уровня, за который год назад надо было платить API-провайдеру, теперь помещается в одну видеокарту за счёт того, что активирует десятую часть себя.
Реалистичная картина такая. Настоящий открытый фронтир — DeepSeek V4-Pro, GLM-5.2, Kimi — существует, свободно скачивается и требует стойки серверных карт. Локально запускается крепкий средний класс, и на типовых бизнес-задачах он практически неотличим от закрытых моделей, а отстаёт заметно только на сложном рассуждении и длинных агентских сценариях. Для задач с персональными данными вопрос вообще не в качестве: локальный контур — единственный законный вариант.
И последнее. Meta ушла из открытых весов, gpt-oss не обновлялся с августа 2025 года, а лидерство перешло к китайским лабораториям. Нравится это или нет, но если вы сегодня разворачиваете открытую модель — с высокой вероятностью она будет китайской. Именно поэтому стоит внимательно читать лицензии и проверять модели на своих данных, а не на чужих бенчмарках.
Развернуть локальный контур под ключ
Подберём модель, посчитаем железо, развернём на vLLM и настроим маршрутизацию между локальной моделью и внешним API. Первая консультация бесплатно.