Перейти к контенту
AI и LLM

Локальная LLM для B2B: когда нужна, сколько стоит, сколько занимает

Разбор экономики локальных LLM для бизнеса: когда on-premise действительно оправдан, сколько это реально стоит, какая инфраструктура нужна и как оценить срок внедрения.

Автор: Николай Мазур · · 6 мин чтения

Каждый месяц слышим одно и то же:

«Нам нужна своя локальная LLM. Не хотим отправлять данные в OpenAI».

И почти всегда за этим стоит страх перед облачными LLM, а не реальное требование. Разберём, когда локальная модель действительно нужна и сколько это стоит на практике.

Когда локальная LLM обоснована

Три сценария, где мы всегда идём на локальную модель:

  1. Категория субъекта КИИ, ФЗ-187. Данные не могут покидать периметр. Никаких компромиссов.
  2. Работа с подрядчиками ВПК или гособоронзаказом. Даже отечественные облачные LLM могут не подойти по регламентам заказчика.
  3. Медицинские, финансовые или юридические данные с жёстким compliance. Здесь дешевле локальная LLM, чем каждый раз обосновывать использование облачной перед аудитом.

Когда локальная LLM — избыточна

Пять сценариев, где GigaChat / YandexGPT дешевле и точнее:

  1. Обычный B2B без работы с гостайной. Отечественные облачные LLM хранят данные в РФ по договору, что соответствует 152-ФЗ.
  2. Задачи, требующие сильной языковой модели. Локальные 7B–13B модели проигрывают GigaChat и YandexGPT на русском языке, особенно в длинных ответах.
  3. Малый объём запросов (до 10 000 в день). Экономика GPU не окупается — облачный биллинг оказывается в разы дешевле.
  4. Быстрый старт. Локальная модель требует 4–8 недель на MVP; облачная — 2–3 недели.
  5. Нет инженера для DevOps локальной GPU-инфраструктуры. Поддержка стоит денег и требует экспертизы.

Часто ответ не «или — или», а двухконтурная схема: чувствительные запросы обрабатывает локальная модель, публичные уходят в облачную. Слой поиска при этом общий, поэтому решение можно менять по ходу проекта, не переписывая систему.

Двухконтурная схема: запрос попадает в слой маршрутизации, который проверяет наличие чувствительных данных; такие запросы идут в локальную модель внутри периметра рядом с векторным хранилищем корпоративных документов, а публичные — в облачную модель

Двухконтурная схема: выбор модели становится настройкой маршрутизации, а не архитектурным решением, которое нельзя отменить.

Инфраструктура: что нужно на практике

Для MVP с локальной LLM:

  • GPU-сервер: 1x NVIDIA A100 (80GB) или 2x RTX 4090. Аренда в Selectel / Yandex Cloud / VK Cloud: 150–300 тыс. ₽/мес.
  • Векторная база: Qdrant self-hosted или pgvector. Без отдельного сервера.
  • Модель: Saiga (русский язык), Mistral 7B / Qwen 2.5 7B (общая), локальные модели RUSSIAN NLP research.
  • Инфраструктура: Docker + Nginx + мониторинг (Grafana / Prometheus).

Для production (тысячи запросов в сутки):

  • 2–4 GPU-сервера с балансировкой и failover.
  • Отдельный сервер для векторной базы с бэкапами.
  • CI/CD для регулярного обновления индекса.
  • On-call инженер или retainer у подрядчика.

Стоимость: реальные цифры

Разбираем на примере MVP с локальной LLM для 50 пользователей:

Разработка (единоразово)

  • Пилот 3–6 недель: 700 тыс. – 1.5 млн ₽.
  • Полноценный production 3–4 месяца: 2.5 – 5 млн ₽.

Инфраструктура (ежемесячно)

  • GPU-аренда: 150–300 тыс. ₽/мес (для MVP).
  • Разработка / поддержка: 100–250 тыс. ₽/мес.
  • Мониторинг, DevOps: включено в поддержку.

Итого за первый год: 4.5 – 10 млн ₽.

Для сравнения: тот же функционал на GigaChat / YandexGPT под ключ — 1.5 – 3 млн ₽ на разработку и 30–80 тыс. ₽/мес на API-биллинг.

Локальная LLM окупается, если экономит время сотрудников на сумму больше 500 тыс. ₽/мес, либо compliance-требования делают облачные варианты невозможными.

Как выбирать между моделями

Для русского языка мы используем три семейства:

  • Saiga (7B / 13B) — специально адаптирована под русский, хороша для диалоговых задач и генерации коротких ответов.
  • Mistral 7B / Qwen 2.5 (7B / 14B) — сильные многозадачные модели, но требуют промт-инжиниринга для стабильного русского вывода.
  • Локальные Russian NLP модели (Vikhr, YandexGPT Lite) — если есть доступ; часто выигрывают на бизнес-задачах.

Выбор идёт по трём критериям:

  1. Задача: диалог vs генерация документов vs поиск.
  2. GPU-бюджет: 7B помещается в один A100, 13B требует 2 GPU или квантизацию.
  3. Latency-требования: 7B отвечает за 2–4 секунды, 13B — 5–10 секунд.

Что делать вместо «нам нужна своя LLM»

Правильные вопросы перед принятием решения:

  1. Есть ли compliance-запрет на облачные LLM? Если нет — начинайте с GigaChat / YandexGPT.
  2. Сколько запросов в день будет реально? До 5 000 — облачная. От 30 000 — локальная окупается.
  3. Готовы ли к DevOps локальной инфраструктуры? Если нет — retainer у подрядчика 200+ тыс. ₽/мес.
  4. Есть ли уже 3–5 задач, где LLM реально сэкономит время? Если нет — сначала пилот на одной, потом решение о локальной модели.

Живой пример

AI-ассистент для B2B-продаж — локальная Saiga на инфраструктуре заказчика, 12 000 SKU в каталоге, работа с подрядчиками ВПК (compliance-требование). Проект окупился за 3 месяца при бюджете 4.5 млн ₽.

Здесь compliance был реальным ограничением. Без него мы бы взяли GigaChat, и бюджет разработки был бы вдвое меньше.

Дальше

Если сомневаетесь — запишитесь на бесплатную встречу. За 60 минут разберём, где у вас реальный compliance-запрет, а где страх, и покажем оптимальный вариант по бюджету и качеству.

Больше о нашем подходе к локальным LLM — на странице услуги.

Похожая задача в вашем бизнесе?

За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.