Локальная LLM для B2B: когда нужна, сколько стоит, сколько занимает
Разбор экономики локальных LLM для бизнеса: когда on-premise действительно оправдан, сколько это реально стоит, какая инфраструктура нужна и как оценить срок внедрения.
Каждый месяц слышим одно и то же:
«Нам нужна своя локальная LLM. Не хотим отправлять данные в OpenAI».
И почти всегда за этим стоит страх перед облачными LLM, а не реальное требование. Разберём, когда локальная модель действительно нужна и сколько это стоит на практике.
Когда локальная LLM обоснована
Три сценария, где мы всегда идём на локальную модель:
- Категория субъекта КИИ, ФЗ-187. Данные не могут покидать периметр. Никаких компромиссов.
- Работа с подрядчиками ВПК или гособоронзаказом. Даже отечественные облачные LLM могут не подойти по регламентам заказчика.
- Медицинские, финансовые или юридические данные с жёстким compliance. Здесь дешевле локальная LLM, чем каждый раз обосновывать использование облачной перед аудитом.
Когда локальная LLM — избыточна
Пять сценариев, где GigaChat / YandexGPT дешевле и точнее:
- Обычный B2B без работы с гостайной. Отечественные облачные LLM хранят данные в РФ по договору, что соответствует 152-ФЗ.
- Задачи, требующие сильной языковой модели. Локальные 7B–13B модели проигрывают GigaChat и YandexGPT на русском языке, особенно в длинных ответах.
- Малый объём запросов (до 10 000 в день). Экономика GPU не окупается — облачный биллинг оказывается в разы дешевле.
- Быстрый старт. Локальная модель требует 4–8 недель на MVP; облачная — 2–3 недели.
- Нет инженера для DevOps локальной GPU-инфраструктуры. Поддержка стоит денег и требует экспертизы.
Часто ответ не «или — или», а двухконтурная схема: чувствительные запросы обрабатывает локальная модель, публичные уходят в облачную. Слой поиска при этом общий, поэтому решение можно менять по ходу проекта, не переписывая систему.
Двухконтурная схема: выбор модели становится настройкой маршрутизации, а не архитектурным решением, которое нельзя отменить.
Инфраструктура: что нужно на практике
Для MVP с локальной LLM:
- GPU-сервер: 1x NVIDIA A100 (80GB) или 2x RTX 4090. Аренда в Selectel / Yandex Cloud / VK Cloud: 150–300 тыс. ₽/мес.
- Векторная база: Qdrant self-hosted или pgvector. Без отдельного сервера.
- Модель: Saiga (русский язык), Mistral 7B / Qwen 2.5 7B (общая), локальные модели RUSSIAN NLP research.
- Инфраструктура: Docker + Nginx + мониторинг (Grafana / Prometheus).
Для production (тысячи запросов в сутки):
- 2–4 GPU-сервера с балансировкой и failover.
- Отдельный сервер для векторной базы с бэкапами.
- CI/CD для регулярного обновления индекса.
- On-call инженер или retainer у подрядчика.
Стоимость: реальные цифры
Разбираем на примере MVP с локальной LLM для 50 пользователей:
Разработка (единоразово)
- Пилот 3–6 недель: 700 тыс. – 1.5 млн ₽.
- Полноценный production 3–4 месяца: 2.5 – 5 млн ₽.
Инфраструктура (ежемесячно)
- GPU-аренда: 150–300 тыс. ₽/мес (для MVP).
- Разработка / поддержка: 100–250 тыс. ₽/мес.
- Мониторинг, DevOps: включено в поддержку.
Итого за первый год: 4.5 – 10 млн ₽.
Для сравнения: тот же функционал на GigaChat / YandexGPT под ключ — 1.5 – 3 млн ₽ на разработку и 30–80 тыс. ₽/мес на API-биллинг.
Локальная LLM окупается, если экономит время сотрудников на сумму больше 500 тыс. ₽/мес, либо compliance-требования делают облачные варианты невозможными.
Как выбирать между моделями
Для русского языка мы используем три семейства:
- Saiga (7B / 13B) — специально адаптирована под русский, хороша для диалоговых задач и генерации коротких ответов.
- Mistral 7B / Qwen 2.5 (7B / 14B) — сильные многозадачные модели, но требуют промт-инжиниринга для стабильного русского вывода.
- Локальные Russian NLP модели (Vikhr, YandexGPT Lite) — если есть доступ; часто выигрывают на бизнес-задачах.
Выбор идёт по трём критериям:
- Задача: диалог vs генерация документов vs поиск.
- GPU-бюджет: 7B помещается в один A100, 13B требует 2 GPU или квантизацию.
- Latency-требования: 7B отвечает за 2–4 секунды, 13B — 5–10 секунд.
Что делать вместо «нам нужна своя LLM»
Правильные вопросы перед принятием решения:
- Есть ли compliance-запрет на облачные LLM? Если нет — начинайте с GigaChat / YandexGPT.
- Сколько запросов в день будет реально? До 5 000 — облачная. От 30 000 — локальная окупается.
- Готовы ли к DevOps локальной инфраструктуры? Если нет — retainer у подрядчика 200+ тыс. ₽/мес.
- Есть ли уже 3–5 задач, где LLM реально сэкономит время? Если нет — сначала пилот на одной, потом решение о локальной модели.
Живой пример
AI-ассистент для B2B-продаж — локальная Saiga на инфраструктуре заказчика, 12 000 SKU в каталоге, работа с подрядчиками ВПК (compliance-требование). Проект окупился за 3 месяца при бюджете 4.5 млн ₽.
Здесь compliance был реальным ограничением. Без него мы бы взяли GigaChat, и бюджет разработки был бы вдвое меньше.
Дальше
Если сомневаетесь — запишитесь на бесплатную встречу. За 60 минут разберём, где у вас реальный compliance-запрет, а где страх, и покажем оптимальный вариант по бюджету и качеству.
Больше о нашем подходе к локальным LLM — на странице услуги.
Читайте также
Похожая задача в вашем бизнесе?
За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.