Сколько стоит RAG для компании в 2026 году: бюджет, сроки, из чего складывается цена
Реальные цифры внедрения RAG-системы на корпоративных данных: от пилота за 700 тысяч до промышленного контура за 2,5–5 млн ₽. Что входит в бюджет и на чём можно сэкономить.
Короткий ответ: пилот RAG-системы на ограниченном корпусе документов стоит от 700 тысяч рублей и занимает 3–6 недель. Промышленный контур — с ролями доступа, аудитом ответов и автоматическим обновлением индекса — от 2,5 до 5 млн рублей и 2–4 месяца работы. GPU-инфраструктура считается отдельно: аренда в российских облаках — от 50–150 тыс. ₽/мес, покупка сервера — от 1,5 млн ₽ разово.
Теперь разберём, откуда берутся эти цифры и почему вилка такая широкая.
Из чего складывается бюджет RAG-проекта
RAG (Retrieval-Augmented Generation) — это не «одна нейросеть», а конвейер: подготовка документов → векторный индекс → поиск → генерация ответа с цитатами. Бюджет распределяется примерно так:
| Статья | Доля бюджета | Что внутри |
|---|---|---|
| Подготовка данных | 25–35% | Парсинг PDF/Excel/1С, чистка, разбиение на чанки, метаданные |
| Поиск и индекс | 20–25% | Векторная БД (Qdrant), гибридный поиск, ре-ранкинг |
| Генерация и промпты | 15–20% | Выбор модели, промпт-инжиниринг, цитирование источников |
| Интеграции | 15–20% | CRM, Telegram, корпоративный портал, SSO |
| Качество и безопасность | 15–20% | Оценка ответов, роли доступа, логирование, fallback на человека |
Работа с моделью — самая обсуждаемая и одна из самых дешёвых статей бюджета. Основные деньги уходят до неё.
Главный сюрприз для заказчиков: самая дорогая часть — не «нейросеть», а подготовка данных. Если ваша база знаний — это 10 000 PDF со сканами, таблицами и версиями одного и того же регламента, именно здесь уйдёт треть бюджета.
Что влияет на цену сильнее всего
1. Состояние данных. Чистая база в Confluence и свалка сканов в сетевой папке — проекты разной стоимости при одинаковой формулировке задачи.
2. Облачная или локальная модель. GigaChat и YandexGPT по API — дешевле на старте, оплата за токены. Локальная LLM (Saiga, Qwen, Mistral) — дороже во внедрении, но данные не покидают периметр, а расходы не растут с объёмом запросов. Для отраслей с чувствительными данными (юристы, медицина, оборонка) локальный контур — фактически единственный вариант.
3. Требования к точности. «Ассистент для внутренних вопросов сотрудников» и «бот, который отвечает клиентам от имени компании» — разные уровни ответственности. Во втором случае закладывайте бюджет на систему оценки качества ответов и человека в контуре.
4. Число интеграций. Каждая система-источник (1С, CRM, СЭД) — это отдельный коннектор и отдельное тестирование.
Как сэкономить без потери качества
- Начните с пилота на одном сценарии. 2–3 типовых вопроса, ограниченный корпус документов, 20–50 реальных запросов для проверки. Это от 700 тыс. ₽ и даёт честный ответ на вопрос «работает ли это на наших данных» до того, как вы потратите миллионы.
- Не дообучайте модель. В 80% B2B-задач fine-tuning не нужен — RAG на хорошем индексе даёт лучший результат за меньшие деньги. Подробнее — в нашем разборе RAG против fine-tuning.
- Арендуйте GPU, пока не выйдете на стабильную нагрузку. Покупка сервера окупается при постоянном потоке запросов, но на этапе пилота это замороженные деньги.
Сроки: чего ждать по этапам
- Discovery (1–2 недели). Аудит данных, выбор сценариев, оценка рисков. Здесь выясняется реальный объём работ.
- Пилот (3–6 недель). Рабочий прототип на реальных документах с метриками качества.
- Промышленный контур (2–4 месяца от старта). Роли, мониторинг, обновление индекса, обучение сотрудников.
Если подрядчик обещает промышленный RAG «под ключ за месяц» — он либо не делал этого раньше, либо под «RAG» имеет в виду обёртку над ChatGPT без работы с вашими данными.
Итог
- Пилот: от 700 тыс. ₽, 3–6 недель — честная проверка на ваших данных.
- Промышленный контур: от 2,5 млн ₽, 2–4 месяца — с безопасностью, ролями и метриками качества.
- GPU: аренда от 50 тыс. ₽/мес или сервер от 1,5 млн ₽ — отдельной строкой.
Хотите оценку под ваш корпус документов? Разберём вашу задачу за 60 минут — покажем архитектуру, риски и что можно проверить на пилоте. Подробнее об услуге — Локальная LLM и RAG для бизнеса.
Читайте также
Похожая задача в вашем бизнесе?
За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.