RAG или fine-tuning: что выбрать для корпоративной LLM
Разбор двух подходов к внедрению LLM на корпоративных данных. Когда RAG выигрывает по цене и точности, когда fine-tuning оправдан, и почему в 80% B2B-задач мы выбираем RAG.
Каждую вторую консультацию по AI-ассистенту нам приносят одну и ту же вводную:
«Хотим обучить свою LLM на наших документах».
Формулировка звучит красиво, но за ней почти всегда стоит RAG, а не fine-tuning. Разберём, чем эти подходы отличаются и как выбрать правильный для вашей задачи.
Что делает fine-tuning
Fine-tuning — это дообучение базовой модели на ваших данных. Веса модели меняются, и она начинает «знать» вашу предметную область, стилистику и терминологию.
Что нужно, чтобы fine-tune работал:
- От 5 000 до 100 000 пар «вопрос — ответ», размеченных вручную или полуавтоматически.
- GPU-инфраструктура (для 7B–13B моделей: H100 / A100 на несколько часов минимум).
- Обновление модели при изменении данных — новая партия документов означает новый цикл fine-tuning.
Fine-tuning идёт хорошо, когда: нужно генерировать однотипные документы (юридические заключения, страховые заключения), или адаптировать модель под специфический язык (медицинская терминология, промышленный сленг).
Что делает RAG
RAG (Retrieval-Augmented Generation) — это конвейер из двух шагов:
- Поиск — вопрос пользователя переводится в вектор, ищется релевантный контекст в вашей базе документов (Qdrant, pgvector, ElasticSearch).
- Генерация — базовая LLM (GigaChat, YandexGPT или локальная Saiga / Mistral) отвечает на вопрос, опираясь на найденный контекст.
Модель при этом не меняется. Ваши данные хранятся в векторной базе.
Главное различие — где оказываются ваши данные и можно ли проверить, откуда взялся ответ.
Сравнение на реальных параметрах
| Критерий | RAG | Fine-tuning |
|---|---|---|
| Первичная стоимость | 700 тыс. – 3 млн ₽ | 2 – 8 млн ₽ |
| Обновление данных | Переиндексация (часы) | Новый цикл обучения (дни) |
| Проверяемость ответов | Есть цитаты из источников | Модель просто «знает» |
| GPU-инфраструктура | Опциональна | Обязательна |
| Галлюцинации | Контролируются через контекст | Возможны без предупреждения |
| Соответствие 152-ФЗ | Данные в вашем контуре | Данные в весах модели |
Когда мы выбираем RAG (в 80% случаев)
- База знаний обновляется чаще, чем раз в квартал.
- Нужны ответы с цитированием источников (юр. кабинеты, поддержка, продажи).
- Не хочется тратить бюджет на GPU и MLOps.
- Клиент не готов ждать 2 недели на каждое обновление модели.
Пример: AI-ассистент для B2B-продаж — 12 000 SKU в каталоге, менеджеры получают ответы за 12 минут вместо 2 часов. RAG на Qdrant + локальная Saiga. Обновление каталога — раз в неделю, автоматической переиндексацией.
Когда мы выбираем fine-tuning
- Массовая генерация однотипных документов: типовые договоры, счета-фактуры, уведомления.
- Стилистическая адаптация: юридический язык, промышленный жаргон, официально-деловой стиль без исключений.
- База данных стабильна: медицинские протоколы, регламенты безопасности, ГОСТы.
Гибридный подход
Иногда используем оба одновременно: fine-tune адаптирует базовую модель под тон и стиль, а RAG подтягивает актуальные данные. Такое встречается в проектах с высокими требованиями к формату вывода и одновременно быстро меняющимся контентом (например, автоматическая генерация коммерческих предложений).
Практический критерий выбора
Один вопрос, который отсеивает 80% сомнений:
«Как часто меняются данные, на которые модель должна опираться?»
- Чаще раза в месяц → RAG.
- Реже раза в квартал и есть 5 000+ размеченных примеров → fine-tuning может окупиться.
- Не знаете точно → начинайте с RAG, потом добавите fine-tuning, если нужно.
Ошибка большинства проектов, которые к нам приносят с fine-tuning в ТЗ: клиент видит «обучить свою модель» как единственный способ добиться качества. На практике RAG выигрывает по стоимости внедрения в 3–5 раз, а по качеству ответов — на 90% задач сравним или лучше, потому что галлюцинации контролируются цитированием источников.
Что делать дальше
Если сомневаетесь, что подходит вашей задаче — запишитесь на бесплатную встречу. За 60 минут разберём вашу базу знаний, покажем архитектуру RAG или fine-tuning под ваш случай и оценим бюджет.
Читайте также
Похожая задача в вашем бизнесе?
За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.