Перейти к контенту
AI и LLM

RAG или fine-tuning: что выбрать для корпоративной LLM

Разбор двух подходов к внедрению LLM на корпоративных данных. Когда RAG выигрывает по цене и точности, когда fine-tuning оправдан, и почему в 80% B2B-задач мы выбираем RAG.

Автор: Николай Мазур · · 7 мин чтения

Каждую вторую консультацию по AI-ассистенту нам приносят одну и ту же вводную:

«Хотим обучить свою LLM на наших документах».

Формулировка звучит красиво, но за ней почти всегда стоит RAG, а не fine-tuning. Разберём, чем эти подходы отличаются и как выбрать правильный для вашей задачи.

Что делает fine-tuning

Fine-tuning — это дообучение базовой модели на ваших данных. Веса модели меняются, и она начинает «знать» вашу предметную область, стилистику и терминологию.

Что нужно, чтобы fine-tune работал:

  • От 5 000 до 100 000 пар «вопрос — ответ», размеченных вручную или полуавтоматически.
  • GPU-инфраструктура (для 7B–13B моделей: H100 / A100 на несколько часов минимум).
  • Обновление модели при изменении данных — новая партия документов означает новый цикл fine-tuning.

Fine-tuning идёт хорошо, когда: нужно генерировать однотипные документы (юридические заключения, страховые заключения), или адаптировать модель под специфический язык (медицинская терминология, промышленный сленг).

Что делает RAG

RAG (Retrieval-Augmented Generation) — это конвейер из двух шагов:

  1. Поиск — вопрос пользователя переводится в вектор, ищется релевантный контекст в вашей базе документов (Qdrant, pgvector, ElasticSearch).
  2. Генерация — базовая LLM (GigaChat, YandexGPT или локальная Saiga / Mistral) отвечает на вопрос, опираясь на найденный контекст.

Модель при этом не меняется. Ваши данные хранятся в векторной базе.

Сравнение RAG и fine-tuning: в RAG документы остаются в вашем индексе, модель получает нужный фрагмент в момент запроса и отвечает с цитатой, обновление занимает часы; в fine-tuning данные впитываются в веса модели, обновление требует нового цикла обучения, источник ответа показать нельзя

Главное различие — где оказываются ваши данные и можно ли проверить, откуда взялся ответ.

Сравнение на реальных параметрах

КритерийRAGFine-tuning
Первичная стоимость700 тыс. – 3 млн ₽2 – 8 млн ₽
Обновление данныхПереиндексация (часы)Новый цикл обучения (дни)
Проверяемость ответовЕсть цитаты из источниковМодель просто «знает»
GPU-инфраструктураОпциональнаОбязательна
ГаллюцинацииКонтролируются через контекстВозможны без предупреждения
Соответствие 152-ФЗДанные в вашем контуреДанные в весах модели

Когда мы выбираем RAG (в 80% случаев)

  • База знаний обновляется чаще, чем раз в квартал.
  • Нужны ответы с цитированием источников (юр. кабинеты, поддержка, продажи).
  • Не хочется тратить бюджет на GPU и MLOps.
  • Клиент не готов ждать 2 недели на каждое обновление модели.

Пример: AI-ассистент для B2B-продаж — 12 000 SKU в каталоге, менеджеры получают ответы за 12 минут вместо 2 часов. RAG на Qdrant + локальная Saiga. Обновление каталога — раз в неделю, автоматической переиндексацией.

Когда мы выбираем fine-tuning

  • Массовая генерация однотипных документов: типовые договоры, счета-фактуры, уведомления.
  • Стилистическая адаптация: юридический язык, промышленный жаргон, официально-деловой стиль без исключений.
  • База данных стабильна: медицинские протоколы, регламенты безопасности, ГОСТы.

Гибридный подход

Иногда используем оба одновременно: fine-tune адаптирует базовую модель под тон и стиль, а RAG подтягивает актуальные данные. Такое встречается в проектах с высокими требованиями к формату вывода и одновременно быстро меняющимся контентом (например, автоматическая генерация коммерческих предложений).

Практический критерий выбора

Один вопрос, который отсеивает 80% сомнений:

«Как часто меняются данные, на которые модель должна опираться?»

  • Чаще раза в месяц → RAG.
  • Реже раза в квартал и есть 5 000+ размеченных примеров → fine-tuning может окупиться.
  • Не знаете точно → начинайте с RAG, потом добавите fine-tuning, если нужно.

Ошибка большинства проектов, которые к нам приносят с fine-tuning в ТЗ: клиент видит «обучить свою модель» как единственный способ добиться качества. На практике RAG выигрывает по стоимости внедрения в 3–5 раз, а по качеству ответов — на 90% задач сравним или лучше, потому что галлюцинации контролируются цитированием источников.

Что делать дальше

Если сомневаетесь, что подходит вашей задаче — запишитесь на бесплатную встречу. За 60 минут разберём вашу базу знаний, покажем архитектуру RAG или fine-tuning под ваш случай и оценим бюджет.

Похожая задача в вашем бизнесе?

За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.