Перейти к содержанию

AI и RAG

RAG Pipeline

Ответы на вопросы по документам строятся по схеме Retrieval-Augmented Generation:

  1. Retrieval — по вопросу пользователя выполняется гибридный поиск по векторной БД, выбираются Top-K релевантных чанков (K=5–10).
  2. Формирование промпта — в контекст попадают найденные фрагменты, отдельно задаётся system-инструкция («Ты юридический помощник…») и вопрос.
  3. Генерация — LLM (через Ollama: llama3, mistral, qwen и др.) генерирует ответ на основе контекста.
  4. Пост-обработка — добавление ссылок на источники (файлы, фрагменты), форматирование, при необходимости деанонимизация.

Модели

Задача Модель Примечание
Эмбеддинги mxbai-embed-large / bge-m3 Локально через Ollama
LLM (генерация) llama3 / mistral / qwen Локально через Ollama
Транскрипция Whisper large-v3 Аудио/видео
OCR Apple Vision / Tesseract PDF со сканами

Конфигурация

В БД (app_config) задаются:

  • default_embedding_model — модель эмбеддингов
  • default_embedding_dimensions — размерность (например, 1024)
  • default_chunk_size и default_chunk_overlap — параметры разбиения текста для RAG

Всё работает локально: данные не покидают машину пользователя.