AI и RAG
RAG Pipeline
Ответы на вопросы по документам строятся по схеме Retrieval-Augmented Generation:
- Retrieval — по вопросу пользователя выполняется гибридный поиск по векторной БД, выбираются Top-K релевантных чанков (K=5–10).
- Формирование промпта — в контекст попадают найденные фрагменты, отдельно задаётся system-инструкция («Ты юридический помощник…») и вопрос.
- Генерация — LLM (через Ollama: llama3, mistral, qwen и др.) генерирует ответ на основе контекста.
- Пост-обработка — добавление ссылок на источники (файлы, фрагменты), форматирование, при необходимости деанонимизация.
Модели
| Задача | Модель | Примечание |
|---|---|---|
| Эмбеддинги | mxbai-embed-large / bge-m3 | Локально через Ollama |
| LLM (генерация) | llama3 / mistral / qwen | Локально через Ollama |
| Транскрипция | Whisper large-v3 | Аудио/видео |
| OCR | Apple Vision / Tesseract | PDF со сканами |
Конфигурация
В БД (app_config) задаются:
default_embedding_model— модель эмбеддинговdefault_embedding_dimensions— размерность (например, 1024)default_chunk_sizeиdefault_chunk_overlap— параметры разбиения текста для RAG
Всё работает локально: данные не покидают машину пользователя.