Работы / KAVACHAM
Задача
Отвечать по большому собранию текстов так, чтобы каждый ответ можно было проверить: документ и страница.
Нет источника — нет ответа.
Результат и что измерено
Собрана одним человеком с 3 по 25 июля 2026 года — три недели от пустой папки.
Систему обкатывают 30 исследователей в закрытой группе Телеграма: присылают замечания, я по ним дорабатываю.
Для заказчика первый такой проект делаю пилотом и говорю об этом заранее.
Что сделано
- 40 499 документов нарезаны на 469 602 фрагмента, у каждого — числовой отпечаток смысла.
- Поиск идет по смыслу, а не по совпадению слов.
- Ответ собирается только из найденных фрагментов. Не нашел — "не знаю".
- 142 автоматические проверки не дают выпустить ответ без источника.
- Работает в облаке, сайт обновляется после каждой правки.
Инструменты
Python · FastAPI · нарезка документов на фрагменты · эмбеддинги multilingual-e5 · векторный поиск ChromaDB · PyMuPDF · Google Cloud Run · Firestore · GitHub Pages