Мы проверяем. Чтобы давать
действительно точные ответы.
Сравниваем разные подходы к поиску по базе документации RetailSoft. Реальные данные, честные выводы, понятные графики.
Это понимание контекста.
(из 1 649 после очистки)
Сравнение подходов (текущий самозамер)
TESTS IN PROGRESS| K | Ед. поиска | Словарь | Смысл / модель | Слияние | MRR | Top-1 | Время |
|---|---|---|---|---|---|---|---|
| K1 | целая статья | BM25 | — | — | 0,8975 | 84,2% (1280) | 8,6 мс |
| K2 | фрагмент | BM25 | — | — | 0,9048 | 84,9% (1292) | 52,7 мс |
| K3 | фрагмент | — | e5-base | — | 0,2940 | 21,2% (323) | 21,9 мс |
| K4 | фрагмент | BM25 | e5-base | RRF | 0,5097 | 39,8% (606) | 79,6 мс |
| K5 | фрагмент | BGE-M3 sparse layer | BGE-M3 | RRF (родной) | 0,6718 | 53,2% (809) | 62,6 мс |
| K6 | фрагмент + 9 308 изображений | BM25 | voyage-multimodal-3,5 | RRF | 0,7264 | 60,8% (925) | ≈366 мс |
| K7 | фрагмент | BM25 | voyage-4-large | RRF | 0,7236 | 61,4% (934) | 366 мс |
Запросом служит заголовок статьи, поэтому тест естественно благоприятен lexical-поиску. Живой финальный этап на 105 вопросах идёт отдельно.
Первый тест показал свою границу
Первый живой этап использовал 70 вопросов и K1–K4. Разница по смыслу оказалась меньше измеренного шума слепого судьи.
Исторический живой этап · K1–K4
Размах по смысловой оценке: 3 ответа из 20. Повторные оценки противоречили друг другу в 13 случаях из 80.
Именно поэтому набор вырос: 70 → предел чувствительности → 105 вопросов.
Качество корпуса начинается раньше модели
После исправления потерянных заголовков и разъехавшихся страниц структура изменилась 1 649 → 1 521 статья. Это не потеря документов: раздробленные части были сшиты обратно.
50 обычных + 55 тяжёлых
Тяжёлые вопросы специально проверяют места, где простой «похожий текст» может вводить в заблуждение.
Перифраз
Значимые слова статьи специально обходятся. Semantic может помочь.
Версии и продукты
Смысловая близость может мешать точной версии, цифре или продукту.
Ответ на изображении
Найти статью → понять, что текста мало → запросить изображение → ответить по экрану.
Отрицательные контроли
Правильное поведение — честно сказать, что ответа в базе нет.
Из пяти ранних image-вопросов без ручной сверки четыре оказались негодными, поэтому редакция 2 была заморожена до прогона.
Что уже обосновано — и где заканчиваются выводы
Что уже можно утверждать
- Для этого корпуса K1/K2 — серьёзные рабочие решения.
- Semantic сильно зависит от конкретной модели.
- Hybrid не гарантирует улучшения.
- Корпус нужно проверять так же внимательно, как модель.
- Нужны отрицательные контроли и честный отказ.
- Судья имеет собственную погрешность.
Чего мы не доказали
- Не доказано, что BM25 лучше semantic вообще.
- Self-check не является финальным пользовательским рейтингом.
- Старые judge-проценты нельзя переносить на новый пул 105.
- Image-ablation не доказывает бесполезность изображений.
- RoSBERTa и BGE-M3 multi-vector не проиграли — они отложены.
- Финальные judge-результаты ещё ожидаются.
Финальный живой этап · 105 вопросов
ОЖИДАЕТСЯ / В ПРОГОНЕK5: judge 1 идёт прогон. K6/K7: judge pending. Пустые значения не считаются нулём и не участвуют в выводах.
Главный результат исследования — не название победившей модели. Мы получили способ понять, насколько сложный поиск действительно нужен конкретной базе знаний. Другой корпус может дать другой результат.
Словарь терминов
BM25 — полнотекстовый поиск по словам и редким терминам. Embedding — числовое представление смысла текста. RRF — объединение рейтингов. MRR — насколько высоко находится первый правильный результат. OCR — распознавание текста на изображении.
Почему K2 остаётся в таблице?
K2 измерена полностью, но снята как отдельный финальный участник: это вариант lexical-подхода, а не самостоятельная технология. Удалять уже полученные измерения было бы неправильно.