RESEARCH

Мы проверяем. Чтобы давать
действительно точные ответы.

Сравниваем разные подходы к поиску по базе документации RetailSoft. Реальные данные, честные выводы, понятные графики.

Больше, чем просто поиск.

Это понимание контекста.
1 521
статья
в итоговой базе
(из 1 649 после очистки)
9 308
изображений
интерфейсов, настроек, схем
?
105
тестовых вопросов
замороженный набор P / V / I / N

Сравнение подходов (текущий самозамер)

TESTS IN PROGRESS
KЕд. поискаСловарьСмысл / модельСлияниеMRRTop-1Время
K1целая статьяBM250,897584,2% (1280)8,6 мс
K2фрагментBM250,904884,9% (1292)52,7 мс
K3фрагментe5-base0,294021,2% (323)21,9 мс
K4фрагментBM25e5-baseRRF0,509739,8% (606)79,6 мс
K5фрагментBGE-M3 sparse layerBGE-M3RRF (родной)0,671853,2% (809)62,6 мс
K6фрагмент + 9 308 изображенийBM25voyage-multimodal-3,5RRF0,726460,8% (925)≈366 мс
K7фрагментBM25voyage-4-largeRRF0,723661,4% (934)366 мс
MRR (чем выше — тем лучше)
K10,897
K20,905
K30,294
K40,51
K50,672
K60,726
K70,724
Top-1 (точный документ)
K184,2
K284,9
K321,2
K439,8
K553,2
K660,8
K761,4
Время ответа (мс)
K18,6
K252,7
K321,9
K479,6
K562,6
K6366
K7366
Самозамер — прибор, а не финальный рейтинг.

Запросом служит заголовок статьи, поэтому тест естественно благоприятен lexical-поиску. Живой финальный этап на 105 вопросах идёт отдельно.

МЕТОДИКА

Первый тест показал свою границу

Первый живой этап использовал 70 вопросов и K1–K4. Разница по смыслу оказалась меньше измеренного шума слепого судьи.

Исторический живой этап · K1–K4

Размах по смысловой оценке: 3 ответа из 20. Повторные оценки противоречили друг другу в 13 случаях из 80.

Если разница между системами меньше шума измерителя, надо улучшать тест.

Именно поэтому набор вырос: 70 → предел чувствительности → 105 вопросов.

Качество корпуса начинается раньше модели

После исправления потерянных заголовков и разъехавшихся страниц структура изменилась 1 649 → 1 521 статья. Это не потеря документов: раздробленные части были сшиты обратно.

105 ВОПРОСОВ

50 обычных + 55 тяжёлых

Тяжёлые вопросы специально проверяют места, где простой «похожий текст» может вводить в заблуждение.

P · 15

Перифраз

Значимые слова статьи специально обходятся. Semantic может помочь.

V · 15

Версии и продукты

Смысловая близость может мешать точной версии, цифре или продукту.

I · 15

Ответ на изображении

Найти статью → понять, что текста мало → запросить изображение → ответить по экрану.

N · 10

Отрицательные контроли

Правильное поведение — честно сказать, что ответа в базе нет.

Вопрос, построенный по пересказу картинки, измеряет качество пересказа — а не качество поиска.

Из пяти ранних image-вопросов без ручной сверки четыре оказались негодными, поэтому редакция 2 была заморожена до прогона.

ВЫВОДЫ

Что уже обосновано — и где заканчиваются выводы

Что уже можно утверждать

  • Для этого корпуса K1/K2 — серьёзные рабочие решения.
  • Semantic сильно зависит от конкретной модели.
  • Hybrid не гарантирует улучшения.
  • Корпус нужно проверять так же внимательно, как модель.
  • Нужны отрицательные контроли и честный отказ.
  • Судья имеет собственную погрешность.

Чего мы не доказали

  • Не доказано, что BM25 лучше semantic вообще.
  • Self-check не является финальным пользовательским рейтингом.
  • Старые judge-проценты нельзя переносить на новый пул 105.
  • Image-ablation не доказывает бесполезность изображений.
  • RoSBERTa и BGE-M3 multi-vector не проиграли — они отложены.
  • Финальные judge-результаты ещё ожидаются.

Финальный живой этап · 105 вопросов

ОЖИДАЕТСЯ / В ПРОГОНЕ

K5: judge 1 идёт прогон. K6/K7: judge pending. Пустые значения не считаются нулём и не участвуют в выводах.

Не следовать рецепту. Проверять.

Главный результат исследования — не название победившей модели. Мы получили способ понять, насколько сложный поиск действительно нужен конкретной базе знаний. Другой корпус может дать другой результат.

Словарь терминов

BM25 — полнотекстовый поиск по словам и редким терминам. Embedding — числовое представление смысла текста. RRF — объединение рейтингов. MRR — насколько высоко находится первый правильный результат. OCR — распознавание текста на изображении.

Почему K2 остаётся в таблице?

K2 измерена полностью, но снята как отдельный финальный участник: это вариант lexical-подхода, а не самостоятельная технология. Удалять уже полученные измерения было бы неправильно.