← Блог

Чат-бот по документам ошибается не из-за нейросети

Компании подключают ассистента к своей базе знаний, а через месяц сотрудники перестают ему верить. Обычно первым делом меняют модель — и почти ничего не меняется. Разбираем, где ломается качество на самом деле и как проверить свои документы до покупки.

Октябрь 2026 · 6 минут чтения

Сценарий знакомый. Компания решает: пусть сотрудники спрашивают не коллег, а ассистента — по регламентам, договорам, инструкциям. Подрядчик подключает хорошую языковую модель, загружает папку с документами, демо проходит отлично.

Через месяц выясняется: ассистент уверенно цитирует регламент, который отменили в прошлом году, путает цены из прайса и не находит пункт, который точно есть в договоре. Сотрудники снова пишут коллегам.

Первая реакция — «модель слабая, возьмём помощнее». Иногда это немного помогает, чаще — нет. Большинство ошибок возникает раньше, чем модель вообще видит вопрос.

Как устроен ассистент по документам

Если упростить, путь от папки с файлами до ответа состоит из шести шагов.

Нейросеть — только последний шаг

Большинство ошибок возникает раньше, чем модель видит вопрос

01Сбор

Папки, почта, CRM, учётная система, чаты

02Распознавание

Текст из PDF, сканов, таблиц, презентаций

03Очистка

Дубли, мусор, какая версия действует

04Нарезка

Разделы и пункты, источник у каждого фрагмента

05Поиск

Подходящие фрагменты под вопрос

06Ответ

Модель формулирует ответ со ссылкой

здесь теряется качествоздесь работает нейросеть

Языковая модель работает только на последнем шаге. Если на шаге 5 нашёлся не тот фрагмент или нужный потерялся ещё на шагах 2–4, самая сильная модель не ответит правильно. В худшем случае она ответит уверенно и неправильно.

Пять мест, где теряется качество

1. Сканы и фотографии. Отсканированный договор для компьютера — это картинка, текста в нём нет. Без распознавания такой документ в базе просто пустой. С плохим распознаванием хуже: «150 000» превращается в «150 О00», печать накрывает реквизиты, рукописная правка на полях пропадает.

2. Таблицы. Прайсы, спецификации, графики платежей. При простом извлечении текста строки и столбцы склеиваются, и цена одной позиции оказывается рядом с названием другой. Модель честно перескажет то, что ей дали, то есть неправду.

3. Версии и дубли. «Регламент_2023», «Регламент_2024_новый», «Регламент_финал_испр». Для поиска это три одинаково подходящих документа. Если система не знает, какой из них действует, ассистент процитирует любой.

4. Нарезка. Документ режут на фрагменты, чтобы находить нужное место. Если резать механически, по числу символов, условие «кроме случаев, указанных в п. 4.2» окажется в одном фрагменте, а сам п. 4.2 — в другом. Ассистент найдёт первую половину и ответит без исключения. Резать нужно по структуре документа — разделам, пунктам, строкам, — и с заголовком раздела у каждого фрагмента.

5. Контекст и доступы. Письмо «Да, согласовано, см. ниже» без цепочки ничего не значит. По сообщению из чата без даты не понять, актуально ли оно. А часть документов — зарплаты, договоры с конкретными клиентами — видеть должны не все. Если при загрузке потерять, откуда фрагмент, от какого он числа и кому доступен, ассистент либо отвечает без контекста, либо показывает лишнее.

Во всех пяти случаях замена модели ничего не исправит: ошибка уже в данных, которые ей передают.

Как проверить свою базу до покупки ассистента

Это можно сделать за вечер, без подрядчика.

  1. Соберите 30–50 реальных вопросов. Не придуманных, а тех, что сотрудники действительно задают: из рабочих чатов, почты, обращений в поддержку.
  2. Для каждого найдите правильный ответ руками и запишите, в каком документе и на какой странице он лежит. Это и есть эталонный набор.
  3. Посмотрите, в каком виде лежат эти документы. Сколько из них сканы? Сколько ответов спрятано в таблицах? У скольких есть несколько версий? Это сразу покажет, где будут проблемы.
  4. Проверяйте поиск отдельно от ответа. Когда будете тестировать любое решение, смотрите не только на ответ, но и на то, какие фрагменты оно нашло. Если нужный фрагмент не находится, дело не в модели, и менять её бесполезно.
  5. Требуйте ссылку на источник и честное «не знаю». Ответ без ссылки на конкретное место в документе нельзя проверить. А ассистент, который никогда не говорит «в документах этого нет», рано или поздно начнёт выдумывать.

С таким набором на руках разговор с любым подрядчиком меняется: вместо «покажите демо» — «прогоните наши 50 вопросов и покажите, сколько ответов верных».

Как это делаем мы

В Kalman Lab мы начинаем ассистента не с выбора модели, а с данных. Собираем конвейер, который один раз приводит документы в порядок и дальше держит базу актуальной: новые файлы подтягиваются сами, старые версии помечаются, у каждого фрагмента сохраняются источник, дата и права доступа.

Качество меряем на вашем эталонном наборе до запуска и показываем цифры: сколько вопросов находит поиск, сколько ответов верных, где ассистент честно отказывается. Если окажется, что задачу проще решить без нейросети — например, порядком в папках и нормальным поиском, — так и скажем.

Первый разбор задачи — 30 минут, бесплатно. Расскажите, какие у вас документы и что сотрудники ищут чаще всего, — подскажем, что в них может сломать ассистента.

Дальше в блоге: Свой сервер для нейросети или оплата за запросы: считаем, что дешевле

Контакт

Расскажите о задаче

Опишите её в двух-трёх предложениях. Ответим и сразу скажем, стоит ли за неё браться. Первый созвон — с архитектором, который потом ведёт проект.

Made on
Tilda