директор и машина · производственный цикл · запись № 001 · · Давид Герштейн
Распознавание документов: как мы подняли точность с 59% до 85% — не меняя модель
Точность извлечения полей из документов выросла с 59% до 85% без обучения модели: спецификации на каждый из 79 типов, режимы доверия (авто / с проверкой / руками) и дорогая модель только на сложных случаях. Раскладка комплекта: 1,5 часа → минуты.
На демо распознавание документов работает всегда. Подрядчик показывает чистый скан паспорта, система вытаскивает поля, все довольны. Потом наступает реальный поток: фото с телефона под углом, справка на трёх листах в пяти файлах, рукописные вставки, печать поверх текста. И оказывается, что между демо и работой лежит несколько месяцев настоящей работы.
Это разбор такого пути: поток клиентских документов в консультационном бизнесе, 79 типов документов, точность извлечения ключевых полей — с 59% на старте до 85% после калибровки. Модель мы не обучали и не меняли. Всё, что дало прирост, — организация вокруг модели.
Откуда берутся 59%
Стартовая точность считалась честно: по ключевым полям (фамилии, имена, даты, номера — то, из-за чего документ вообще обрабатывают), на реальном потоке, сверкой с человеком. Не «доля распознанных документов», а «доля полей, которые можно не перепроверять».
59% — это типичный результат «модель как есть плюс универсальный промпт». Дальше выяснилось, что потери сидят не в модели, а в трёх местах: система не знала, что за документ перед ней; не знала, какие поля в нём критичны; и пыталась обрабатывать всё одним способом.
Что дало прирост: три слоя
1. Спецификация на каждый тип документа
Вместо универсальной инструкции — библиотека: на каждый из 79 типов своя спецификация. Что это за документ, какие поля извлекать, какие из них критичны, какие типичные ловушки (где путается серия с номером, как выглядят старые бланки). Звучит трудоёмко — и это трудоёмко. Но именно здесь лежит основной прирост точности, и эта работа делается один раз, а окупается на каждом документе потока.
2. Режимы доверия вместо тотальной автоматизации
Второй слой — признать, что стопроцентная автоматизация не нужна и вредна. Поток разделён на режимы, и решение о режиме принимается расчётом по фактическим данным (тип шрифта, согласие двух моделей между собой, число критичных полей), а не на глаз:
- Авто — печатный текст, высокое согласие моделей, мало критичных полей: результат идёт в работу без человека;
- Авто с проверкой — человек видит извлечённые поля рядом с документом и подтверждает;
- Только руками — рукопись, плохой скан, документ с высокой ценой ошибки.
3. Дорогая модель — там, где она нужна
Третий слой — экономика. Флагманская модель на каждом документе — это дорого и не нужно: на печатном тексте дешёвая модель даёт то же качество. Дорогая работает на сложных случаях и критичных полях. Подробнее про эту арифметику — в разборе реальных расходов на ИИ.
Случай, о котором молчат вендоры: один документ — несколько файлов
В реальном хранилище документы не лежат «один файл — один документ». Справка приходит тремя фотографиями, договор — сканом по страницам, а иногда в одном PDF лежат два разных документа. Требование «склейте всё в один файл» не работает: так документы физически не приходят, и заставить клиентов и сотрудников пересобирать файлы — значит убить внедрение об удобство. Систему пришлось учить собирать документ из нескольких файлов и резать файл на несколько документов. Если вы выбираете готовое решение — проверьте его именно на этом случае, здесь ломаются почти все.
Что это дало людям
До: менеджер разбирает комплект документов клиента полтора часа — скачивает, переименовывает, раскладывает по разделам, вносит данные в карточку. После: загружает всё одним окном, система определяет типы, раскладывает и извлекает данные, менеджер проверяет результат. Полтора часа превратились в минуты, и — важнее — исчезла зависимость от того, «как привык раскладывать конкретный человек».
85% — не потолок и не магия. Это уровень, на котором система стала выгоднее ручного труда с запасом, а дальнейший прирост стоит дороже, чем проверка оставшихся случаев человеком. Знать, где остановиться, — тоже часть внедрения; про то, где такие проекты обычно ломаются целиком, — разбор ошибок внедрения ИИ.