[ направления ] [ журнал ] [ опыт и цифры ] [ автор ] t.me/directorandmachine ↗
журнал практика · цифры настоящие

директор и машина · производственный цикл · запись № 001 · · Давид Герштейн

Распознавание документов: как мы подняли точность с 59% до 85% — не меняя модель

79 типов · точность 59% → 85% · 1,5 часа → минуты
Коротко · суть разбора

Точность извлечения полей из документов выросла с 59% до 85% без обучения модели: спецификации на каждый из 79 типов, режимы доверия (авто / с проверкой / руками) и дорогая модель только на сложных случаях. Раскладка комплекта: 1,5 часа → минуты.

На демо распознавание документов работает всегда. Подрядчик показывает чистый скан паспорта, система вытаскивает поля, все довольны. Потом наступает реальный поток: фото с телефона под углом, справка на трёх листах в пяти файлах, рукописные вставки, печать поверх текста. И оказывается, что между демо и работой лежит несколько месяцев настоящей работы.

Это разбор такого пути: поток клиентских документов в консультационном бизнесе, 79 типов документов, точность извлечения ключевых полей — с 59% на старте до 85% после калибровки. Модель мы не обучали и не меняли. Всё, что дало прирост, — организация вокруг модели.

Откуда берутся 59%

Стартовая точность считалась честно: по ключевым полям (фамилии, имена, даты, номера — то, из-за чего документ вообще обрабатывают), на реальном потоке, сверкой с человеком. Не «доля распознанных документов», а «доля полей, которые можно не перепроверять».

59% — это типичный результат «модель как есть плюс универсальный промпт». Дальше выяснилось, что потери сидят не в модели, а в трёх местах: система не знала, что за документ перед ней; не знала, какие поля в нём критичны; и пыталась обрабатывать всё одним способом.

Что дало прирост: три слоя

1. Спецификация на каждый тип документа

Вместо универсальной инструкции — библиотека: на каждый из 79 типов своя спецификация. Что это за документ, какие поля извлекать, какие из них критичны, какие типичные ловушки (где путается серия с номером, как выглядят старые бланки). Звучит трудоёмко — и это трудоёмко. Но именно здесь лежит основной прирост точности, и эта работа делается один раз, а окупается на каждом документе потока.

2. Режимы доверия вместо тотальной автоматизации

Второй слой — признать, что стопроцентная автоматизация не нужна и вредна. Поток разделён на режимы, и решение о режиме принимается расчётом по фактическим данным (тип шрифта, согласие двух моделей между собой, число критичных полей), а не на глаз:

Почему это главное решениеПервая же ошибка автоматики на важном документе убивает доверие ко всей системе — люди начинают перепроверять всё, и эффект обнуляется. Честное «этот тип мы пока проверяем руками» сохраняет доверие к тем девяноста процентам потока, где автоматика работает. Система с режимами доверия живёт; система «всё автоматом» умирает от первого скандала.

3. Дорогая модель — там, где она нужна

Третий слой — экономика. Флагманская модель на каждом документе — это дорого и не нужно: на печатном тексте дешёвая модель даёт то же качество. Дорогая работает на сложных случаях и критичных полях. Подробнее про эту арифметику — в разборе реальных расходов на ИИ.

Случай, о котором молчат вендоры: один документ — несколько файлов

В реальном хранилище документы не лежат «один файл — один документ». Справка приходит тремя фотографиями, договор — сканом по страницам, а иногда в одном PDF лежат два разных документа. Требование «склейте всё в один файл» не работает: так документы физически не приходят, и заставить клиентов и сотрудников пересобирать файлы — значит убить внедрение об удобство. Систему пришлось учить собирать документ из нескольких файлов и резать файл на несколько документов. Если вы выбираете готовое решение — проверьте его именно на этом случае, здесь ломаются почти все.

Что это дало людям

До: менеджер разбирает комплект документов клиента полтора часа — скачивает, переименовывает, раскладывает по разделам, вносит данные в карточку. После: загружает всё одним окном, система определяет типы, раскладывает и извлекает данные, менеджер проверяет результат. Полтора часа превратились в минуты, и — важнее — исчезла зависимость от того, «как привык раскладывать конкретный человек».

85% — не потолок и не магия. Это уровень, на котором система стала выгоднее ручного труда с запасом, а дальнейший прирост стоит дороже, чем проверка оставшихся случаев человеком. Знать, где остановиться, — тоже часть внедрения; про то, где такие проекты обычно ломаются целиком, — разбор ошибок внедрения ИИ.