директор и машина · производственный цикл · запись № 019 · · Давид Герштейн
Распознавание первичных документов и своего потока: точность с 59% до 85% без смены модели
Первый запуск распознавания первичных документов и собственного потока бумаг почти у всех даёт около 59% — и на этом большинство закрывает тему, решив, что «модель не тянет». Путь до 85% проходится без смены и дообучения модели: работает не она, а организация вокруг неё — спецификация на каждый из 79 типов документов, режимы доверия (авто / с проверкой / только руками) вместо тотальной автоматизации и дорогая модель только там, где она нужна. Побочный результат: полтора часа разбора комплекта превратились в минуты, а качество перестало зависеть от того, как привык раскладывать документы конкретный менеджер.
Содержание · 13 разделов
- Распознавание первичных документов: почему первый прогон даёт около 59%
- Откуда берутся 59%
- Слой 1: спецификация на каждый тип документа
- Слой 2: режимы доверия вместо «всё автоматом»
- Слой 3: дорогая модель — только там, где нужна
- Сколько это стоит и когда окупается
- Случай, о котором молчат вендоры
- Чего я не понимал в начале
- Распознавание первичных документов в 1С: где проходит граница
- Как выбирать между коробкой, подрядчиком и своими руками
- Что это дало людям
- Где остановиться
- С чего начать вам
Суммы и объёмы в разборе пересчитаны на условную компанию — механика и выводы реальные.
Если вы пробовали распознавание первичных документов — счетов, актов, накладных, а следом и собственного потока справок и договоров — и бросили, почти наверняка вы остановились на 59%. Не буквально на этой цифре, но в этом районе: система вроде работает, но перепроверять приходится всё, менеджеры плюются, и через месяц все возвращаются к ручному вводу с чувством «ну я же говорил».
Мы стояли ровно там же. Разница только в том, что не бросили — и выяснили вещь, которая переворачивает подход: эти 59% не имеют отношения к качеству модели. Мы подняли точность до 85%, не обучая и не меняя модель вообще. Всё, что дало прирост, — организация вокруг неё.
Ниже — что именно делать, по слоям, с честными цифрами и с местом, где ломаются почти все готовые решения.
Распознавание первичных документов: почему первый прогон даёт около 59%
Речь о рабочем потоке компании — счета, акты, накладные, справки, договоры с приложениями, а не о том, как вытащить текст из одной фотографии. Первый прогон проваливается потому, что модель работает без эталонного набора и без правил разбора спорных случаев. 59% — типовой результат первого прогона, и на нём большинство закрывает тему, решив, что технология не тянет.
Ту же связку удалось довести до 85% на 79 типах документов, не меняя модель: собрали эталоны, описали правила для спорных полей, прогнали циклы сверки. Время на комплект упало с полутора часов до минут.
Откуда берутся 59%
Сначала про цифру, потому что её обычно считают нечестно. Стартовую точность мы считали по ключевым полям — фамилии, имена, даты, номера, то, из-за чего документ вообще обрабатывают. На реальном потоке, сверкой с человеком. Не «доля распознанных документов», а доля полей, которые можно не перепроверять. Разница принципиальная: вендор покажет вам первое, работать вы будете со вторым.
И ещё одно, из-за чего цифры вендоров и ваши никогда не сойдутся: они считают на своей тестовой выборке, вы живёте на своём потоке. Пока не прогнали свои документы — любая обещанная точность к вам отношения не имеет.
59% — это типичный результат схемы «модель как есть плюс универсальный промпт». И вот где на самом деле лежат потери: система не знает, что за документ перед ней; не знает, какие поля в нём критичны; и пытается обрабатывать всё одним способом. Три дыры, и ни одна не чинится сменой модели. Хоть флагманскую поставьте.
Слой 1: спецификация на каждый тип документа
Вместо универсальной инструкции — библиотека: на каждый из 79 типов своя спецификация. Что это за документ, какие поля извлекать, какие из них критичны, какие типичные ловушки — где путается серия с номером, как выглядят старые бланки.
Выглядит спецификация буднично — вот сокращённый пример того, что мы пишем на каждый тип:
ТИП: справка о доходах (форма банка), 1–3 страницы. ИЗВЛЕКАТЬ: ФИО полностью, период, суммы по месяцам, итог, дата выдачи, подпись/печать (есть/нет). КРИТИЧНЫЕ ПОЛЯ: ФИО, итоговая сумма, период. Ошибка в них = переделка всего пакета, поэтому при любом сомнении — не угадывай, отправляй на проверку человеку. ЛОВУШКИ: — старый бланк: период указан словами, не цифрами; — две страницы могут быть от разных периодов — проверь даты; — рукописные исправления рядом с суммой → только руками. ЕСЛИ НЕ УВЕРЕН: помечай поле как «требует проверки», пустое поле лучше выдуманного.
Обратите внимание на последнюю строку. «Пустое поле лучше выдуманного» — правило, которое я бы вешал на стену: без него машина заполнит пропуск правдоподобной ерундой, и вы найдёте её через месяц в договоре.
Звучит трудоёмко. Это и есть трудоёмко: неделя работы человека, который знает эти документы. Но именно здесь основной прирост точности, и работа делается один раз, а окупается на каждом документе потока. Если вам не хочется её делать — это честный сигнал, что внедрение вы не потянете: дальше будет не легче.
Слой 2: режимы доверия вместо «всё автоматом»
Второй слой — признать, что стопроцентная автоматизация не нужна и вредна. Поток делится на три режима, и решение принимается расчётом по фактическим признакам (тип шрифта, согласие двух моделей между собой, число критичных полей), а не на глаз.
| Режим | Что попадает | Роль человека |
|---|---|---|
| Авто | Печатный текст, высокое согласие моделей, мало критичных полей | Не участвует |
| Авто с проверкой | Средние случаи | Видит поля рядом с документом и подтверждает |
| Только руками | Рукопись, плохой скан, высокая цена ошибки | Делает целиком |
рассылка журнала
Разборы про документы и заявки — на почту
Распознавание, сроки, зависшие статусы, клиентский портал.
Слой 3: дорогая модель — только там, где нужна
Третий слой — экономика, и здесь директору стоит вмешаться лично. Флагманская модель на каждом документе — это дорого и бессмысленно: на печатном тексте дешёвая даёт то же качество. Дорогая работает на сложных случаях и критичных полях.
Это не экономия ради экономии. Разница в счёте между «гоняем всё через флагман» и «маршрутизируем по сложности» — кратная, и она решает, доживёт ли проект до второго квартала. Подробнее про эту арифметику — в разборе реальных расходов на ИИ.
Сколько это стоит и когда окупается
Считаем на условной компании: поток 400 комплектов в месяц, разбор одного руками — полтора часа, ставка менеджера 700 ₽/час. Это порядка 420 тысяч рублей в месяц управляемой работы (оценка) — при том, что менеджер нанимался не за этим.
Стоимость машинной обработки складывается из трёх частей: сами вызовы модели (центы за документ при разумной маршрутизации), недели работы на спецификации — разовые, и время человека на приёмку в режимах «с проверкой» и «руками». Последняя часть не исчезает никогда, и её надо честно закладывать: у нас это порядка четверти прежнего времени.
Если ваша цифра в калькуляторе меньше сотни тысяч в месяц — честно скажу: не начинайте, вам это пока не окупится, займитесь чем-то более денежным. Если больше — вы каждый месяц платите эту сумму за работу, которую половина рынка уже не делает руками.
Случай, о котором молчат вендоры
Теперь то, ради чего стоит дочитать до конца, если вы выбираете готовое решение.
В реальном хранилище документы не лежат «один файл — один документ». Справка приходит тремя фотографиями. Договор — сканом по страницам. А иногда в одном PDF лежат два разных документа, потому что менеджер отсканировал стопку не глядя.
Требование «склейте всё в один файл» не работает. Так документы физически не приходят, и заставлять клиентов и сотрудников пересобирать файлы — значит убить внедрение об удобство. Нам пришлось учить систему собирать документ из нескольких файлов и резать файл на несколько документов.
Если вы выбираете подрядчика или коробку — тестируйте именно на этом. Не на чистом скане паспорта, который вам покажут на демо. Дайте три фотографии одной справки под углом и PDF с двумя документами внутри. Здесь ломаются почти все, и лучше узнать об этом до оплаты, а не после.
Чего я не понимал в начале
Признаюсь в двух вещах, на которых потерял время.
Первое: я месяц искал «модель получше». Сравнивал, читал бенчмарки, гонял тесты. Прирост от смены модели оказался в пределах статистической погрешности — а прирост от описания типов документов дал двадцать шесть процентных пунктов. Я искал не там, где потерял, а там, где светлее.
Второе: мы сначала строили «всё автоматом», потому что режимы доверия казались признанием поражения. Это была ошибка ровно наоборот: система без режимов доверия проработала до первой громкой ошибки, после которой ей перестали верить целиком. Пришлось откатываться и вводить их задним числом — вместе с потерянным доверием команды, которое восстанавливается дольше, чем настраивается любая техника.
Распознавание первичных документов в 1С: где проходит граница
Раз уж речь зашла о выборе, разведу два вопроса, которые постоянно смешивают: распознавание первичных документов и распознавание вашего потока — это не одно и то же, и решаются они разными инструментами.
Первичка — счета, акты, накладные, УПД. Структура устойчивая, поля стоят на своих местах, форма предсказуема. Здесь встроенные средства учётной системы справляются, и городить рядом свой контур незачем: цены подписочные, результат сразу в проводке.
Ваш собственный поток — всё остальное. Клиентские справки, договоры с приложениями, рукописные формы, сканы под углом. Именно на этом наборе первый прогон и даёт те самые 59%, потому что каждый тип требует своей спецификации, а «одна модель на всё» разваливается. Первый заход на другом наборе — 92 эталонных документа, ошибки с 20% до 7% — описан здесь.
Практический вывод: если у вас болит первичка — начинайте с возможностей учётной системы, это дешевле и быстрее. Свой контур нужен там, где документы нестандартные, а объём такой, что ручной ввод стал отдельной работой. У нас именно этот путь и довёл точность до 85% на 79 типах, а время на комплект — с полутора часов до минут.
бесплатный курс · телеграм
Собрать разбор документов машиной
В курсе — как поставить обработку документов: эталонный набор, правила для спорных случаев, приёмка результата. Тот путь, которым мы дошли с 59% до 85% точности.
Начать курс бесплатно →открывается в Telegram · доступ по подписке на канал
Как выбирать между коробкой, подрядчиком и своими руками
Раз уж вы дочитали до сюда, вам скоро придётся принимать это решение. Коротко, как я его вижу.
И сразу отвечу на вопрос, который задают чаще всего: «а в 1С же есть распознавание документов, зачем что-то ещё?» Есть, и для бухгалтерии оно работает: 1С и подобные программы отлично забирают счета и накладные в учёт, цены там понятные и подписочные. Но их распознавание заточено под бухгалтерский первичный документ — стандартную форму с предсказуемой структурой. Как только поток становится вашим — клиентские справки, договоры с приложениями, сканы под углом, редкие типы, — оптическое распознавание по шаблону упирается в потолок, и начинается ровно то, о чём эта статья.
Готовая коробка хороша, если ваши документы — стандартные и массовые: счета, накладные, паспорта. Дёшево, быстро, но спецификации под ваши редкие типы вы туда не занесёте, и на «трёх фотографиях справки» она, скорее всего, споткнётся. Тест перед покупкой описан выше — не поленитесь.
Подрядчик нужен, когда типов много и они ваши. Но требуйте, чтобы спецификации писались вместе с вашим человеком, который эти документы знает, — и чтобы они остались у вас в читаемом виде. Спецификации, а не код, — главный актив этого проекта. Если подрядчик уходит, а описания типов остались у вас, вы восстановите систему за недели. Если наоборот — начнёте с нуля.
Своими руками реально, если в компании есть человек, готовый разбираться. Инструменты доступны, вход — десятки долларов, механика описана в разборе про агентов. Именно так это начиналось у нас, и оглядываясь — это был правильный выбор: мы поняли свои документы лучше, чем понял бы любой внешний исполнитель.
Что это дало людям
До: менеджер разбирает комплект документов клиента полтора часа. Скачивает, переименовывает, раскладывает по разделам, вносит данные в карточку. После: загружает всё одним окном, система определяет типы, раскладывает и извлекает данные, менеджер проверяет результат.
Полтора часа превратились в минуты — и я специально не пишу «в ноль», потому что проверка осталась. Но выигрыш даже не в этом. Исчезла зависимость от того, «как привык раскладывать конкретный человек» — а значит, ушёл целый класс проблем: потерянные комплекты, разный порядок папок у разных менеджеров, невозможность быстро передать клиента другому сотруднику.
Где остановиться
85% — не потолок и не магия. Это уровень, на котором система стала выгоднее ручного труда с запасом, а дальнейший прирост стоит дороже, чем проверка оставшихся случаев человеком.
Практический признак, что пора остановиться: вы неделю бьётесь за пару процентных пунктов, а очередь на приёмке от этого не уменьшается. Значит, оставшиеся случаи по своей природе требуют человека, и правильное решение — не улучшать модель, а нормально организовать проверку. Знать, где остановиться, — управленческий навык, и в распознавании документов он экономит больше денег, чем любая смена модели. Ему нигде не учат, и именно на нём чаще всего сыплются внедрения. Гонка за сотней процентов съедает бюджеты, которые нужно было потратить на второй процесс. О том, где такие проекты ломаются целиком, — разбор ошибок внедрения.
С чего начать вам
Не с выбора подрядчика и не с изучения рынка программ. С трёх действий, на которые уйдёт неделя и ни рубля.
Первое. Посчитайте, сколько времени ваши люди тратят на разбор документов. Не «примерно», а замером: попросите двух менеджеров неделю фиксировать. Цифра вас удивит — она всегда больше ожидаемой.
Второе. Выпишите типы документов, которые к вам приходят. Не все 79 — топ-10 по частоте. Это и будет черновик первых спецификаций.
Третье. Возьмите десять реальных комплектов — грязных, с фотографиями и перевёрнутыми сканами — и прогоните через любой доступный инструмент. Получите свои 59% и увидите, где именно теряется точность. Это ваша стартовая точка, и она всегда честнее презентации вендора.
Дальше — три слоя из этой статьи. А если хотите пройти путь по порядку, с практикой на своих документах, — у меня есть бесплатный курс для руководителей: работа с документами там разобрана отдельно, вместе с экономикой и режимами доверия.
И последнее. Разница между компаниями, у которых это работает, и теми, у кого «не пошло», — почти никогда не в бюджете и не в подрядчике. Она в том, нашёлся ли человек, готовый неделю описывать типы документов вместо того, чтобы ждать волшебную коробку. Волшебных коробок не будет ни в этом году, ни в следующем — будут инструменты, которые окупаются в руках того, кто разобрался.
Частые вопросы
Распознавание первичных документов — это то же самое, что распознавание текста онлайн?
Нет. Онлайн-сервисы вытаскивают из картинки буквы: на выходе текст, который всё равно вносит человек. Корпоративная задача другая — понять, какой это документ из десятков типов, вытащить именно критичные поля и отдать их в систему уже проверенными. Буквы научились распознавать давно, и это умеет любой бесплатный сервис; 59% и 85% в этой статье — про поля, которые можно не перепроверять, а не про символы.
Можно ли распознавать первичные документы в 1С?
Да, и для счетов, актов и накладных встроенных средств учётной системы обычно достаточно: у первички устойчивая структура и предсказуемая форма. Отдельный контур нужен для собственного потока — справок, договоров с приложениями, рукописных форм и сканов под углом, где одна модель на все типы разваливается.
Почему точность распознавания на старте всегда низкая?
Потому что «модель как есть плюс универсальный промпт» не знает, что за документ перед ней и какие поля в нём критичны. Потери сидят не в модели, а в отсутствии спецификаций — у нас это была разница между 59% и 85%.
Нужно ли обучать модель под свои документы?
В нашем случае — нет, и это главный вывод: весь прирост дала организация вокруг модели. Обучение стоит дорого и требует размеченных данных; начинайте с описания типов документов и режимов доверия.
Что такое режимы доверия?
Разделение потока на три части: авто (печатный текст, высокое согласие моделей — идёт в работу без человека), авто с проверкой (человек подтверждает извлечённые поля) и только руками (рукопись, плохой скан, высокая цена ошибки). Решение принимается расчётом, а не на глаз.
Какой процент точности считать достаточным?
Тот, при котором система выгоднее ручного труда с запасом. У нас это 85%: дальнейший прирост стоил дороже, чем проверка оставшихся случаев человеком. Гнаться за 100% — типичная и дорогая ошибка.
На чём ломаются готовые решения для распознавания?
На том, что документ приходит не одним файлом: справка тремя фотографиями, договор — сканом по страницам, а в одном PDF бывает два разных документа. Проверяйте любое решение именно на этом кейсе, до покупки.
#ии и нейросети #автоматизация #контроль и надёжность
Присылаю новый разбор в день выхода — с цифрами, которые можно подставить в свою таблицу. Без дайджестов ради дайджестов: нет статьи — нет письма.