Перейти к содержимому
DTS Business
2 мин чтенияDTS Business

Перестаньте спрашивать про точность

Точность — это одно число, описывающее систему, которая ведёт себя по-разному на разных частях собственного вывода. Значение имеет порог.

«Какая у неё точность?» — первый вопрос в любом разговоре об автоматизации документооборота, и он неправильный. Не потому что точность не важна, а потому что одно число скрывает структуру, которая и делает систему пригодной к использованию.

Почему одна цифра вводит в заблуждение

Допустим, извлечение работает с точностью 94%. Шесть документов из ста — с ошибкой. Сразу возникают два вопроса, и ответа ни на один из них в этой цифре нет:

  • Какие именно шесть? Если они распределены случайно, проверять нужно каждый документ — и вы не автоматизировали ничего. Если они сосредоточены среди тех, что система и так помечает как сомнительные, остальное можно проводить автоматически.
  • С какой ошибкой? Пропущенное поле отловится дальше по процессу. Правдоподобное неверное значение будет проведено и обнаружится при сверке. Точность та же, риск совершенно разный.

О чём спрашивать вместо этого

Как выглядит кривая «точность против охвата»? Отсортируйте документы по собственной уверенности системы и постройте зависимость точности от доли объёма, которую вы бы проводили автоматически. У полезной системы кривая крутая: высокая уверенность соответствует очень высокой точности, а ошибки скапливаются внизу.

Эта кривая и есть результат работы. Она превращает техническое свойство в бизнес-решение: выберите долю ошибок, которую процесс способен принять, и прочитайте по кривой уровень автоматизации.

Какую долю ошибок мы реально можем принять? Это ответ бизнеса, а не инженеров, и он сильно различается. Ошибка в статье затрат вскроется при сверке. Ошибка в платёжных реквизитах не вскроется вообще, пока не навредит.

Как отказ выглядит снаружи? Системы, которые ломаются заметно, гораздо безопаснее систем, которые ломаются правдоподобно, — при одинаковой точности.

Порог и есть продукт

Основная ценность в проектах по обработке документов создаётся именно выбором этого порога, и это та часть, которой уделяют меньше всего внимания. Команды тратят недели на выбор модели и минуты на число, определяющее, что в итоге автоматизируется.

Схема, которая у нас работает: начинать с осознанно высокого порога, при котором доля автоматизации низкая, а доля ошибок среди автоматически проведённых документов близка к нулю. Дать очереди проверки доказать, что системе можно доверять. Затем осознанно снижать порог, наблюдая за долей ошибок, пока не дойдёте до предела, установленного бизнесом.

Начать с низкого и поднять после инцидента не получится. Доверие несимметрично, и потерять его можно только один раз.

И проверки важнее извлечения

Последнее, что стоит сказать: значительная часть ошибок, которые мы видим, не требует более крупной модели. Они не проходят арифметику. Позиции не сходятся с итогом, дата выходит за срок перевозки, кода контрагента нет в справочнике.

Бизнес-правила дёшевы, детерминированы, объяснимы и отрабатывают за миллисекунды. Напишите их прежде, чем рассматривать модель побольше.

  • Обработка документов
  • Оценка качества
  • Продакшен