Перейти к содержимому
DTS Business

ИИ для документов

Извлечение и проверка структурированных данных из договоров, счетов и форм — с передачей сомнительных случаев человеку.

  • Структурированные поля из PDF, сканов и офисных документов
  • Оценка уверенности: спорные документы уходят на проверку, а не додумываются
  • Автоматическая обработка большинства, внимание человека — на остатке

Интерактивное демо на этом сайте недоступно

Этот контур работает без сторонних ИИ-провайдеров. Напишите нам — покажем систему в работе лично.

Связаться с нами

В чём проблема с документами

Обработка документов обычно не сложная, а изматывающая. Человек открывает PDF, читает шесть полей, переносит их в другую систему и повторяет. Это дорого, это медленно в конце месяца, и доля ошибок растёт ровно тогда, когда растёт объём.

Шаблонное извлечение существует десятилетиями и стабильно разочаровывает: оно ломается, как только поставщик меняет форму документа. Языковые модели хорошо переносят вариативность вёрстки — но сами по себе уверенно придумывают значение, которого на странице нет, а в финансовом процессе это хуже, чем отсутствие автоматизации.

Как мы делаем это безопасным

Извлечение по схеме. Модель просят вернуть заданный набор полей заданных типов, а не связный текст. Ответ, не прошедший проверку схемой, отклоняется и запрашивается заново — дальше он не идёт.

Привязка к источнику. Каждое извлечённое значение связано с местом в документе, откуда оно взято, чтобы проверяющий переходил к странице, а не перечитывал документ.

Правила проверки. После извлечения работают бизнес-правила: суммы сходятся, даты попадают в допустимый диапазон, реквизиты находятся в справочниках. Большинство ошибок извлечения не проходят арифметическую проверку задолго до того, как их увидит человек.

Маршрутизация по уверенности. Каждый документ получает оценку. Выше порога — обрабатывается автоматически. Ниже — попадает в очередь проверки с подсветкой спорных полей. Порог — это решение бизнеса о допустимой доле ошибок, и мы настраиваем его вместе с вами на реальных данных.

Реалистичная форма первого запуска

  1. Один тип документов — самый массовый.
  2. Размеченная выборка в несколько сотен документов, разделённая на рабочую и отложенную части.
  3. Извлечение и проверки работают параллельно существующему ручному процессу, ничего не проводя.
  4. Сравнение двух путей на отложенной выборке, по каждому полю.
  5. Переключение только для уверенной части, с очередью проверки, работающей с первого дня.

Такая последовательность даёт измеримый результат за недели и дёшево проваливается, если документы окажутся сложнее, чем выглядели.

Что вы получаете

Сервис извлечения, набор правил проверки, интерфейс проверки, размеченный датасет и отчёт о точности. Датасет здесь важнее всего: именно он позволяет заново оценить систему, когда поставщик сменит формат или вы смените модель.

Частые вопросы

Какой точности ждать?

Это полностью зависит от разнородности ваших документов, и любая цифра, названная до их просмотра, — маркетинг. Мы обязуемся не по цифре, а по измерению: размеченная выборка, отчёт о точности по каждому полю и порог уверенности, настроенный так, чтобы доля ошибок среди автоматически проведённых документов укладывалась в приемлемую для вас.

Работают ли сканы?

Да, через этап OCR. Качество зависит от скана. Плохие сканы плотных таблиц остаются объективно сложным случаем, и мы говорим об этом до договора, а не после.

Может ли система писать в нашу ERP или CRM?

Обычно ради этого всё и делается. Извлечение, которое заканчивается таблицей в Excel, экономит немного. Мы интегрируемся с учётной системой, чтобы обработанный документ становился проведённой операцией.

Есть процесс, который стоит автоматизировать?

Связаться с нами