Введение

Оцифровка аналоговых документов

Обработка документов – это область исследований и комплекс производственных процессов, направленных на преобразование аналогового документа в цифровой формат. Обработка документов не ограничивается фотографированием или сканированием документа для получения цифрового изображения, но включает в себя и обеспечение его цифровой интерпретируемости. Это подразумевает извлечение структуры документа или его компоновки, а затем и содержимого, которое может быть представлено в виде текста или изображений. В процессе могут использоваться как традиционные алгоритмы компьютерного зрения, так и сверточные нейронные сети, так и ручной труд. Решаемые задачи связаны с семантической сегментацией, обнаружением объектов, оптическим распознаванием символов (OCR), распознаванием рукописного текста (HTR) и, в более широком смысле, транскрипцией – автоматической или ручной. Этот термин может также охватывать этап оцифровки документа с помощью сканера и этап интерпретации документа, например, с использованием технологий обработки естественного языка (NLP) или классификации изображений. Он находит применение во многих промышленных и научных областях для оптимизации административных процессов, обработки почты, а также оцифровки аналоговых архивов и исторических документов.

Предыстория

Обработка документов изначально была, и в некоторой степени остаётся, своего рода конвейерной работой, связанной с обработкой документов, таких как письма и посылки, с целью сортировки, извлечения или массового извлечения данных. Эта работа могла выполняться внутри компании или посредством аутсорсинга бизнес-процессов. Обработка документов действительно может включать в себя привлечение внешнего ручного труда, например, через платформу Mechanical Turk. В качестве примера ручной обработки документов, относительно недавно, в 2007 году, обработка "миллионов заявлений на визу и гражданство" осуществлялась с использованием "приблизительно 1000 внештатных сотрудников", работавших над "обработкой почты и вводом данных". Хотя ввод данных с клавиатуры использовался в обработке документов задолго до появления компьютерной мыши или сканера, в статье The New York Times 1990 года, посвященной концепции "безбумажного офиса", утверждалось, что "обработка документов начинается со сканера". В этом контексте бывший вице-президент Xerox Пол Страссман выразил критическое мнение, заявив, что компьютеры не сокращают, а увеличивают объем бумаги в офисе. Технология, известная как автоматическая обработка документов или, иногда, интеллектуальная обработка документов (ID), появилась как специфическая форма интеллектуальной автоматизации процессов (IPA), объединяющая инструменты искусственного интеллекта, такие как машинное обучение (ML), обработка естественного языка (NLP) или интеллектуальное распознавание символов (OCR), для извлечения данных из различных типов документов.

Приложения

Автоматическая обработка документов применима к широкому спектру документов, как структурированных, так и неструктурированных. Например, в сфере бизнеса и финансов технологии могут использоваться для обработки бумажных счетов-фактур, форм, заказов на покупку, контрактов и денежных купюр. Финансовые учреждения используют интеллектуальную обработку документов для обработки больших объемов форм, таких как нормативные документы или кредитные договоры. Системы ID используют искусственный интеллект для извлечения и классификации данных из документов, заменяя ручной ввод данных. В медицине разработаны методы обработки документов для облегчения наблюдения за пациентами и оптимизации административных процедур, в частности, путем оцифровки медицинских или лабораторных отчетов. Также ставится цель стандартизировать медицинские базы данных. Алгоритмы также непосредственно используются для помощи врачам в медицинской диагностике, например, путем анализа изображений магнитно-резонансной томографии или микроскопических изображений. Обработка документов широко применяется и в гуманитарных и цифровых гуманитарных науках для извлечения исторических больших данных из архивов и коллекций культурного наследия. Для различных источников разработаны специализированные подходы, включая текстовые документы, такие как газетные архивы, а также изображения и карты.

Технологии

Если с 1980-х годов традиционные алгоритмы компьютерного зрения широко использовались для решения задач обработки документов, то в 2010-х годах они постепенно были заменены технологиями нейронных сетей. Однако традиционные технологии компьютерного зрения все еще применяются, иногда в сочетании с нейронными сетями, в некоторых отраслях. Многие технологии поддерживают развитие обработки документов, в частности, оптическое распознавание символов (OCR) и распознавание рукописного текста (HTR), позволяющие автоматически транскрибировать текст. Текстовые сегменты идентифицируются с помощью алгоритмов обнаружения экземпляров или объектов, которые иногда также могут использоваться для определения структуры документа. Для решения этой задачи иногда применяются алгоритмы семантической сегментации. Эти технологии часто составляют основу обработки документов. Однако другие алгоритмы могут быть задействованы до или после этих процессов. Кроме того, используются технологии оцифровки документов, как в форме классического, так и трехмерного сканирования. Оцифровка трехмерных документов может использовать производные фотограмметрии. Иногда требуется разработка специализированных 2D-сканеров для адаптации к размеру документов или в целях эргономики сканирования. Обработка документов также зависит от цифрового кодирования документов в подходящий формат файла. Более того, обработка гетерогенных баз данных может опираться на технологии классификации изображений. На другом конце цепочки находятся различные алгоритмы восстановления изображения, экстраполяции или очистки данных. Для текстовых документов интерпретация может использовать технологии обработки естественного языка (NLP).