Введение

Способность компьютера принимать и интерпретировать разборчивый рукописный ввод, распознавая отдельные буквы и слова в рукописном тексте. Распознавание рукописного ввода (HWR), также известное как распознавание рукописного текста (HTR), – это способность компьютера принимать и интерпретировать разборчивый рукописный ввод из различных источников, таких как бумажные документы, фотографии, сенсорные экраны и другие устройства. Изображение рукописного текста может быть получено "оффлайн" с бумаги посредством оптического сканирования (оптическое распознавание символов) или интеллектуального распознавания слов. Альтернативно, движения пера могут быть зафиксированы "онлайн", например, на экране компьютера с пером, что обычно является более простой задачей, поскольку доступно больше информации для анализа. Система распознавания рукописного ввода обрабатывает форматирование, выполняет корректную сегментацию на символы и определяет наиболее вероятные слова.

Оффлайн признание

Оффлайн-распознавание рукописного текста предполагает автоматическое преобразование текста на изображении в буквенные коды, пригодные для использования в компьютерных и текстовых редакторах. Данные, полученные таким образом, рассматриваются как статичное представление рукописного текста. Распознавание рукописного текста в автономном режиме сравнительно сложнее, поскольку у разных людей разные стили письма. И на сегодняшний день, системы оптического распознавания символов (OCR) в основном ориентированы на машинопечатный текст, а технология интеллектуального распознавания символов (ICR) – на рукописный текст, написанный заглавными буквами.

Экстракция символов

Оффлайн распознавание символов часто включает сканирование формы или документа. Это означает, что отдельные символы, содержащиеся в отсканированном изображении, необходимо извлечь. Существуют инструменты, способные выполнить этот этап. Однако на этом этапе часто возникают различные неточности. Наиболее распространенная из них – когда соединенные символы возвращаются в виде единого подграфического объекта, содержащего оба символа. Это создает серьезную проблему на этапе распознавания. Тем не менее, существует множество алгоритмов, снижающих вероятность соединения символов.

Распознавание символов

После извлечения отдельных символов используется механизм распознавания для идентификации соответствующего компьютерного символа. В настоящее время существует несколько различных техник распознавания.

Экстракция характеристик

Экстракция признаков работает схожим образом с распознавателями нейронных сетей. Однако программисты должны вручную определять признаки, которые, по их мнению, являются важными. Такой подход предоставляет распознавателю больше контроля над признаками, используемыми для идентификации. Тем не менее, любая система, использующая этот подход, требует значительно больше времени на разработку, чем нейронная сеть, поскольку признаки не изучаются автоматически.

Современные методы

В то время как традиционные методы фокусируются на сегментации отдельных символов для распознавания, современные методы ориентированы на распознавание всех символов в сегментированной строке текста. Особенно они сосредоточены на методах машинного обучения, способных к самостоятельному изучению визуальных признаков, избегая ручной разработки признаков, использовавшейся ранее. Передовые методы применяют сверточные сети для извлечения визуальных признаков из нескольких перекрывающихся окон изображения текстовой строки, а рекуррентная нейронная сеть использует эти признаки для вычисления вероятностей символов.

Оборудование

Коммерческие продукты, включающие распознавание почерка в качестве замены клавиатурного ввода, появились в начале 1980-х годов. Примерами служат терминалы для рукописного ввода, такие как Penpad Pencept и терминал Inforite для точек продаж. С развитием крупного потребительского рынка персональных компьютеров было представлено несколько коммерческих продуктов, призванных заменить клавиатуру и мышь на персональном компьютере единой системой указания и рукописного ввода, например, от Pencept, CIC и других. Первым коммерчески доступным портативным компьютером типа планшета стал GRiDPad от GRiD Systems, выпущенный в сентябре 1989 года. Его операционная система была основана на MS DOS. В начале 1990-х годов производители оборудования, включая NCR, IBM и EO, выпустили планшетные компьютеры, работающие под операционной системой PenPoint, разработанной GO Corp. PenPoint использовал распознавание почерка и жестов, а также предоставлял соответствующие возможности стороннему программному обеспечению. Планшетный компьютер IBM стал первым, получившим название ThinkPad, и использовал систему распознавания почерка, разработанную IBM. Эта система распознавания впоследствии была портирована в Microsoft Windows для Pen Computing и IBM Pen для OS/2. Ни один из этих продуктов не добился коммерческого успеха. Достижения в области электроники позволили разместить вычислительную мощность, необходимую для распознавания почерка, в форм-факторе меньшем, чем у планшетных компьютеров, и распознавание почерка стало часто использоваться в качестве метода ввода для портативных персональных цифровых помощников (ПДА). Первым ПДА, обеспечившим ввод рукописного текста, стал Apple Newton, который продемонстрировал общественности преимущества упрощенного пользовательского интерфейса. Однако устройство не имело коммерческого успеха из-за ненадежности программного обеспечения, которое пыталось изучить особенности почерка пользователя. К моменту выхода Newton OS 2.0, в которой распознавание почерка было значительно улучшено, включая уникальные функции, которые до сих пор не встречаются в современных системах распознавания, такие как коррекция ошибок в режиме реального времени, уже сложилось преимущественно негативное первое впечатление. После прекращения выпуска Apple Newton эта функция была включена в Mac OS X 10.2 и более поздние версии под названием Inkwell. Позже Palm выпустила успешную серию ПДА, основанную на системе распознавания Graffiti. Graffiti повысила удобство использования, определив набор "одноштриховых" форм для каждого символа. Это уменьшило вероятность ошибочного ввода, хотя запоминание этих форм увеличило сложность обучения для пользователя. Было установлено, что система распознавания Graffiti нарушает патент, принадлежащий Xerox, и Palm заменила Graffiti лицензированной версией системы распознавания почерка CIC, которая, хотя и поддерживала одноштриховые формы, предшествовала патенту Xerox. Решение суда о нарушении было отменено в апелляционной инстанции, а затем снова отменено в последующей апелляции. Впоследствии стороны договорились о соглашении, касающемся этого и других патентов. Tablet PC – это ноутбук с графическим планшетом и стилусом, позволяющий пользователю вводить текст от руки на экране устройства. Операционная система распознает почерк и преобразует его в текст. Windows Vista и Windows 7 включают в себя функции персонализации, которые изучают особенности почерка или словарный запас пользователя для английского, японского, традиционного китайского, упрощенного китайского и корейского языков. Эти функции включают в себя "мастер персонализации", который запрашивает образцы почерка пользователя и использует их для переобучения системы с целью повышения точности распознавания. Эта система отличается от менее продвинутой системы распознавания почерка, используемой в Windows Mobile OS для ПДА. Хотя распознавание почерка является формой ввода, к которой общественность привыкла, оно не получило широкого распространения ни на настольных компьютерах, ни на ноутбуках. До сих пор считается, что ввод с клавиатуры быстрее и надежнее. По состоянию на 2006 год многие ПДА предлагают ввод рукописного текста, иногда даже принимая естественный рукописный почерк, но точность по-прежнему остается проблемой, и некоторые пользователи считают даже простую экранную клавиатуру более эффективной.

Программное обеспечение

Раннее программное обеспечение могло распознавать печатный почерк, где символы были разделены, однако курсивный почерк с соединенными символами представлял собой парадокс Сайра – проблему, связанную с сегментацией символов. В 1962 году Шелия Губерман, находившаяся тогда в Москве, написала первую прикладную программу распознавания образов. Коммерческие решения предлагались такими компаниями, как Communications Intelligence Corporation и IBM. В начале 1990-х годов две компании – ParaGraph International и Lexicus – разработали системы, способные распознавать рукописный курсив. ParaGraph базировалась в России и была основана ученым-компьютерщиком Степаном Пачиковым, а Lexicus – Ронджоном Нагом и Крисом Кортге, студентами Стэнфордского университета. Система ParaGraph CalliGrapher была внедрена в системы Apple Newton, а система Lexicus Longhand стала коммерчески доступна для операционных систем PenPoint и Windows. В 1993 году Lexicus была приобретена компанией Motorola и продолжила разработку систем распознавания китайского почерка и предсказания текста для Motorola. ParaGraph была приобретена SGI в 1997 году, а ее команда по распознаванию почерка сформировала подразделение P&I, которое позднее было приобретено Vadem у SGI. В 1999 году Microsoft приобрела технологию распознавания почерка CalliGrapher и другие технологии цифрового ввода, разработанные P&I, у Vadem. Wolfram Mathematica (версии 8.0 и выше) также предоставляет функцию распознавания рукописного текста или текста TextRecognize.

Исследования

[[Файл:Признание адреса.png|thumbnail|Метод, используемый для использования контекстной информации в первой системе интерпретации рукописных адресов, разработанной Саргуром Шрихари и Джонатаном Халлом. В частности, двунаправленная и многомерная долговременная кратковременная память (LSTM) Алекса Грейвса и др. выиграла три соревнования по распознаванию связного почерка на Международной конференции по анализу и распознаванию документов (ICDAR) в 2009 году, не имея предварительных знаний о трех различных языках (французском, арабском, персидском). Недавние методы глубокого обучения на основе графических процессоров для прямосвязных сетей, разработанные Дэном Сиресаном и его коллегами из IDSIA, выиграли конкурс ICDAR 2011 года по распознаванию китайского рукописного текста в автономном режиме; их нейронные сети также стали первыми искусственными распознавателями образов, достигшими производительности, сопоставимой с человеческой, в известной задаче распознавания рукописных цифр MNIST, разработанной Яном Лекуном и его коллегами из Нью-Йоркского университета. Бенджамин Грэм из Университета Уорик выиграл конкурс по распознаванию китайского рукописного текста в 2013 году, показав точность 97.39% (с ошибкой всего 2.61%), используя подход к сверточным нейронным сетям, который к 2017 году эволюционировал в "разреженные сверточные нейронные сети".