Введение
Способность компьютера принимать и интерпретировать разборчивый рукописный ввод, распознавая отдельные буквы и слова в рукописном тексте. Распознавание рукописного ввода (HWR), также известное как распознавание рукописного текста (HTR), – это способность компьютера принимать и интерпретировать разборчивый рукописный ввод из различных источников, таких как бумажные документы, фотографии, сенсорные экраны и другие устройства. Изображение рукописного текста может быть получено "оффлайн" с бумаги посредством оптического сканирования (оптическое распознавание символов) или интеллектуального распознавания слов. Альтернативно, движения пера могут быть зафиксированы "онлайн", например, на экране компьютера с пером, что обычно является более простой задачей, поскольку доступно больше информации для анализа. Система распознавания рукописного ввода обрабатывает форматирование, выполняет корректную сегментацию на символы и определяет наиболее вероятные слова.
recognizing the specific letters and words in hand written text
Handwriting recognition (HWR), also known as handwritten text recognition (HTR), is the ability of a computer to receive and interpret intelligible handwritten input from sources such as paper documents, photographs, touch screens and other devices. The image of the written text may be sensed "off line" from a piece of paper by optical scanning (optical character recognition) or intelligent word recognition. Alternatively, the movements of the pen tip may be sensed "on line", for example by a pen based computer screen surface, a generally easier task as there are more clues available. A handwriting recognition system handles formatting, performs correct segmentation into characters, and finds the most possible words.
Оффлайн признание
Оффлайн-распознавание рукописного текста предполагает автоматическое преобразование текста на изображении в буквенные коды, пригодные для использования в компьютерных и текстовых редакторах. Данные, полученные таким образом, рассматриваются как статичное представление рукописного текста. Распознавание рукописного текста в автономном режиме сравнительно сложнее, поскольку у разных людей разные стили письма. И на сегодняшний день, системы оптического распознавания символов (OCR) в основном ориентированы на машинопечатный текст, а технология интеллектуального распознавания символов (ICR) – на рукописный текст, написанный заглавными буквами.
Экстракция символов
Оффлайн распознавание символов часто включает сканирование формы или документа. Это означает, что отдельные символы, содержащиеся в отсканированном изображении, необходимо извлечь. Существуют инструменты, способные выполнить этот этап. Однако на этом этапе часто возникают различные неточности. Наиболее распространенная из них – когда соединенные символы возвращаются в виде единого подграфического объекта, содержащего оба символа. Это создает серьезную проблему на этапе распознавания. Тем не менее, существует множество алгоритмов, снижающих вероятность соединения символов.
Распознавание символов
После извлечения отдельных символов используется механизм распознавания для идентификации соответствующего компьютерного символа. В настоящее время существует несколько различных техник распознавания.
Экстракция характеристик
Экстракция признаков работает схожим образом с распознавателями нейронных сетей. Однако программисты должны вручную определять признаки, которые, по их мнению, являются важными. Такой подход предоставляет распознавателю больше контроля над признаками, используемыми для идентификации. Тем не менее, любая система, использующая этот подход, требует значительно больше времени на разработку, чем нейронная сеть, поскольку признаки не изучаются автоматически.
Современные методы
В то время как традиционные методы фокусируются на сегментации отдельных символов для распознавания, современные методы ориентированы на распознавание всех символов в сегментированной строке текста. Особенно они сосредоточены на методах машинного обучения, способных к самостоятельному изучению визуальных признаков, избегая ручной разработки признаков, использовавшейся ранее. Передовые методы применяют сверточные сети для извлечения визуальных признаков из нескольких перекрывающихся окон изображения текстовой строки, а рекуррентная нейронная сеть использует эти признаки для вычисления вероятностей символов.
Оборудование
Коммерческие продукты, включающие распознавание почерка в качестве замены клавиатурного ввода, появились в начале 1980-х годов. Примерами служат терминалы для рукописного ввода, такие как Penpad Pencept и терминал Inforite для точек продаж. С развитием крупного потребительского рынка персональных компьютеров было представлено несколько коммерческих продуктов, призванных заменить клавиатуру и мышь на персональном компьютере единой системой указания и рукописного ввода, например, от Pencept, CIC и других. Первым коммерчески доступным портативным компьютером типа планшета стал GRiDPad от GRiD Systems, выпущенный в сентябре 1989 года. Его операционная система была основана на MS DOS. В начале 1990-х годов производители оборудования, включая NCR, IBM и EO, выпустили планшетные компьютеры, работающие под операционной системой PenPoint, разработанной GO Corp. PenPoint использовал распознавание почерка и жестов, а также предоставлял соответствующие возможности стороннему программному обеспечению. Планшетный компьютер IBM стал первым, получившим название ThinkPad, и использовал систему распознавания почерка, разработанную IBM. Эта система распознавания впоследствии была портирована в Microsoft Windows для Pen Computing и IBM Pen для OS/2. Ни один из этих продуктов не добился коммерческого успеха. Достижения в области электроники позволили разместить вычислительную мощность, необходимую для распознавания почерка, в форм-факторе меньшем, чем у планшетных компьютеров, и распознавание почерка стало часто использоваться в качестве метода ввода для портативных персональных цифровых помощников (ПДА). Первым ПДА, обеспечившим ввод рукописного текста, стал Apple Newton, который продемонстрировал общественности преимущества упрощенного пользовательского интерфейса. Однако устройство не имело коммерческого успеха из-за ненадежности программного обеспечения, которое пыталось изучить особенности почерка пользователя. К моменту выхода Newton OS 2.0, в которой распознавание почерка было значительно улучшено, включая уникальные функции, которые до сих пор не встречаются в современных системах распознавания, такие как коррекция ошибок в режиме реального времени, уже сложилось преимущественно негативное первое впечатление. После прекращения выпуска Apple Newton эта функция была включена в Mac OS X 10.2 и более поздние версии под названием Inkwell. Позже Palm выпустила успешную серию ПДА, основанную на системе распознавания Graffiti. Graffiti повысила удобство использования, определив набор "одноштриховых" форм для каждого символа. Это уменьшило вероятность ошибочного ввода, хотя запоминание этих форм увеличило сложность обучения для пользователя. Было установлено, что система распознавания Graffiti нарушает патент, принадлежащий Xerox, и Palm заменила Graffiti лицензированной версией системы распознавания почерка CIC, которая, хотя и поддерживала одноштриховые формы, предшествовала патенту Xerox. Решение суда о нарушении было отменено в апелляционной инстанции, а затем снова отменено в последующей апелляции. Впоследствии стороны договорились о соглашении, касающемся этого и других патентов. Tablet PC – это ноутбук с графическим планшетом и стилусом, позволяющий пользователю вводить текст от руки на экране устройства. Операционная система распознает почерк и преобразует его в текст. Windows Vista и Windows 7 включают в себя функции персонализации, которые изучают особенности почерка или словарный запас пользователя для английского, японского, традиционного китайского, упрощенного китайского и корейского языков. Эти функции включают в себя "мастер персонализации", который запрашивает образцы почерка пользователя и использует их для переобучения системы с целью повышения точности распознавания. Эта система отличается от менее продвинутой системы распознавания почерка, используемой в Windows Mobile OS для ПДА. Хотя распознавание почерка является формой ввода, к которой общественность привыкла, оно не получило широкого распространения ни на настольных компьютерах, ни на ноутбуках. До сих пор считается, что ввод с клавиатуры быстрее и надежнее. По состоянию на 2006 год многие ПДА предлагают ввод рукописного текста, иногда даже принимая естественный рукописный почерк, но точность по-прежнему остается проблемой, и некоторые пользователи считают даже простую экранную клавиатуру более эффективной.
and the Inforite point of sale terminal. With the advent of the large consumer market for personal computers, several commercial products were introduced to replace the keyboard and mouse on a personal computer with a single pointing/handwriting system, such as those from Pencept, CIC and others. The first commercially available tablet type portable computer was the GRiDPad from GRiD Systems, released in September 1989. Its operating system was based on MS DOS. In the early 1990s, hardware makers including NCR, IBM and EO released tablet computers running the PenPoint operating system developed by GO Corp. PenPoint used handwriting recognition and gestures throughout and provided the facilities to third party software. IBM's tablet computer was the first to use the ThinkPad name and used IBM's handwriting recognition. This recognition system was later ported to Microsoft Windows for Pen Computing, and IBM's Pen for OS/2. None of these were commercially successful. Advancements in electronics allowed the computing power necessary for handwriting recognition to fit into a smaller form factor than tablet computers, and handwriting recognition is often used as an input method for hand held PDAs. The first PDA to provide written input was the Apple Newton, which exposed the public to the advantage of a streamlined user interface. However, the device was not a commercial success, owing to the unreliability of the software, which tried to learn a user's writing patterns. By the time of the release of the Newton OS 2.0, wherein the handwriting recognition was greatly improved, including unique features still not found in current recognition systems such as modeless error correction, the largely negative first impression had been made. After discontinuation of Apple Newton, the feature was incorporated in Mac OS X 10.2 and later as Inkwell. Palm later launched a successful series of PDAs based on the Graffiti recognition system. Graffiti improved usability by defining a set of "unistrokes", or one stroke forms, for each character. This narrowed the possibility for erroneous input, although memorization of the stroke patterns did increase the learning curve for the user. The Graffiti handwriting recognition was found to infringe on a patent held by Xerox, and Palm replaced Graffiti with a licensed version of the CIC handwriting recognition which, while also supporting unistroke forms, pre dated the Xerox patent. The court finding of infringement was reversed on appeal, and then reversed again on a later appeal. The parties involved subsequently negotiated a settlement concerning this and other patents. A Tablet PC is a notebook computer with a digitizer tablet and a stylus, which allows a user to handwrite text on the unit's screen. The operating system recognizes the handwriting and converts it into text. Windows Vista and Windows 7 include personalization features that learn a user's writing patterns or vocabulary for English, Japanese, Chinese Traditional, Chinese Simplified and Korean. The features include a "personalization wizard" that prompts for samples of a user's handwriting and uses them to retrain the system for higher accuracy recognition. This system is distinct from the less advanced handwriting recognition system employed in its Windows Mobile OS for PDAs. Although handwriting recognition is an input form that the public has become accustomed to, it has not achieved widespread use in either desktop computers or laptops. It is still generally accepted that keyboard input is both faster and more reliable. as of 2006, many PDAs offer handwriting input, sometimes even accepting natural cursive handwriting, but accuracy is still a problem, and some people still find even a simple on screen keyboard more efficient.
Программное обеспечение
Раннее программное обеспечение могло распознавать печатный почерк, где символы были разделены, однако курсивный почерк с соединенными символами представлял собой парадокс Сайра – проблему, связанную с сегментацией символов. В 1962 году Шелия Губерман, находившаяся тогда в Москве, написала первую прикладную программу распознавания образов. Коммерческие решения предлагались такими компаниями, как Communications Intelligence Corporation и IBM. В начале 1990-х годов две компании – ParaGraph International и Lexicus – разработали системы, способные распознавать рукописный курсив. ParaGraph базировалась в России и была основана ученым-компьютерщиком Степаном Пачиковым, а Lexicus – Ронджоном Нагом и Крисом Кортге, студентами Стэнфордского университета. Система ParaGraph CalliGrapher была внедрена в системы Apple Newton, а система Lexicus Longhand стала коммерчески доступна для операционных систем PenPoint и Windows. В 1993 году Lexicus была приобретена компанией Motorola и продолжила разработку систем распознавания китайского почерка и предсказания текста для Motorola. ParaGraph была приобретена SGI в 1997 году, а ее команда по распознаванию почерка сформировала подразделение P&I, которое позднее было приобретено Vadem у SGI. В 1999 году Microsoft приобрела технологию распознавания почерка CalliGrapher и другие технологии цифрового ввода, разработанные P&I, у Vadem. Wolfram Mathematica (версии 8.0 и выше) также предоставляет функцию распознавания рукописного текста или текста TextRecognize.
Исследования
[[Файл:Признание адреса.png|thumbnail|Метод, используемый для использования контекстной информации в первой системе интерпретации рукописных адресов, разработанной Саргуром Шрихари и Джонатаном Халлом. В частности, двунаправленная и многомерная долговременная кратковременная память (LSTM) Алекса Грейвса и др. выиграла три соревнования по распознаванию связного почерка на Международной конференции по анализу и распознаванию документов (ICDAR) в 2009 году, не имея предварительных знаний о трех различных языках (французском, арабском, персидском). Недавние методы глубокого обучения на основе графических процессоров для прямосвязных сетей, разработанные Дэном Сиресаном и его коллегами из IDSIA, выиграли конкурс ICDAR 2011 года по распознаванию китайского рукописного текста в автономном режиме; их нейронные сети также стали первыми искусственными распознавателями образов, достигшими производительности, сопоставимой с человеческой, в известной задаче распознавания рукописных цифр MNIST, разработанной Яном Лекуном и его коллегами из Нью-Йоркского университета. Бенджамин Грэм из Университета Уорик выиграл конкурс по распознаванию китайского рукописного текста в 2013 году, показав точность 97.39% (с ошибкой всего 2.61%), используя подход к сверточным нейронным сетям, который к 2017 году эволюционировал в "разреженные сверточные нейронные сети".