Оптикалық тану (OCR) жүйесі – суреттегі мәтінді автоматты түрде цифрлық форматқа айналдырады. Құжаттарды, суреттерді өңдеуге, мәліметтерді іздеуге көмектеседі. 💻🔍🇰🇿
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Компьютерлік визуалды мәтінді тану
Computer recognition of visual text
Оптикалық таңбаларды тану немесе оптикалық таңбаларды оқу (ОТК) – сканерленген құжаттан, құжаттың фотосуретінен, көрініс фотосуретінен (мысалы, пейзаждық фотосуреттегі белгілер мен жарнамалық баннерлердегі мәтін) немесе бейнеге қосылған субтитр мәтінінен (мысалы, теледидар хабарларынан) алынған, терілген, қолмен жазылған немесе басылған мәтіннің кескіндерін машиналық кодталған мәтінге электрондық немесе механикалық түрлендіру. Паспорттар, шот-фактуралар, банк шоттары, компьютерлік түбіртектер, визиткалар, хаттар, басылған деректер немесе кез келген басқа да құжаттар сияқты басылған деректерді енгізудің кең таралған түрі ретінде қолданылады. Бұл басылған мәтіндерді цифрландырудың әдеттегі әдісі, осы арқылы оларды электрондық түрде өңдеуге, іздеуге, ықшам түрде сақтауға, онлайн көрсетуге және когнитивтік есептеулер, машиналық аударма, мәтінді дауысқа түрлендіру (құрастырылған), маңызды деректерді және мәтіндік талдауды қажет ететін машиналық процестерде пайдалануға болады. ОТК – үлгілерді тану, жасанды интеллект және компьютерлік көру саласындағы зерттеу саласы. Алғашқы нұсқалары әрбір таңбаның кескінімен оқытылуы керек болды және бір қаріппен жұмыс істеді. Қазіргі заманғы жүйелер көптеген қаріптер үшін жоғары дәлдікпен нәтиже береді және әртүрлі кескін файл форматтарын қолдайды. Кейбір жүйелер түпнұсқа бетке ұқсас форматталған шығысты – суреттер, бағандар және басқа мәтіндік емес элементтерді қамти отырып – қайта жасай алады.
Optical character recognition or optical character reader (OCR) is the electronic or mechanical conversion of images of typed, handwritten or printed text into machine encoded text, whether from a scanned document, a photo of a document, a scene photo (for example the text on signs and billboards in a landscape photo) or from subtitle text superimposed on an image (for example: from a television broadcast). Widely used as a form of data entry from printed paper data recordswhether passport documents, invoices, bank statements, computerized receipts, business cards, mail, printed data, or any suitable documentationit is a common method of digitizing printed texts so that they can be electronically edited, searched, stored more compactly, displayed online, and used in machine processes such as cognitive computing, machine translation, (extracted) text to speech, key data and text mining. OCR is a field of research in pattern recognition, artificial intelligence and computer vision. Early versions needed to be trained with images of each character, and worked on one font at a time. Advanced systems capable of producing a high degree of accuracy for most fonts are now common, and with support for a variety of image file format inputs. Some systems are capable of reproducing formatted output that closely approximates the original page including images, columns, and other non textual components.
Тарих
Алғашқы оптикалық таңбаларды тану телеграфиямен байланысты технологияларға және көзі нашар адамдар үшін оқу құралдарын жасауға бастау алды. 1914 жылы Эммануэль Голдберг әріптерді оқып, оларды стандартты телеграфтық кодқа түрлендіретін машина ойлап тапты. Сонымен қатар, Эдмунд Фурнье д'Альбе баспа бетінен жылжығанда нақты әріптерге немесе таңбаларға сәйкес дыбыстар шығаратын «Оптофон» деп аталатын қолға ұсталатын сканерді жасады. 1920 жылдардың соңы мен 1930 жылдары Эммануэль Голдберг оптикалық кодты тану жүйесін пайдаланып, микрофильмдік архивтерді іздеуге арналған «Статистикалық машинаны» жасады. 1931 жылы ол бұл өнертабысы үшін АҚШ патенті № 1,838,389 алды. Патент IBM компаниясымен сатып алынды.
Early optical character recognition may be traced to technologies involving telegraphy and creating reading devices for the blind. In 1914, Emanuel Goldberg developed a machine that read characters and converted them into standard telegraph code. Concurrently, Edmund Fournier d'Albe developed the Optophone, a handheld scanner that when moved across a printed page, produced tones that corresponded to specific letters or characters. In the late 1920s and into the 1930s, Emanuel Goldberg developed what he called a "Statistical Machine" for searching microfilm archives using an optical code recognition system. In 1931, he was granted US Patent number 1,838,389 for the invention. The patent was acquired by IBM.
Көру қабілеті нашар пайдаланушылар
1974 жылы Рэй Курцвейл Kurzweil Computer Products, Inc. компаниясын құрды және кез келген шрифтте басылған мәтінді тани алатын омни-шрифт OCR-ді дамытуды жалғастырды. (Курцвейл көбінесе омни-шрифт OCR-ді ойлап тапқан деп есептеледі, бірақ ол 1960 және 1970 жылдарда CompuScan сияқты компаниялар тарапынан қолданылған.) Курцвейл бұл технологияны соқыр адамдарға арналған оқу машинасы жасау үшін пайдаланды, ол компьютерге мәтінді оқып беруге мүмкіндік берді. Құрылғыда CCD типті жазық сканер және мәтінді дауысқа түрлендіру синтезаторы болды. 1976 жылдың 13 қаңтарында аяқталған өнім Курцвейл мен Ұлттық соқырлар федерациясының басшылары басқарған, кеңінен жарияланған баспасөз конференциясында таныстырылды. 1978 жылы Kurzweil Computer Products оптикалық таңбаларды тану компьютерлік бағдарламасының коммерциялық нұсқасын сатуды бастады. LexisNexis алғашқы клиенттердің бірі болды және заңдық құжаттар мен жаңалықтарды өзінің жаңа онлайн деректер базасына жүктеу үшін бағдарламаны сатып алды. Екі жылдан кейін Курцвейл өзінің компаниясын Xerox-ке сатты, ол кейін Scansoft болып бөлініп, Nuance Communications-пен бірікті. 2000-шы жылдары OCR онлайн қызмет ретінде (WebOCR) қолжетімді болды, сондай-ақ бұлттық есептеу ортасында және смартфондағы шетел тіліндегі белгілерді нақты уақыт режимінде аудару сияқты мобильді қосымшаларда пайдаланылды. Смартфондар мен смарт-көзілдіріктердің пайда болуымен OCR интернетке қосылған мобильді құрылғыларда қолданыла алады, құрылғының камерасы түсірген мәтінді шығару үшін. OCR функционалдығы жоқ құрылғылар әдетте OCR API-ді пайдаланып, құрылғы түсірген кескіннен мәтінді шығарады. OCR API шығарылған мәтінді, сондай-ақ түпнұсқа кескіндегі анықталған мәтіннің орналасуы туралы ақпаратты құрылғыға қосымша өңдеу (мысалы, мәтінді дауысқа түрлендіру) немесе көрсету үшін қайтарады. Латын, кириллица, араб, еврей, үнді, бенгал (бангла), деванагари, тамил, қытай, жапон және корей әріптері бар, көптеген әдеттегі жазу жүйелері үшін әртүрлі коммерциялық және ашық кодты OCR жүйелері бар.
In 1974, Ray Kurzweil started the company Kurzweil Computer Products, Inc. and continued development of omni font OCR, which could recognize text printed in virtually any font. (Kurzweil is often credited with inventing omni font OCR, but it was in use by companies, including CompuScan, in the late 1960s and 1970s.) Kurzweil used the technology to create a reading machine for blind people to have a computer read text to them out loud. The device included a CCD type flatbed scanner and a text to speech synthesizer. On January 13, 1976, the finished product was unveiled during a widely reported news conference headed by Kurzweil and the leaders of the National Federation of the Blind. In 1978, Kurzweil Computer Products began selling a commercial version of the optical character recognition computer program. LexisNexis was one of the first customers, and bought the program to upload legal paper and news documents onto its nascent online databases. Two years later, Kurzweil sold his company to Xerox, which eventually spun it off as Scansoft, which merged with Nuance Communications. In the 2000s, OCR was made available online as a service (WebOCR), in a cloud computing environment, and in mobile applications like real time translation of foreign language signs on a smartphone. With the advent of smartphones and smartglasses, OCR can be used in internet connected mobile device applications that extract text captured using the device's camera. These devices that do not have built in OCR functionality will typically use an OCR API to extract the text from the image file captured by the device. The OCR API returns the extracted text, along with information about the location of the detected text in the original image back to the device app for further processing (such as text to speech) or display. Various commercial and open source OCR systems are available for most common writing systems, including Latin, Cyrillic, Arabic, Hebrew, Indic, Bengali (Bangla), Devanagari, Tamil, Chinese, Japanese, and Korean characters.
Түрлері
Оптикалық таңбаларды тану (ОКР) – машинамен терілген мәтінді бір-бір таңбадан немесе глифтен анықтауға бағытталған технология. Оптикалық сөзді тану – машинамен терілген мәтінді бір-бір сөзден анықтайды (әсіресе, сөздерді бос орынмен бөлінетін тілдер үшін). Көбінесе жай ғана "ОКР" деп аталады. Ақылды таңбаларды тану (АКТ) – қолмен жазылған баспа шрифті немесе жалғастырылған мәтінді бір-бір таңбадан немесе глифтен анықтауға бағытталған, көбінесе машиналық оқытуды қолданатын технология. Ақылды сөзді тану (АСС) – қолмен жазылған баспа шрифті немесе жалғастырылған мәтінді бір-бір сөзден анықтайды. Бұл әсіресе глифтер жалғастырылған жазуда бөлінбеген тілдер үшін өте пайдалы. ОКР көбінесе статикалық құжатты талдайтын офлайн процесс болып табылады. Онлайн ОКР API қызметін ұсынатын бұлттық қызметтер де бар. Қолжазбаның қозғалысын талдау қолжазбаны тану үшін деректер көзі ретінде қолданылуы мүмкін. Бұл техника тек таңбалар мен сөздердің пішінін ғана емес, сонымен қатар қозғалысты – сегменттердің салыну ретін, бағытын және қаламды қою мен көтеру үлгісін де анықтай алады. Бұл қосымша ақпарат процестің дәлдігін арттырады. Бұл технология "онлайн таңбаларды тану", "динамикалық таңбаларды тану", "нақты уақыт таңбаларды тану" және "ақылды таңбаларды тану" деп те аталады.
Optical character recognition (OCR)targets typewritten text, one glyph or character at a time. Optical word recognitiontargets typewritten text, one word at a time (for languages that use a space as a word divider). Usually just called "OCR". Intelligent character recognition (ICR)also targets handwritten printscript or cursive text one glyph or character at a time, usually involving machine learning. Intelligent word recognition (IWR)also targets handwritten printscript or cursive text, one word at a time. This is especially useful for languages where glyphs are not separated in cursive script. OCR is generally an offline process, which analyses a static document. There are cloud based services which provide an online OCR API service. Handwriting movement analysis can be used as input to handwriting recognition. Instead of merely using the shapes of glyphs and words, this technique is able to capture motion, such as the order in which segments are drawn, the direction, and the pattern of putting the pen down and lifting it. This additional information can make the process more accurate. This technology is also known as "online character recognition", "dynamic character recognition", "real time character recognition", and "intelligent character recognition".
Кейінгі өңдеу
OCR-нің дәлдігін жоғарылатуға болады, егер нәтижелерді құжатта болуы мүмкін сөздердің тізімімен шектелсе. Мысалы, "Вашингтон, D.C." ағылшын тілінде "Вашингтон DOC" дегеннен гөрі әлдеқайда көп кездеседі. Сканерленетін тілдің грамматикасын білу де сөздің етістік пе, есім пе екенін анықтауға көмектеседі, соның арқасында дәлдік артады. OCR API-ден алынған нәтижелерді одан да жақсарту үшін Левенштейн қашықтығы алгоритмі OCR кейін өңдеуінде қолданылады.
OCR accuracy can be increased if the output is constrained by a lexicona list of words that are allowed to occur in a document. For example, "Washington, D. C." is generally far more common in English than "Washington DOC". Knowledge of the grammar of the language being scanned can also help determine if a word is likely to be a verb or a noun, for example, allowing greater accuracy. The Levenshtein Distance algorithm has also been used in OCR post processing to further optimize results from an OCR API.
Қолданбаға тән оңтайландырулар
Соңғы жылдары негізгі OCR технологиясын ұсынатын компаниялар OCR жүйелерін нақты кіріс түрлерін тиімдірек өңдеу үшін жаңарта бастады. Қолданбаға тән лексикадан басқа, бизнес ережелерін, стандартты өрнектерді немесе түсті суреттердегі мол ақпаратты ескере отырып, жақсы нәтижелерге қол жеткізуге болады. Бұл стратегия "Қолданбаға бағытталған OCR" немесе "Тәңкелген OCR" деп аталады және лицензиялық номерлерді, шот-фактураларды, скриншоттарды, жеке куәліктерді, жүргізуші куәліктерін және автомобиль өндірісінің OCR-ын жүзеге асыру үшін қолданылды. New York Times OCR технологиясын Document Helper деп аталатын өзіндік құралға бейімдеді, ол олардың интерактивті жаңалықтар тобына қарау қажет құжаттарды өңдеуді үдетуге мүмкіндік береді. Олар бұл құралдың сағатына 5400 бетке дейін өңдеуге және журналистерге мазмұнды қарау үшін дайындауға көмектесетінін атап өтеді.
In recent years, the major OCR technology providers began to tweak OCR systems to deal more efficiently with specific types of input. Beyond an application specific lexicon, better performance may be had by taking into account business rules, standard expression, or rich information contained in color images. This strategy is called "Application Oriented OCR" or "Customized OCR", and has been applied to OCR of license plates, invoices, screenshots, ID cards, driver's licenses, and automobile manufacturing. The New York Times has adapted the OCR technology into a proprietary tool they entitle Document Helper, that enables their interactive news team to accelerate the processing of documents that need to be reviewed. They note that it enables them to process what amounts to as many as 5,400 pages per hour in preparation for reporters to review the contents.
Айналадағы амалдар
Таңбаларды тану мәселесін жақсарылған OCR алгоритмдерінен өзгеше тәсілдер арқылы шешудің бірнеше техникасы бар.
There are several techniques for solving the problem of character recognition by means other than improved OCR algorithms.
Жақсы нәтижеге жету
OCR A, OCR B немесе MICR сияқты арнайы қаріптер, нақты өлшемдері, аралықтары және ерекше таңба пішіндерімен, банк чектерін өңдеу кезінде транскрипцияның жоғары дәлдігін қамтамасыз етеді. Көптеген танымал OCR қозғалтқыштары Arial немесе Times New Roman сияқты кең таралған қаріптердегі мәтінді тану үшін жасалған, сондықтан олар осы ерекше және жиі қолданылатын қаріптерден өзгешеленетін қаріптердегі мәтінді тана алмайды. Google Tesseract жаңа қаріптерді тануға оқытыла алатындықтан, ол OCR A, OCR B және MICR қаріптерін тани алады. Тізімдемелер – бұл адамдарды әрбір ұяшыққа бір ғана таңбаны анық жазуға ынталандыратын алдын ала басылған ұяшықтар. Көпшілік ресурстар мінездемелерді тікелей тану үшін емес, бейне өңдеу алгоритмдерін жасау үшін бағдарламалық жасақтаманы дамытушыларды шақыру үшін, мысалы, рейтингтік турнирлер арқылы қолданылды.
Special fonts like OCR A, OCR B, or MICR fonts, with precisely specified sizing, spacing, and distinctive character shapes, allow a higher accuracy rate during transcription in bank check processing. Several prominent OCR engines were designed to capture text in popular fonts such as Arial or Times New Roman, and are incapable of capturing text in these fonts that are specialized and very different from popularly used fonts. As Google Tesseract can be trained to recognize new fonts, it can recognize OCR A, OCR B and MICR fonts. Comb fields are pre printed boxes that encourage humans to write more legiblyone glyph per box. Crowd sourcing has also been used not to perform character recognition directly but to invite software developers to develop image processing algorithms, for example, through the use of rank order tournaments.
Дұрыс
АҚШ Энергетика министрлігінің тапсырысы бойынша, Ақпараттық ғылымдар ғылыми-зерттеу институты (ISRI) машинамен басылған құжаттарды түсінуге арналған автоматтандырылған технологияларды жетілдіруді мақсат етіп, 1992-1996 жылдар аралығында OCR дәлдігінің ең авторитетті жылдық сынағын жүргізді. Латын әрпімен жазылған мәтінді тану, тіпті айқын кескіндер болған жағдайда да, әлі де 100% дәл емес. 19-шы және 20-шы ғасырдың басындағы газет беттерін тануға негізделген бір зерттеуде коммерциялық OCR бағдарламалық қамтамасы үшін әрбір таңба бойынша OCR дәлдігі 81%-дан 99%-ға дейін ауытқыды; толық дәлдікке адамның қарауы немесе деректер сөздігі арқылы растау арқылы қол жеткізуге болады. Қолмен басылған мәтінді, көркем жазуды және басқа жазу жүйелеріндегі басылған мәтінді (әсіресе бір таңба үшін көптеген сызықтары бар Шығыс Азия тілдеріндегі таңбаларды) тану сияқты басқа да салалар әлі де белсенді зерттеулердің нысаны болып табылады. MNIST деректер базасы жүйелердің қолмен жазылған цифрларды тану қабілетін сынау үшін кеңінен қолданылады. Дәлдік деңгейін бірнеше тәсілмен өлшеуге болады, ал олардың өлшену тәсілі есептелген дәлдік деңгейіне үлкен әсер етеді. Мысалы, егер сөз контексті (сөздік) бағдарламалық қамтаманы жоқ сөздерді табу үшін қолданбаса, 1% таңба қатесі (99% дәлдік) егер өлшем әрбір толық сөздің қате әріптермен танылғанына негізделген болса, 5% немесе одан да нашар нәтиже беруі мүмкін. Нейрондық желіге негізделген қолжазбаны тану шешімдерінде жеткілікті көлемдегі деректер жиынтығын пайдалану маңызды. Дегенмен, табиғи деректер жиынтығын жасау өте күрделі және көп уақытты алады. Ескі мәтінді цифрландырудағы қиындықтардың мысалы – OCR-дің «ұзын s» және «f» таңбаларын ажырата алмауы.
Commissioned by the U. S. Department of Energy (DOE), the Information Science Research Institute (ISRI) had the mission to foster the improvement of automated technologies for understanding machine printed documents, and it conducted the most authoritative of the Annual Test of OCR Accuracy from 1992 to 1996. Recognition of typewritten, Latin script text is still not 100% accurate even where clear imaging is available. One study based on recognition of 19th and early 20th century newspaper pages concluded that character by character OCR accuracy for commercial OCR software varied from 81% to 99%; total accuracy can be achieved by human review or Data Dictionary Authentication. Other areasincluding recognition of hand printing, cursive handwriting, and printed text in other scripts (especially those East Asian language characters which have many strokes for a single character)are still the subject of active research. The MNIST database is commonly used for testing systems' ability to recognize handwritten digits. Accuracy rates can be measured in several ways, and how they are measured can greatly affect the reported accuracy rate. For example, if word context (a lexicon of words) is not used to correct software finding non existent words, a character error rate of 1% (99% accuracy) may result in an error rate of 5% or worse if the measurement is based on whether each whole word was recognized with no incorrect letters. Using a large enough dataset is important in a neural network based handwriting recognition solutions. On the other hand, producing natural datasets is very complicated and time consuming. An example of the difficulties inherent in digitizing old text is the inability of OCR to differentiate between the "long s" and "f" characters.
Юникод
Unicode стандартына 1993 жылғы маусымда 1.1 нұсқасымен бірге OCR технологиясын қолдау үшін әріптер қосылды. Осы әріптердің кейбіреулері MICR, OCR A немесе OCR B қаріптеріне тән болып келеді.
Characters to support OCR were added to the Unicode Standard in June 1993, with the release of version 1.1. Some of these characters are mapped from fonts specific to MICR, OCR A or OCR B.