Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
Деректерді машинамен оқылатын форматта сақтауға қабілетті орта. Байланыс және есептеу техникасында машинамен оқылатын орта (немесе компьютермен оқылатын орта) – деректерді цифрлық компьютер немесе сенсор оңай оқи алатын форматта сақтауға қабілетті орта. Бұл адаммен оқылатын орта және деректерден өзгеше. Нәтижесі машинамен оқылатын деректер немесе компьютермен оқылатын деректер деп аталады, ал деректердің өзі машинамен оқылатындық қасиетіне ие деп сипатталады.
Medium capable of storing data in a format readable by a machine
In communications and computing, a machine readable medium (or computer readable medium) is a medium capable of storing data in a format easily readable by a digital computer or a sensor. It contrasts with human readable medium and data. The result is called machine readable data or computer readable data, and the data itself can be described as having machine readability.
Деректер
Машинамен оқылатын деректер құрылымдалған деректер болуы тиіс. Машинамен оқылатын деректерді құруға жасалған әрекеттер 1960 жылдарға дейін жетеді. Машиналық оқу және табиғи тілді өңдеу саласындағы маңызды жетістіктер пайда болған кезде (мысалы, Вайзенбаумның ELIZA-сы), адамдар машинамен оқу мүмкіндігінің табысын күтіп, машинамен оқылатын құжаттар жасауға тырысты. Мұндай мысалдың бірі – музыкатанушы Нэнси Б. Райхтың 1966 жылы композитор Уильям Джей Сидманның туындыларының машинамен оқылатын каталогын жасауы. АҚШ-та 2019 жылғы 14 қаңтардағы «Ашық мемлекеттік деректер» заңы машинамен оқылатын деректерді «компьютердің адамның араласуынсыз оңай өңдеуіне мүмкіндік беретін, сонымен бірге семантикалық мағынаның жоғалмауына кепілдік беретін форматтағы деректер» деп анықтайды. Заң АҚШ-тың федералдық агенттіктерге «агенттіктің кез келген мемлекеттік дерегі машинамен оқылатынын» қамтамасыз ету үшін осындай форматта мемлекеттік деректерді жариялауға нұсқайды. Машинамен оқылатын деректерді екі топқа бөлуге болады: адамдар оқи алатын, бірақ машиналар үшін де оқуға қолайлы деректер (мысалы, микроформаттар, RDFa, HTML) және негізінен машинамен өңдеуге арналған деректер файлдарының форматтары (CSV, RDF, XML, JSON). Бұл форматтар тек олардың ішіндегі деректер формалды түрде құрылымдалған жағдайда ғана машинамен оқылатын болады; жақсы құрылмаған электрондық кестеден CSV файлын экспорттау осы анықтамаға сәйкес келмейді. «Машинамен оқылатын» термині «цифрлық түрде қолжетімді» дегенмен бірдей емес. Цифрлық түрде қолжетімді құжат онлайн режимінде болуы мүмкін, бұл адамдарға компьютер арқылы қол жеткізуді жеңілдетеді, бірақ егер ол машинамен оқылмайтын болса, оның мазмұнын компьютерлік бағдарламалау логикасы арқылы алу, түрлендіру және өңдеу әлдеқайда қиын. Кеңейтілген таңбалау тілі (XML) адамдар мен машиналар үшін де оқуға қолайлы етіп жасалған, ал кеңейтілген стильдік тілдің түрлендіруі (XSLT) деректерді адамдар оқуы үшін ұсынуды жақсарту үшін қолданылады. Мысалы, XSLT XML-ді портативті құжат форматында (PDF) автоматты түрде көрсету үшін пайдаланылуы мүмкін. Машинамен оқылатын деректерді адамдар оқуы үшін автоматты түрде түрлендіруге болады, бірақ көбінесе керісінше орындау мүмкін емес. Үкіметтік өнімділік және нәтижелер туралы заңның (GPRA) жаңарту заңын іске асыру мақсатында Басқару және бюджет кеңсесі (OMB) «машинамен оқылатын форматты» былай анықтайды: «Веб-браузер немесе компьютерлік жүйе автоматты түрде оқи алатын стандартты компьютерлік тілдегі формат (ағылшын тіліндегі мәтін емес). (мысалы, xml). Дәстүрлі мәтін өңдеу құжаттары мен портативті құжат форматындағы (PDF) файлдарды адамдар оңай оқи алады, бірақ машиналарға түсіндіру қиын. Басқа форматтар, мысалы кеңейтілген таңбалау тілі (XML), (JSON) немесе бас бағаналары бар электрондық кестелер, оларды үтірмен бөлінген мәндер (CSV) ретінде экспорттауға болады, машинамен оқылатын форматтар болып табылады». HTML – құрылымдық таңбалау тілі болғандықтан, құжаттың бөліктерін бөлек белгілеу арқылы компьютерлер мазмұн кестелерін, жоспарларды, әдебиеттерді іздеуге арналған библиографияларды және т.б. құрастыру үшін құжат компоненттерін жинай алады. Дәстүрлі мәтін өңдеу құжаттарын және басқа форматтарды машинамен оқылатын етуге болады, бірақ құжаттарда жетілдірілген құрылымдық элементтер болуы керек.
Machine readable data must be structured data. Attempts to create machine readable data occurred as early as the 1960s. At the same time that seminal developments in machine reading and natural language processing were releasing (like Weizenbaum's ELIZA), people were anticipating the success of machine readable functionality and attempting to create machine readable documents. One such example was musicologist Nancy B. Reich's creation of a machine readable catalog of composer William Jay Sydeman's works in 1966. In the United States, the OPEN Government Data Act of 14 January 2019 defines machine readable data as "data in a format that can be easily processed by a computer without human intervention while ensuring no semantic meaning is lost." The law directs U. S. federal agencies to publish public data in such a manner, ensuring that "any public data asset of the agency is machine readable". Machine readable data may be classified into two groups: human readable data that is marked up so that it can also be read by machines (e. g. microformats, RDFa, HTML), and data file formats intended principally for processing by machines (CSV, RDF, XML, JSON). These formats are only machine readable if the data contained within them is formally structured; exporting a CSV file from a badly structured spreadsheet does not meet the definition. Machine readable is not synonymous with digitally accessible. A digitally accessible document may be online, making it easier for humans to access via computers, but its content is much harder to extract, transform, and process via computer programming logic if it is not machine readable. Extensible Markup Language (XML) is designed to be both human and machine readable, and Extensible Stylesheet Language Transformation (XSLT) is used to improve the presentation of the data for human readability. For example, XSLT can be used to automatically render XML in Portable Document Format (PDF). Machine readable data can be automatically transformed for human readability but, generally speaking, the reverse is not true. For purposes of implementation of the Government Performance and Results Act (GPRA) Modernization Act, the Office of Management and Budget (OMB) defines "machine readable format" as follows: "Format in a standard computer language (not English text) that can be read automatically by a web browser or computer system. (e. g.; xml). Traditional word processing documents and portable document format (PDF) files are easily read by humans but typically are difficult for machines to interpret. Other formats such as extensible markup language (XML), (JSON), or spreadsheets with header columns that can be exported as comma separated values (CSV) are machine readable formats. As HTML is a structural markup language, discreetly labeling parts of the document, computers are able to gather document components to assemble tables of contents, outlines, literature search bibliographies, etc. It is possible to make traditional word processing documents and other formats machine readable but the documents must include enhanced structural elements."