Машинно-читаемые данные: форматы, стандарты и применение.
Machine-readable medium and data
Машинно-читаемый носитель: что это такое? Хранение данных в формате, понятном компьютерам и сенсорам. Структурированные данные, история развития с 1960-х.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Средство, способное хранить данные в формате, читаемом машиной.
Medium capable of storing data in a format readable by a machine
В области связи и вычислительной техники машиночитаемый носитель (или компьютерночитаемый носитель) – это средство, способное хранить данные в формате, легко воспринимаемом цифровым компьютером или датчиком. Он отличается от носителей и данных, предназначенных для чтения человеком. Результатом является машиночитаемые данные или компьютерночитаемые данные, а сами данные можно охарактеризовать как обладающие машиночитаемостью.
In communications and computing, a machine readable medium (or computer readable medium) is a medium capable of storing data in a format easily readable by a digital computer or a sensor. It contrasts with human readable medium and data. The result is called machine readable data or computer readable data, and the data itself can be described as having machine readability.
Данные
Машинно-читаемые данные должны быть структурированными. Попытки создания машино-читаемых данных предпринимались еще в 1960-х годах. Одновременно с основополагающими разработками в области машинного чтения и обработки естественного языка (такими как ELIZA Вейзенбаума) люди предвидели успех машино-читаемых функций и пытались создавать машино-читаемые документы. Одним из примеров является создание музыковедом Нэнси Б. Райх машино-читаемого каталога произведений композитора Уильяма Джея Сидмана в 1966 году. В Соединенных Штатах Закон об открытых государственных данных от 14 января 2019 года определяет машино-читаемые данные как "данные в формате, который может быть легко обработан компьютером без участия человека, при этом не теряется семантическое значение". Закон обязывает федеральные агентства США публиковать общедоступные данные в таком формате, гарантируя, что "любой общедоступный массив данных агентства будет машино-читаемым". Машинно-читаемые данные можно классифицировать на две группы: данные, читаемые человеком, которые размечены таким образом, чтобы их могли читать и машины (например, микроформаты, RDFa, HTML), и форматы файлов данных, предназначенные главным образом для обработки машинами (CSV, RDF, XML, JSON). Эти форматы являются машино-читаемыми только в том случае, если содержащиеся в них данные формально структурированы; экспорт CSV-файла из плохо структурированной таблицы не соответствует этому определению. Машинно-читаемые данные не являются синонимом цифровой доступности. Цифровой документ может быть доступен в сети, что облегчает доступ к нему людям через компьютеры, но извлечь, преобразовать и обработать его содержимое с помощью логики компьютерного программирования гораздо сложнее, если он не является машино-читаемым. Язык расширяемой разметки (XML) предназначен для чтения как человеком, так и машиной, а язык преобразования таблиц стилей (XSLT) используется для улучшения представления данных для удобства чтения человеком. Например, XSLT можно использовать для автоматического преобразования XML в переносимый формат документов (PDF). Машинно-читаемые данные можно автоматически преобразовать для удобства чтения человеком, но, как правило, обратное неверно. В целях реализации Закона о модернизации Закона о результатах и эффективности деятельности правительства (GPRA), Управление по бюджету и управлению (OMB) определяет "машинно-читаемый формат" следующим образом: "Формат на стандартном компьютерном языке (не на английском языке), который может быть автоматически прочитан веб-браузером или компьютерной системой (например, XML). Традиционные документы для обработки текста и файлы портативного формата документов (PDF) легко читаются людьми, но обычно их трудно интерпретировать машинам. Другие форматы, такие как язык расширяемой разметки (XML), (JSON) или электронные таблицы с заголовками столбцов, которые можно экспортировать в виде значений, разделенных запятыми (CSV), являются машино-читаемыми форматами. Поскольку HTML является языком структурной разметки, дискретно маркирующим части документа, компьютеры могут собирать компоненты документа для создания оглавлений, планов, библиографий для поиска литературы и т. д. Можно сделать традиционные текстовые документы и другие форматы машино-читаемыми, но документы должны содержать расширенные структурные элементы".
Machine readable data must be structured data. Attempts to create machine readable data occurred as early as the 1960s. At the same time that seminal developments in machine reading and natural language processing were releasing (like Weizenbaum's ELIZA), people were anticipating the success of machine readable functionality and attempting to create machine readable documents. One such example was musicologist Nancy B. Reich's creation of a machine readable catalog of composer William Jay Sydeman's works in 1966. In the United States, the OPEN Government Data Act of 14 January 2019 defines machine readable data as "data in a format that can be easily processed by a computer without human intervention while ensuring no semantic meaning is lost." The law directs U. S. federal agencies to publish public data in such a manner, ensuring that "any public data asset of the agency is machine readable". Machine readable data may be classified into two groups: human readable data that is marked up so that it can also be read by machines (e. g. microformats, RDFa, HTML), and data file formats intended principally for processing by machines (CSV, RDF, XML, JSON). These formats are only machine readable if the data contained within them is formally structured; exporting a CSV file from a badly structured spreadsheet does not meet the definition. Machine readable is not synonymous with digitally accessible. A digitally accessible document may be online, making it easier for humans to access via computers, but its content is much harder to extract, transform, and process via computer programming logic if it is not machine readable. Extensible Markup Language (XML) is designed to be both human and machine readable, and Extensible Stylesheet Language Transformation (XSLT) is used to improve the presentation of the data for human readability. For example, XSLT can be used to automatically render XML in Portable Document Format (PDF). Machine readable data can be automatically transformed for human readability but, generally speaking, the reverse is not true. For purposes of implementation of the Government Performance and Results Act (GPRA) Modernization Act, the Office of Management and Budget (OMB) defines "machine readable format" as follows: "Format in a standard computer language (not English text) that can be read automatically by a web browser or computer system. (e. g.; xml). Traditional word processing documents and portable document format (PDF) files are easily read by humans but typically are difficult for machines to interpret. Other formats such as extensible markup language (XML), (JSON), or spreadsheets with header columns that can be exported as comma separated values (CSV) are machine readable formats. As HTML is a structural markup language, discreetly labeling parts of the document, computers are able to gather document components to assemble tables of contents, outlines, literature search bibliographies, etc. It is possible to make traditional word processing documents and other formats machine readable but the documents must include enhanced structural elements."