Введение

Средство, способное хранить данные в формате, читаемом машиной.

В области связи и вычислительной техники машиночитаемый носитель (или компьютерночитаемый носитель) – это средство, способное хранить данные в формате, легко воспринимаемом цифровым компьютером или датчиком. Он отличается от носителей и данных, предназначенных для чтения человеком. Результатом является машиночитаемые данные или компьютерночитаемые данные, а сами данные можно охарактеризовать как обладающие машиночитаемостью.

Данные

Машинно-читаемые данные должны быть структурированными. Попытки создания машино-читаемых данных предпринимались еще в 1960-х годах. Одновременно с основополагающими разработками в области машинного чтения и обработки естественного языка (такими как ELIZA Вейзенбаума) люди предвидели успех машино-читаемых функций и пытались создавать машино-читаемые документы. Одним из примеров является создание музыковедом Нэнси Б. Райх машино-читаемого каталога произведений композитора Уильяма Джея Сидмана в 1966 году. В Соединенных Штатах Закон об открытых государственных данных от 14 января 2019 года определяет машино-читаемые данные как "данные в формате, который может быть легко обработан компьютером без участия человека, при этом не теряется семантическое значение". Закон обязывает федеральные агентства США публиковать общедоступные данные в таком формате, гарантируя, что "любой общедоступный массив данных агентства будет машино-читаемым". Машинно-читаемые данные можно классифицировать на две группы: данные, читаемые человеком, которые размечены таким образом, чтобы их могли читать и машины (например, микроформаты, RDFa, HTML), и форматы файлов данных, предназначенные главным образом для обработки машинами (CSV, RDF, XML, JSON). Эти форматы являются машино-читаемыми только в том случае, если содержащиеся в них данные формально структурированы; экспорт CSV-файла из плохо структурированной таблицы не соответствует этому определению. Машинно-читаемые данные не являются синонимом цифровой доступности. Цифровой документ может быть доступен в сети, что облегчает доступ к нему людям через компьютеры, но извлечь, преобразовать и обработать его содержимое с помощью логики компьютерного программирования гораздо сложнее, если он не является машино-читаемым. Язык расширяемой разметки (XML) предназначен для чтения как человеком, так и машиной, а язык преобразования таблиц стилей (XSLT) используется для улучшения представления данных для удобства чтения человеком. Например, XSLT можно использовать для автоматического преобразования XML в переносимый формат документов (PDF). Машинно-читаемые данные можно автоматически преобразовать для удобства чтения человеком, но, как правило, обратное неверно. В целях реализации Закона о модернизации Закона о результатах и эффективности деятельности правительства (GPRA), Управление по бюджету и управлению (OMB) определяет "машинно-читаемый формат" следующим образом: "Формат на стандартном компьютерном языке (не на английском языке), который может быть автоматически прочитан веб-браузером или компьютерной системой (например, XML). Традиционные документы для обработки текста и файлы портативного формата документов (PDF) легко читаются людьми, но обычно их трудно интерпретировать машинам. Другие форматы, такие как язык расширяемой разметки (XML), (JSON) или электронные таблицы с заголовками столбцов, которые можно экспортировать в виде значений, разделенных запятыми (CSV), являются машино-читаемыми форматами. Поскольку HTML является языком структурной разметки, дискретно маркирующим части документа, компьютеры могут собирать компоненты документа для создания оглавлений, планов, библиографий для поиска литературы и т. д. Можно сделать традиционные текстовые документы и другие форматы машино-читаемыми, но документы должны содержать расширенные структурные элементы".