Кіріспе

Деректерді машинамен оқылатын форматта сақтауға қабілетті орта. Байланыс және есептеу техникасында машинамен оқылатын орта (немесе компьютермен оқылатын орта) – деректерді цифрлық компьютер немесе сенсор оңай оқи алатын форматта сақтауға қабілетті орта. Бұл адаммен оқылатын орта және деректерден өзгеше. Нәтижесі машинамен оқылатын деректер немесе компьютермен оқылатын деректер деп аталады, ал деректердің өзі машинамен оқылатындық қасиетіне ие деп сипатталады.

Деректер

Машинамен оқылатын деректер құрылымдалған деректер болуы тиіс. Машинамен оқылатын деректерді құруға жасалған әрекеттер 1960 жылдарға дейін жетеді. Машиналық оқу және табиғи тілді өңдеу саласындағы маңызды жетістіктер пайда болған кезде (мысалы, Вайзенбаумның ELIZA-сы), адамдар машинамен оқу мүмкіндігінің табысын күтіп, машинамен оқылатын құжаттар жасауға тырысты. Мұндай мысалдың бірі – музыкатанушы Нэнси Б. Райхтың 1966 жылы композитор Уильям Джей Сидманның туындыларының машинамен оқылатын каталогын жасауы. АҚШ-та 2019 жылғы 14 қаңтардағы «Ашық мемлекеттік деректер» заңы машинамен оқылатын деректерді «компьютердің адамның араласуынсыз оңай өңдеуіне мүмкіндік беретін, сонымен бірге семантикалық мағынаның жоғалмауына кепілдік беретін форматтағы деректер» деп анықтайды. Заң АҚШ-тың федералдық агенттіктерге «агенттіктің кез келген мемлекеттік дерегі машинамен оқылатынын» қамтамасыз ету үшін осындай форматта мемлекеттік деректерді жариялауға нұсқайды. Машинамен оқылатын деректерді екі топқа бөлуге болады: адамдар оқи алатын, бірақ машиналар үшін де оқуға қолайлы деректер (мысалы, микроформаттар, RDFa, HTML) және негізінен машинамен өңдеуге арналған деректер файлдарының форматтары (CSV, RDF, XML, JSON). Бұл форматтар тек олардың ішіндегі деректер формалды түрде құрылымдалған жағдайда ғана машинамен оқылатын болады; жақсы құрылмаған электрондық кестеден CSV файлын экспорттау осы анықтамаға сәйкес келмейді. «Машинамен оқылатын» термині «цифрлық түрде қолжетімді» дегенмен бірдей емес. Цифрлық түрде қолжетімді құжат онлайн режимінде болуы мүмкін, бұл адамдарға компьютер арқылы қол жеткізуді жеңілдетеді, бірақ егер ол машинамен оқылмайтын болса, оның мазмұнын компьютерлік бағдарламалау логикасы арқылы алу, түрлендіру және өңдеу әлдеқайда қиын. Кеңейтілген таңбалау тілі (XML) адамдар мен машиналар үшін де оқуға қолайлы етіп жасалған, ал кеңейтілген стильдік тілдің түрлендіруі (XSLT) деректерді адамдар оқуы үшін ұсынуды жақсарту үшін қолданылады. Мысалы, XSLT XML-ді портативті құжат форматында (PDF) автоматты түрде көрсету үшін пайдаланылуы мүмкін. Машинамен оқылатын деректерді адамдар оқуы үшін автоматты түрде түрлендіруге болады, бірақ көбінесе керісінше орындау мүмкін емес. Үкіметтік өнімділік және нәтижелер туралы заңның (GPRA) жаңарту заңын іске асыру мақсатында Басқару және бюджет кеңсесі (OMB) «машинамен оқылатын форматты» былай анықтайды: «Веб-браузер немесе компьютерлік жүйе автоматты түрде оқи алатын стандартты компьютерлік тілдегі формат (ағылшын тіліндегі мәтін емес). (мысалы, xml). Дәстүрлі мәтін өңдеу құжаттары мен портативті құжат форматындағы (PDF) файлдарды адамдар оңай оқи алады, бірақ машиналарға түсіндіру қиын. Басқа форматтар, мысалы кеңейтілген таңбалау тілі (XML), (JSON) немесе бас бағаналары бар электрондық кестелер, оларды үтірмен бөлінген мәндер (CSV) ретінде экспорттауға болады, машинамен оқылатын форматтар болып табылады». HTML – құрылымдық таңбалау тілі болғандықтан, құжаттың бөліктерін бөлек белгілеу арқылы компьютерлер мазмұн кестелерін, жоспарларды, әдебиеттерді іздеуге арналған библиографияларды және т.б. құрастыру үшін құжат компоненттерін жинай алады. Дәстүрлі мәтін өңдеу құжаттарын және басқа форматтарды машинамен оқылатын етуге болады, бірақ құжаттарда жетілдірілген құрылымдық элементтер болуы керек.