Кіріспе
Интернет протоколы
robots.txt – веб-сайттардың веб-тараушылар мен басқа веб-роботтарға сайттың қай бөлімдеріне кіруге рұқсат етілгенін көрсету үшін қолданылатын, роботтарды қанағаттандырмау протоколын іске асыруға арналған файл атауы. 1994 жылы жасалған бұл стандарт ерікті түрде орындалуға негізделген. Зардапты боттар бұл файлды қай беттерді аралау керектігін көрсететін анықтамалық ретінде пайдалана алады, бірақ стандартты ұйымдар мұндай әрекеттерге қарсы тұруды ұсынбайды. Кейбір архивтік сайттар robots.txt файлын елемейді. Бұл стандарт 1990 жылдары серверлерге түсетін жүктемені азайту үшін қолданылған; ал 2020 жылдары көптеген веб-сайттар генеративтік жасанды интеллект үшін мәліметтер жинаумен айналысатын боттарға қол жеткізуді тоқтатты. "robots.txt" файлы сайт карталарымен бірге қолданылуы мүмкін, олар веб-сайттар үшін тағы бір боттарды қабылдау стандарты болып табылады.
Тарих
Стандартты 1994 жылғы ақпанда Мартин Костер, Nexor компаниясында жұмыс істеген кезде, сол кездегі WWW-ға қатысты іс-әрекеттер үшін негізгі байланыс арнасы болған www talk пошталық тізімінде ұсынған. Чарльз Стросс Костерді robots.txt ұсынуға итермелегенін айтады, себебі ол нашар жұмыс істейтін веб-тараушыны жазғаннан кейін, ол Костердің серверіне еңсеруге себеп болған. Бастапқыда "RobotsNotWanted.txt" деп аталған стандарт, веб-дамытушыларға қай боттардың олардың веб-сайтына немесе қай беттерге кіруіне болмайтынын көрсетуге мүмкіндік берді. 1994 жылы Интернет барлық боттардың толық тізімін сақтау үшін жеткілікті кішкентай болды; сервердің жүктемесі басты мәселе болып саналды. 1994 жылдың маусым айына қарай ол де-факто стандартқа айналды; WebCrawler, Lycos және AltaVista сияқты іздеу жүйелерінің операторлары да оған сәйкес келді. 2019 жылдың 1 шілдесінде Google Интернет-инженерлік тобының ресми стандарты ретінде Robots Exclusion Protocol ұсынысын жариялады. 2022 жылдың қыркүйегінде RFC 9309 ретінде ұсынылған стандарт жарияланды.
Стандартты
Веб-сайт иесі веб-роботтарға нұсқаулар бергісі келгенде, олар веб-сайттың иерархиясының түбірінде (мысалы, robots.txt) деп аталатын мәтіндік файлды орналастырады. Бұл мәтіндік файлда нұсқаулар белгілі бір форматта (төмендегі мысалдарды қараңыз) болады. Нұсқауларды орындайтын роботтар осы файлды алуға тырысады және веб-сайттан кез келген басқа файлды алудан бұрын нұсқауларды оқиды. Егер бұл файл болмаса, веб-роботтар веб-сайт иесінің бүкіл сайтты сканерлеуге ешқандай шектеулер қоймайтынын болжайды. Robots.txt файлында боттарға қандай веб-беттерге кіруге болатынын және кіре алмайтынын көрсететін нұсқаулар бар. Robots.txt файлдары, әсіресе, Google сияқты іздеу жүйелерінің веб-шолушылары үшін маңызды. Robots.txt файлы веб-сайтта сайтты сканерлеу кезінде көрсетілген роботтардың көрсетілген файлдарды немесе каталогтарды елемеуін сұрау ретінде жұмыс істейді. Бұл, мысалы, іздеу жүйесінің нәтижелерінен құпиялылықты сақтау ниетінен, немесе таңдалған каталогтардың мазмұны сайтты жалпы жіктеу үшін шатастыратын немесе маңызсыз болуы мүмкін деген сенімнен, немесе қосымшаның тек белгілі бір деректермен жұмыс істеуі керек деген тілекпен байланысты болуы мүмкін. Robots.txt тізіміндегі беттерге сілтемелер іздеу нәтижелерінде әлі де пайда болуы мүмкін, егер олар сканерленген беттен сілтемеленген болса. Robots.txt файлы бір бастапқы доменді қамтиды. Бірнеше субдомені бар веб-сайттар үшін әрбір субдоменнің өз robots.txt файлы болуы керек. Егер example.com-да robots.txt файлы болса, бірақ subdomain.example.com-да болмаса, example.com үшін қолданылатын ережелер subdomain.example.com-ға қолданылмайды. Сонымен қатар, әрбір протокол мен портқа өз robots.txt файлы қажет; http://example.com-дағы robots.txt файлы https://example.com-дағы немесе example.com:8080-дағы беттерге қолданылмайды.
Қалыптылық
Робот.txt заңда немесе техникалық протоколдарда міндетті түрде орындалу механизміне ие емес, бірақ бот операторларының көпшілігі оған сәйкес келеді. AOL, Baidu, Bing, DuckDuckGo, Google, Yahoo! және Yandex.
Мұрағат орындары
Кейбір веб-архив жобалары robots.txt файлын елемейді. Архив тобы бұл файлды сайт карталары сияқты қосымша сілтемелерді анықтау үшін пайдаланады. Құрылтайшы Джейсон Скотт: "Бақыланбаған және өз күшіне қалдырылған robots.txt файлы веб-сайттың контекстінен тыс жалпы қолданысқа және мағынаға ие болуы мүмкін мазмұндардың көшірмесін жасауға немесе сілтеме беруге кедергі келтіреді" деді. 2017 жылы Интернет архиві robots.txt директиваларын орындауды тоқтату туралы хабарлады.
Жасанды интеллект
2020 жылдары веб-операторлар генеративтік жасанды интеллект үшін оқу деректерін жинаған боттарға кіруді жобау үшін robots.txt пайдалана бастады. 2023 жылы Originality.AI ең көп талданған мың веб-сайттың 306-сы OpenAI-дың GPTBot-ын өздерінің robots.txt файлында бұғаттағанын, ал 85-і Google-дың Google Extended ботын бұғаттағанын анықтады. Көптеген robots.txt файлдарында GPTBot барлық беттерде тікелей тыйым салынған жалғыз бот ретінде көрсетілген. BBC және The New York Times сияқты жаңалықтар сайттары арасында GPTBot-қа кіруден бас тарту кең таралған. 2023 жылы блог платформасы Medium барлық жасанды интеллект веб-шолушыларына кіруді жобауға ниетті екенін жариялады, себебі «AI компаниялары интернет оқырмандарына спам жіберу үшін жазушылардан құндылықтарды тартып алды». Зардалы веб-роботтар robots.txt ережелерін сақтамайды; кейбіреулері тіпті robots.txt файлын тыйым салынған сілтемелерді табу және тікелей сол сілтемелерге өту үшін нұсқаулық ретінде пайдалануы мүмкін. Бұл кейде қауіпсіздік тәуекелі деп айтылса да, стандарттау органдары осылайша қауіпсіздікті қамтамасыз етуге қарсы. АҚШ-тың Ұлттық Стандарттар және Технология Институты (NIST) бұл практиканы ерекше ескертеді: «Жүйе қауіпсіздігі оның іске асырылуының немесе оның құрамдас бөліктерінің құпиялылығына байланысты болмауы керек». robots.txt файлдарының контекстінде, құпиялылық арқылы қауіпсіздік қауіпсіздік техникасы ретінде ұсынылмайды.
Баламалар
Көптеген роботтар мазмұнды алу кезінде веб-серверге арнайы пайдаланушы агентін жібереді. Веб-администратор серверді роботтардың бірінен келген байланысты анықтаған кезде автоматты түрде сәтсіздік жауабын қайтаруға (немесе баламалы мазмұнды беруге) конфигурациялай алады. Кейбір сайттар, мысалы Google, адамдарға арналған humans.txt файлымен жабдықталған, онда адамдар оқи алатын ақпарат көрсетілген. GitHub сияқты кейбір сайттар humans.txt файлына «Біз туралы» бетіне қайта бағыттайды. Бұрын Google /killer robots.txt мекенжайында «Терминаторға компанияның негізін қалаушылары Ларри Пейдж мен Сергей Бринге зиян келтірмеуді» ескертетін әзілдік файлды орналастырған болатын.
Сайт картасы
Кейбір іздеу роботтары Сайт картасы директивасын қолдайды, бұл роботтар.txt файлында бірнеше Сайт картасын көрсетуге мүмкіндік береді: Сайт картасы: толық URL: Сайт картасы: http://www.example.com/sitemap.xml
Sitemap: http://www. example. com/sitemap. xml
Жалпыға бірдей "*" сәйкестігі
Роботтарды пайдаланудан бас тарту стандартында Disallow: нұсқауында "*" белгісі туралы ештеңе айтылмаған.
Мета-тегтер мен тақырыптар
Тамыр деңгейіндегі robots.txt файлдарынан өзге, роботтарды алып тастау директиваларын роботтар мета-тегтері және X-Robots-Tag HTTP қабатайлары арқылы одан да егжей-тегжейлі деңгейде қолдануға болады. Роботтар мета-тегін HTML емес файлдарға, мысалы, суреттерге, мәтіндік файлдарға немесе PDF құжаттарына қолдануға болмайды. Ал X-Robots-Tag тегін htaccess және httpd.conf файлдарын пайдалану арқылы HTML емес файлдарға қосуға болады.