Введение
Googlebot — это веб-сканер, используемый Google для сбора информации с веб-страниц и создания поискового индекса для поисковой системы Google. Фактически, это название применяется к двум разным типам веб-сканеров: сканеру для настольных компьютеров (имитирующему пользователей настольных устройств) и сканеру для мобильных устройств (имитирующему пользователей мобильных устройств).
Googlebot is the web crawler software used by Google that collects documents from the web to build a searchable index for the Google Search engine. This name is actually used to refer to two different types of web crawlers: a desktop crawler (to simulate desktop users) and a mobile crawler (to simulate a mobile user).
Поведение
Веб-сайт, вероятно, будет сканироваться как Googlebot Desktop, так и Googlebot Mobile. Однако, начиная с сентября 2020 года, все сайты были переведены на мобильную первую индексацию, что означает, что Google сканирует веб-страницы с помощью Googlebot, работающего на смартфоне. Подтип Googlebot можно определить, посмотрев на строку пользовательского агента в запросе. Однако оба типа сканеров подчиняются одному и тому же токену продукта (токену useent) в файле robots.txt, поэтому разработчик не может выборочно нацеливать либо Googlebot Mobile, либо Googlebot Desktop с помощью robots.txt. Google предоставляет различные методы, позволяющие владельцам веб-сайтов управлять контентом, отображаемым в результатах поиска Google. Если веб-мастер решит ограничить доступ к информации на своем сайте для Googlebot или другого сканера, он может сделать это с помощью соответствующих директив в файле robots.txt или путем добавления мета-тега <meta name="Googlebot" content="nofollow" /> на веб-страницу. Запросы Googlebot к веб-серверам идентифицируются по строке пользовательского агента, содержащей "Googlebot", и адресу хоста, содержащему "googlebot.com". В настоящее время Googlebot следует по ссылкам HREF и SRC. Существует множество теорий относительно того, насколько продвинута способность Googlebot обрабатывать JavaScript, мнения варьируются от минимальной способности, основанной на пользовательских интерпретаторах. В настоящее время Googlebot использует веб-сервис рендеринга (WRS), основанный на движке рендеринга Chromium (версия 74 по состоянию на 7 мая 2019 года). Googlebot обнаруживает страницы, собирая все ссылки на каждой странице, которую он может найти. Если это не запрещено тегом nofollow, он затем переходит по этим ссылкам на другие веб-страницы. Новые веб-страницы должны быть связаны с другими известными страницами в Интернете, чтобы быть просканированными и проиндексированными, или отправлены веб-мастером вручную. Проблема, которую часто отмечают веб-мастера с планами веб-хостинга с низкой пропускной способностью, заключается в том, что Googlebot потребляет огромное количество пропускной способности. Это может привести к превышению лимита пропускной способности веб-сайтом и его временному отключению. Это особенно проблематично для зеркальных сайтов, которые размещают много гигабайт данных. Google предоставляет "Search Console", которая позволяет владельцам веб-сайтов регулировать скорость сканирования. Как часто Googlebot будет сканировать сайт, зависит от бюджета сканирования. Бюджет сканирования – это оценка того, как часто обычно обновляется веб-сайт. Технически, команда разработчиков Googlebot (команда по сканированию и индексации) использует несколько определенных терминов внутри для обозначения того, что подразумевается под "бюджетом сканирования". С мая 2019 года Googlebot использует новейший движок рендеринга Chromium, который поддерживает функции ECMAScript 6. Это сделает бота более "вечнозеленым" и гарантирует, что он не будет полагаться на устаревший движок рендеринга по сравнению с возможностями браузеров. Если контент находится за логином, сканеру можно предоставить учетные данные для входа, чтобы он мог сканировать защищенный контент.
Проверка инструмента Crawlers
InspectionTool — это сканер, используемый инструментами тестирования поиска, такими как тест расширенных сниппетов и проверка URL в Google Search Console. Помимо User-Agent и токена User-Agent, он имитирует Googlebot. Независимо опубликовано руководство по сканерам. В нем подробно описаны четыре (4) различных агента сканеров, основанных на данных индекса каталогов веб-серверов: один (1) не использующий Chrome и три (3) использующих Chrome.