Введение

Распределенный метод вычислений. Распределенное веб-сканирование — это метод распределенных вычислений, используемый интернет-поисковыми системами для индексации Интернета посредством веб-сканирования, при котором задействуется множество компьютеров. Такие системы могут предоставлять пользователям возможность добровольно предоставлять свои вычислительные ресурсы и пропускную способность для сканирования веб-страниц. Распределяя нагрузку между множеством компьютеров, удается избежать затрат на содержание крупных вычислительных кластеров.

Статическое назначение

При таком типе политики с самого начала обхода существует фиксированное правило, определяющее, как новые URL-адреса назначаются сканерам. Для статического назначения можно использовать хеш-функцию для преобразования URL-адресов (или, что еще лучше, полных доменных имен) в число, соответствующее индексу соответствующего процесса обхода. Поскольку существуют внешние ссылки, ведущие с веб-сайта, назначенного одному процессу обхода, на веб-сайт, назначенный другому процессу обхода, необходим обмен URL-адресами. Чтобы снизить накладные расходы, связанные с обменом URL-адресами между процессами обхода, обмен следует осуществлять пакетами, несколькими URL-адресами за раз, а наиболее часто цитируемые URL-адреса в коллекции должны быть известны всем процессам обхода до начала обхода (например, на основе данных из предыдущего обхода).

Реализация

С 2003 года большинство современных коммерческих поисковых систем используют эту технику. Google и Yahoo используют тысячи отдельных компьютеров для обхода веб-сайтов. Новые проекты стремятся использовать менее структурированную, более спонтанную форму сотрудничества, привлекая добровольцев к участию в работе, зачастую используя домашние или личные компьютеры. LookSmart – крупнейшая поисковая система, использующая эту технику, которая лежит в основе её проекта распределенного веб-сканирования Grub. Wikia (ныне известная как Fandom) приобрела Grub у LookSmart в 2007 году. Данное решение использует компьютеры, подключенные к Интернету, для обхода интернет-адресов в фоновом режиме. После загрузки просканированных веб-страниц они сжимаются и отправляются обратно вместе с индикатором статуса (например, измененная, новая, недоступная, перенаправленная) на мощные центральные серверы. Серверы, управляющие большой базой данных, отправляют клиентам новые URL-адреса для проверки.

Недостатки

Согласно FAQ о Nutch, сайте поисковой системы с открытым исходным кодом, экономия пропускной способности при распределённом веб-сканировании несущественна, поскольку "успешной поисковой системе требуется больше пропускной способности для загрузки страниц с результатами поиска, чем её сканеру для загрузки страниц".