Введение
Распределенный метод вычислений. Распределенное веб-сканирование — это метод распределенных вычислений, используемый интернет-поисковыми системами для индексации Интернета посредством веб-сканирования, при котором задействуется множество компьютеров. Такие системы могут предоставлять пользователям возможность добровольно предоставлять свои вычислительные ресурсы и пропускную способность для сканирования веб-страниц. Распределяя нагрузку между множеством компьютеров, удается избежать затрат на содержание крупных вычислительных кластеров.
Distributed web crawling is a distributed computing technique whereby Internet search engines employ many computers to index the Internet via web crawling. Such systems may allow for users to voluntarily offer their own computing and bandwidth resources towards crawling web pages. By spreading the load of these tasks across many computers, costs that would otherwise be spent on maintaining large computing clusters are avoided.
Статическое назначение
При таком типе политики с самого начала обхода существует фиксированное правило, определяющее, как новые URL-адреса назначаются сканерам. Для статического назначения можно использовать хеш-функцию для преобразования URL-адресов (или, что еще лучше, полных доменных имен) в число, соответствующее индексу соответствующего процесса обхода. Поскольку существуют внешние ссылки, ведущие с веб-сайта, назначенного одному процессу обхода, на веб-сайт, назначенный другому процессу обхода, необходим обмен URL-адресами. Чтобы снизить накладные расходы, связанные с обменом URL-адресами между процессами обхода, обмен следует осуществлять пакетами, несколькими URL-адресами за раз, а наиболее часто цитируемые URL-адреса в коллекции должны быть известны всем процессам обхода до начала обхода (например, на основе данных из предыдущего обхода).
Реализация
С 2003 года большинство современных коммерческих поисковых систем используют эту технику. Google и Yahoo используют тысячи отдельных компьютеров для обхода веб-сайтов. Новые проекты стремятся использовать менее структурированную, более спонтанную форму сотрудничества, привлекая добровольцев к участию в работе, зачастую используя домашние или личные компьютеры. LookSmart – крупнейшая поисковая система, использующая эту технику, которая лежит в основе её проекта распределенного веб-сканирования Grub. Wikia (ныне известная как Fandom) приобрела Grub у LookSmart в 2007 году. Данное решение использует компьютеры, подключенные к Интернету, для обхода интернет-адресов в фоновом режиме. После загрузки просканированных веб-страниц они сжимаются и отправляются обратно вместе с индикатором статуса (например, измененная, новая, недоступная, перенаправленная) на мощные центральные серверы. Серверы, управляющие большой базой данных, отправляют клиентам новые URL-адреса для проверки.
Недостатки
Согласно FAQ о Nutch, сайте поисковой системы с открытым исходным кодом, экономия пропускной способности при распределённом веб-сканировании несущественна, поскольку "успешной поисковой системе требуется больше пропускной способности для загрузки страниц с результатами поиска, чем её сканеру для загрузки страниц".