Введение
Набор веб-страниц, способных нарушить работу веб-сканеров, "ловят" реальных пауков. Пауковая ловушка (или ловушка для сканера) – это набор веб-страниц, которые могут быть преднамеренно или непреднамеренно использованы для того, чтобы заставить веб-сканер или поискового бота отправлять бесконечное количество запросов или вызвать сбой в работе плохо спроектированного сканера. Веб-сканеры также называют веб-пауками, от которых и произошло название. Пауковые ловушки могут создаваться для "поимки" спам-ботов или других сканеров, расходующих пропускную способность веб-сайта. Они также могут быть созданы непреднамеренно, например, календарями, использующими динамические страницы со ссылками, постоянно указывающими на следующий день или год. Распространенные методы включают: создание бесконечно глубоких древовидных структур, таких как http://example.com/bar/foo/bar/foo/bar/foo/bar/; динамические страницы, генерирующие неограниченное количество документов для обхода веб-сканером. Примеры включают календари и алгоритмически сгенерированную поэзию. Документы, заполненные большим количеством символов, приводящие к сбою лексического анализатора при разборе документа. Документы с идентификаторами сеансов, основанные на необходимых cookie-файлах. Не существует алгоритма, способного обнаружить все пауковые ловушки. Некоторые типы ловушек можно обнаружить автоматически, но новые, неизвестные ловушки появляются быстро.
trapping real spiders
A spider trap (or crawler trap) is a set of web pages that may intentionally or unintentionally be used to cause a web crawler or search bot to make an infinite number of requests or cause a poorly constructed crawler to crash. Web crawlers are also called web spiders, from which the name is derived. Spider traps may be created to "catch" spambots or other crawlers that waste a website's bandwidth. They may also be created unintentionally by calendars that use dynamic pages with links that continually point to the next day or year. Common techniques used are:
creation of indefinitely deep directory structures like http://example. com/bar/foo/bar/foo/bar/foo/bar/
Dynamic pages that produce an unbounded number of documents for a web crawler to follow. Examples include calendars and algorithmically generated language poetry. documents filled with many characters, crashing the lexical analyzer parsing the document. documents with session id's based on required cookies. There is no algorithm to detect all spider traps. Some classes of traps can be detected automatically, but new, unrecognized traps arise quickly.
Вежливость
Ловушка для паука заставляет веб-сканер входить в нечто вроде бесконечного цикла, что расходует ресурсы сканера, снижает его производительность, а в случае плохо написанного сканера может привести к аварийному завершению программы. Вежливые сканеры чередуют запросы между разными хостами и не запрашивают документы с одного и того же сервера чаще одного раза в несколько секунд, что означает, что "вежливый" веб-сканер пострадает значительно меньше, чем "невежливый". Кроме того, сайты с ловушками для пауков обычно содержат файл robots.txt, запрещающий ботам посещать эти ловушки, поэтому легитимный "вежливый" бот не попадет в ловушку, в то время как "невежливый" бот, игнорирующий настройки robots.txt, будет затронут ловушкой.