Кіріспе

Дүниежүзілік желіні жүйелі түрде аралайтын бағдарламалық қамтамасыз ету

Веб-тараушы, кейде «жәндік» немесе «жәндік-бот» деп аталады және көбінесе «тараушы» деп қысқартылады, – бұл Дүниежүзілік желіні жүйелі түрде аралайтын және әдетте веб-индекстеу (веб-тарау) мақсатында іздеу жүйелері қолдайтын интернет-бот. Веб-іздеу жүйелері және кейбір басқа веб-сайттар өздерінің веб-мазмұнын немесе басқа сайттардың веб-мазмұнының индекстерін жаңарту үшін веб-тарау немесе жәндіктер бағдарламалық жасақтамасын пайдаланады. Веб-тараушылар іздеу жүйесі үшін беттерді көшіреді, ол жүктелген беттерді индекстейді, соның арқасында пайдаланушылар тиімдірек іздеуге мүмкіндік алады. Тараушылар кірген жүйелердегі ресурстарды пайдаланады және көбінесе сайттарға рұхсатсыз кіреді. Үлкен көлемдегі беттерге қол жеткізген кезде кесте, жүктеме және «әдептілік» мәселелері туындайды. Тараудан өткізілмейтін сайттар үшін, олар туралы тарау агентіне хабарлауға арналған механизмдер бар. Мысалы, robots.txt файлы боттардан веб-сайттың тек белгілі бір бөліктерін немесе ештеңе де индекстемеуді сұрауы мүмкін. Интернет-беттердің саны өте көп, тіпті ең ірі тараушылар да толық индекс құра алмайды. Осы себепті, 2000 жылға дейін Дүниежүзілік желінің алғашқы жылдарында іздеу жүйелері тиісті іздеу нәтижелерін беруге күресті. Бүгінде тиісті нәтижелер дерлік бірден беріледі. Тараушылар гиперсілтемелерді және HTML кодын тексеруге қабілетті. Оларды веб-скрепинг және деректерге негізделген бағдарламалау үшін де пайдалануға болады.

Номенклатура

Веб-қарауылшыны сонымен қатар өрмекші, құмырсқа, автоматты индекстеуші немесе (FOAF бағдарламалық жасақтамасы контекстінде) Веб-сүріп жүргіш деп те атайды.

Шолу

Веб-шолушы URL-дер тізімімен басталады. Алғашқы URL-дер «тұқым» деп аталады. Шолушы осы URL-дерге кіргенде, осы URL-дерге жауап беретін веб-серверлермен байланыс жасайды, алынған веб-беттердегі барлық гиперсілтемелерді анықтайды және оларды шолу шебі (crawl frontier) деп аталатын келесі қарауға тиіс URL-дер тізіміне қосады. Шебіден URL-дер белгілі бір саясаттар бойынша рекурсивті түрде қарастырылады. Егер шолушы веб-сайттарды (немесе веб-архивті) архивтеуді жүзеге асырса, ол ақпаратты көшіріп, сақтайды. Архивтер әдетте оларды тікелей желідегідей көруге, оқуға және шарлауға болатындай етіп сақталады, бірақ «түсірілімдер» ретінде сақталады. Архив «қойма» деп аталады және веб-беттер жинағын сақтауға және басқаруға арналған. Қойма тек HTML беттерін сақтайды және бұл беттер жеке файлдар ретінде сақталады. Қойма деректерді сақтайтын кез келген басқа жүйеге ұқсас, мысалы, қазіргі заманғы деректер базасы сияқты. Бір ғана айырмашылық – қоймаға деректер базасы жүйесі ұсынатын барлық функционалдық қажет емес. Қойма шолушы алған веб-беттің ең соңғы нұсқасын сақтайды. Көлемінің үлкендігі шолушының белгілі бір уақыт ішінде веб-беттердің шектеулі санын жүктей алатынын білдіреді, сондықтан ол жүктемелерін басымдыққа қоюы керек. Өзгерістердің жоғары қарқыны беттердің бұрын жаңартылып, тіпті жойылғанын білдіруі мүмкін. Серверлік бағдарламалық құралдармен жасалған мүмкін URL-дердің саны веб-шолушыларға қайталанған мазмұнды алудан аулақ болуды қиындатты. HTTP GET (URL-негізделген) параметрлерінің шексіз комбинациялары бар, олардың тек шағын бөлігі ғана бірегей мазмұнды қайтарады. Мысалы, қарапайым онлайн фотогалерея пайдаланушыларға URL-дегі HTTP GET параметрлері арқылы ұсынылған үш опцияны ұсынуы мүмкін. Егер суреттерді сұрыптаудың төрт тәсілі, миниатюраның үш мөлшері, екі файл форматы және пайдаланушы ұсынған мазмұнды өшіру опциясы болса, онда мазмұнның бір жиынтығына 48 түрлі URL арқылы қол жеткізуге болады, олардың барлығы сайтта сілтемеленген болуы мүмкін. Бұл математикалық комбинация шолушылар үшін мәселе тудырады, өйткені олар бірегей мазмұнды алу үшін салыстырмалы түрде шағын скрипттік өзгерістердің шексіз комбинацияларын сұрыптап өтуі керек. Эдвардс және авторлар атап көрсеткендей, «креондарды іздеу үшін өткізу қабілетінің шексіз емес және тегін емес екенін ескере отырып, сапа мен жаңалықты сақтау үшін веб-шолушылардың тек масштабты ғана емес, тиімді де болуы қажет». Шолушы әр қадамда келесі қай беттерді қарау керектігін мұқият таңдауы керек.

Іріктеу саясаты

Интернеттің қазіргі көлемін ескере отырып, тіпті ірі іздеу жүйелері де көпшілікке қолжетімді бөлігінің бір бөлігін ғана қамтиды. 2009 жылғы зерттеуде тіпті ірі масштабтағы іздеу жүйелері индекстелетін Вебтің 40–70% -дан аспайтынын көрсетті; Стив Лоренс пен Ли Джайлстың бұрынғы зерттеулері 1999 жылы бірде-бір іздеу жүйесі Вебтің 16% -дан астамын индекстемегенін көрсетті. Сканер әрқашан веб-беттердің тек бір бөлігін жүктейді, сондықтан жүктелген бөлікте вебтің кездейсоқ үлгісі ғана емес, ең маңызды беттері болуы өте қажет. Бұл веб-беттерді басымдықпен өңдеу үшін маңыздылық өлшемін қажет етеді. Беттің маңыздылығы оның ішкі сапасының, сілтемелер немесе келулер тұрғысынан танымалдылығының және тіпті URL-інің (соңғысы бір ғана жоғары деңгейдегі доменге немесе белгілі бір веб-сайтқа шектелген тік іздеу жүйелеріне қатысты) функциясы болып табылады. Жақсы іріктеу саясатын жасаудың қосымша қиындығы бар: ол толық емес ақпаратпен жұмыс істеуі керек, өйткені веб-беттердің толық жиынтығы сканерлеу кезінде белгілі емес. Чжунху Чо және авторлар тобы сканерлеу кестесіне арналған саясаттарды зерттеу бойынша алғашқы зерттеуді жүргізді. Олардың деректер жиынтығы Стэнфордтан алынған 180 000 беттен тұрды. edu домені, онда әртүрлі стратегиялармен сканерлеу симуляциясы жасалды. Сыналған реттеу өлшемдері: енінен бірінші, кері сілтемелер саны және ішінара PageRank есептеулері. Бір қорытынды бойынша, егер сканер сканерлеу процесінің басында жоғары PageRank-і бар беттерді жүктегісі келсе, ішінара PageRank стратегиясы жақсырақ, одан кейін енінен бірінші және кері сілтемелер саны келеді. Алайда, бұл нәтижелер тек бір доменге қатысты. Чо сонымен қатар Стенфордта веб-сканерлеу туралы докторлық диссертациясын жазды. Найорк және Винер 328 миллион беттен нақты сканерлеуді енінен бірінші ретпен жүргізді. Олар енінен бірінші сканерлеудің жоғары PageRank-і бар беттерді сканерлеудің басында қамтитынын анықтады (бірақ олар бұл стратегияны басқа стратегиялармен салыстырмады). Авторлар бұл нәтижеге берген түсіндірмесі: «Ең маңызды беттерде көптеген хосттардан көптеген сілтемелер бар, және бұл сілтемелер қай хосттан немесе қай беттен басталғанына қарамастан, ертерек табылады». Абитебул OPIC (On line Page Importance Computation) деп аталатын алгоритмге негізделген сканерлеу стратегиясын жасады. OPIC-те әр бетке бастапқы «ақша» сомасы беріледі, ол сілтеме берген беттер арасында тең бөлінеді. Бұл PageRank есептеуіне ұқсас, бірақ ол жылдамырақ және тек бір қадамда жасалады. OPIC-пен басқарылатын сканер алдымен сканерлеу шебіндегі жоғары «ақша» сомасы бар беттерді жүктейді. Эксперименттер 100 000 беттен тұратын синтетикалық графта жүргізілді, онда кіріс сілтемелерінің қуат заңы таралуы байқалды. Алайда, басқа стратегиялармен салыстыру да, нақты Вебте тәжірибелер де болған жоқ. Болди және авторлар тобы 40 миллион беттен тұратын it доменінен және 100 миллион беттен тұратын WebBase сканерінен алынған Вебтің ішкі жиынтықтарында симуляция жасады, енінен бірінші және тереңдікке қарсы, кездейсоқ реттеу және барлық білетін стратегияны сынады. Салыстыру PageRank-тің ішінара сканерлеуде қаншалықты жақсы есептелгендігіне негізделді. PageRank-ті өте тез жинақтайтын кейбір сапарлар (әсіресе, енінен бірінші және барлық білетін сапарлар) өте нашар прогрестік жуықтамалар береді. Бейза Ятес және авторлар gr және cl домендерінен алынған 3 миллион беттен тұратын Вебтің екі ішкі жиынтығында симуляция жасады, бірнеше сканерлеу стратегияларын сынады. Олар OPIC стратегиясының және әр сайтқа кезек ұзындығын пайдаланатын стратегияның енінен бірінші сканерлеуден жақсы екенін және бұрынғы сканерлеуді пайдаланудың, ол қолжетімді болған кезде, ағымдағы сканерлеуді басқару үшін өте тиімді екенін көрсетті. Данешпажоу және авторлар жақсы тұқымдарды табуға арналған қауымдастыққа негізделген алгоритм жасады. Олардың әдісі кездейсоқ тұқымдардан басталатын сканерлеумен салыстырғанда, әртүрлі қауымдастықтардан жоғары PageRank-і бар веб-беттерді аз итерацияда сканерлейді. Осы жаңа әдісті пайдаланып, бұрын сканерленген Веб графынан жақсы тұқымдарды алуға болады. Осы тұқымдарды пайдаланып, жаңа сканерлеу өте тиімді болуы мүмкін.

Келесі сілтемелерді шектеу

Crawler тек HTML беттерді іздеп, басқа MIME түрлерінен қашуы мүмкін. Тек HTML ресурстарын сұрау үшін, crawler GET сұранысымен толық ресурсты сұраудан бұрын веб-ресурстың MIME түрін анықтау үшін HTTP HEAD сұранысын жасай алады. Көптеген HEAD сұраныстарын жасаудан аулақ болу үшін, crawler URL-ді қарап, URL html, htm, asp, aspx, php, jsp, jspx немесе косақшамен аяқталса ғана ресурсты сұрауы мүмкін. Бұл стратегия көптеген HTML веб-ресурстарының қателікпен өткіріліп кетуіне әкелуі мүмкін. Кейбір crawler-лар "?" таңбасы бар ресурстарды сұраудан да қашуы мүмкін (динамикалық түрде жасалғандықтан), crawler веб-сайттан шексіз URL-дерді жүктеуге алып келетін құпия тұзақтардан сақтану үшін. Егер сайт URL-ді жеңілдету үшін URL-ді қайта жазуды қолданса, бұл стратегия сенімсіз болады.

URL-ді қалыпқа келтіру

Crawlers әдетте бір ресурсты бірнеше рет сканерлеуден аулақ болу үшін URL-ді нормалаудың кейбір түрлерін орындайды. URL-ді нормалау, сондай-ақ URL-ді канонияландыру деп аталатын бұл термин, URL-ді біркелкі түрде өзгерту және стандарттау процесін білдіреді. Нормалаудың түрлеріне URL-ді кіші әріптерге аудару, "." және " " сегменттерін жою, сондай-ақ бос емес жол бөлігіне соңғы қисық сызықтарды қосу кіруі мүмкін.

Жолға көтерілу

Кейбір сканерлер белгілі бір веб-сайттан мүмкіндігінше көп ресурстарды жүктеуге/қоюға тырысады. Сондықтан, URL-дегі әрбір жолға көтерілетін, жоғарлап іздейтін сканер (crawler) енгізілді. Мысалы, http://llama.org/hamster/monkey/page.html бастапқы URL берілгенде, ол /hamster/monkey/, /hamster/ және / жолдарын іздеуге тырысады. Коти жолға көтерілетін сканердің оқшауланған ресурстарды немесе әдеттегі сканерлеу кезінде кіріс сілтемесі табылмайтын ресурстарды табуда өте тиімді екенін анықтады.

Тоқтатылған жыртылу

Сканер үшін беттің маңыздылығы, сондай-ақ, беттің белгілі бір сұранысқа қаншалықты ұқсас екендігі арқылы да көрсетілуі мүмкін. Бір-біріне ұқсас беттерді жүктеуге тырысатын веб-сканерлер фокустық немесе тақырыптық сканерлер деп аталады. Тақырыптық және фокустық сканерлеу концепцияларын алғаш рет Филиппо Менцер және Соумен Чакрабарти және т.б. енгізген. Фокустық сканерлеудегі басты мәселе – веб-сканер контекстінде, бетті жүктемес бұрын берілген беттің мәтінінің сұранысқа қаншалықты ұқсас екенін болжау қабілетіне ие болуымыз керек. Мүмкін болатын болжаушы – сілтемелердің мәтіні; осы тәсілді Пинкертон вебтің алғашқы күндеріндегі алғашқы веб-сканерінде қолданған. Дилигенти және т.б. жүргізілген сұраныс пен әлі қарастырылмаған беттер арасындағы ұқсастықты анықтау үшін, бұрын қарастырылған беттердің толық мазмұнын пайдалануды ұсынады. Фокустық сканерлеудің тиімділігі көбінесе ізделіп отырған нақты тақырыптағы сілтемелердің көптігіне байланысты, ал фокустық сканерлеу әдетте бастапқы нүктелерді ұсыну үшін жалпы веб-іздеу жүйесіне сенеді.

Академиялық бағыттағы жұлқылаушы

Фокустатқан сканерлердің мысалы – академиялық сканерлер, олар ақысыз қолжетімді академиялық құжаттарды сканерлейді, мысалы, CiteSeerX іздеу жүйесінің сканері citeseerxbot сияқты. Басқа академиялық іздеу жүйелері: Google Scholar және Microsoft Academic Search және т.б. Академиялық мақалалардың көпшілігі PDF форматында жарияланғандықтан, мұндай сканерлер PDF, PostScript файлдарын, Microsoft Word-ты, соның ішінде олардың zip форматтарын сканерлеуге ерекше қызығушылық танытады. Осы себепті, Heritrix сияқты жалпы ашық кодты сканерлерді басқа MIME түрлерін сүзуге бейімдеу керек немесе осы құжаттарды бөліп алып, шоғырланған сканерлеу дерекқоры мен репозиторийіне импорттау үшін делдалдық бағдарлама қолданылады. Бұл құжаттардың академиялық мақалалар екенін немесе емес екенін анықтау қиын, және бұл сканерлеу процесіне қосымша жүктеме салса, сондықтан бұл машиналық оқыту немесе реттегіш өрнектер алгоритмдерін қолдана отырып, сканерлеуден кейін жүргізіледі. Бұл академиялық құжаттар әдетте факультеттер мен студенттердің жеке беттерінен немесе ғылыми-зерттеу институттарының жарияланымдар беттерінен алынады. Академиялық құжаттар барлық веб-беттердің шағын бөлігін құрайтындықтан, осы веб-сканерлердің тиімділігін арттыру үшін дұрыс бастапқы мәліметтерді таңдау маңызды. Басқа академиялық сканерлер академиялық мақалалардың метадеректерін қамтитын, мысалы, тақырыптар, мақалалар және аннотацияларды қамтитын қарапайым мәтін және HTML файлдарын жүктей алады. Бұл жалпы мақалалардың санын арттырады, бірақ олардың көп бөлігі ақысыз PDF нұсқаларын ұсынбауы мүмкін.

Семантикалық бағытталған жұлдызша

Фокус етілген сканерлердің тағы бір түрі – семантикалық фокус етілген сканер, ол домендік онтологияларды тақырыптық карталарды көрсету үшін пайдаланады және веб-беттерді таңдау және жіктеу мақсатында тиісті онтологиялық ұғымдармен байланыстырады. Бұған қоса, онтологияларды сканерлеу процесінде автоматты түрде жаңарту мүмкіндігі бар. Донг және авторлар веб-беттерді сканерлеу кезінде онтологиялық ұғымдардың мазмұнын жаңарту үшін қолдау векторлы машинасын қолдана отырып, мұндай онтологиялық оқытуға негізделген сканерді ұсынды.

Параллельділік саясаты

Параллельді шолушы – бірнеше процестерді қатарластырып іске қосатын шолушы. Мақсаты – параллельдіктан туындайтын қосымша шығындарды ең азайту арқылы жүктеу жылдамдығын максималды деңгейге жеткізу, сондай-ақ бір бетті қайта-қайта жүктеудің алдын алу. Бір бетті бірнеше рет жүктеуден сақтану үшін шолу жүйесіне шолу процесінде жаңа табылған URL-дерді үлестіру саясаты қажет, себебі бірдей URL-ді екі түрлі шолу процесі анықтай алады.

Қауіпсіздік

Веб-сайт иелерінің көпшілігі өздерінің беттерін іздеу жүйелерінде мүмкіндігінше кеңінен индекстеуге ұмтылады, бірақ веб-шолудың да күтпеген салдары болуы мүмкін. Егер іздеу жүйесі жалпыға қолжетімді болмауы тиіс ресурстарды немесе бағдарламалық қамтамасының осал нұсқаларын көрсететін беттерді индекстесе, бұл қауіпсіздіктің бұзылуына немесе деректердің ұрлануына әкелуі мүмкін. Веб-қосымшалардың стандартты қауіпсіздік ұсынымдарынан басқа, веб-сайт иелері іздеу жүйелеріне өз веб-сайттарының тек қоғамдық бөліктерін ғана индекстеуге рұқсат беру арқылы (robots.txt арқылы) және транзакциялық бөліктерді (кіру беттері, жеке беттер және т.б.) индекстеуден нақты түрде тоқтату арқылы шабуылға ұшырау мүмкіндігін азайта алады.

Жүгірушілерді анықтау

Веб-тараушылар әдетте HTTP сұранысының «Пайдаланушы агенті» өрісін пайдаланып веб-серверге өздерін таныстырады. Веб-сайт әкімшілері көбінесе веб-серверлердің журналын қарап, «пайдаланушы агенті» өрісі арқылы қандай тараушылар веб-серверді қанша рет барлағандарын анықтайды. «Пайдаланушы агенті» өрісінде веб-сайт әкімшісі тараушы туралы толыққанды ақпарат ала алатын URL мекенжайы болуы мүмкін. Веб-сервер журналын қарау – еңбекке толы жұмыс, сондықтан кейбір әкімшілер веб-тараушыларды анықтау, қадағалау және тексеру үшін арнайы құралдарды қолданады. Спам-боттар және басқа да қауіпті веб-тараушылар «пайдаланушы агенті» өрісіне өздерін анықтайтын ақпаратты енгізбеуі мүмкін, немесе өздерін браузер немесе басқа танымал тараушы ретінде жасыруы мүмкін. Веб-сайт әкімшілері веб-тараушылардың өздерін танытуын қалайды, себебі қажет болған жағдайда олардың иесімен байланысуға мүмкіндік алады. Кейбір жағдайларда тараушылар қателікпен тараушы тұзағына түсіп кетуі немесе веб-серверді көптеген сұраулармен жүктеуі мүмкін, сондықтан иесі тараушыны тоқтатуы қажет. Танысу, сондай-ақ веб-беттерді нақты іздеу жүйесімен қашан индекстеуге болатынын білгісі келетін әкімшілер үшін де пайдалы.

Терең желіні аралау

Веб-беттердің көп бөлігі терең немесе көрінбейтін желіде орналасқан. Бұл беттерге әдетте дерекқорға сұраныс жіберу арқылы ғана қол жеткізіледі, ал егер оларға сілтемелер болмаса, кәдімгі шолушылар (краулерлер) оларды таба алмайды. Google Sitemaps протоколы және mod oai осы терең желі ресурстарын табуға мүмкіндік береді. Терең желіні шолу (краулинг) шолуға болатын веб-сілтемелердің санын да арттырады. Кейбір шолушылар тек <a href="URL"> түріндегі URL-дерді ғана қабылдайды. Кейбір жағдайларда, мысалы Googlebot, веб-шолу гипермәтіндік мазмұндағы, тагтардағы немесе мәтіндегі барлық мәтін бойынша жүргізіледі. Терең желі контентін іздеу үшін стратегиялық тәсілдер қолданылуы мүмкін. Экранды сыпыру (screen scraping) деп аталатын техникамен арнайы бағдарламалық жасақтаманы автоматты түрде және қайталап берілген веб-формаға сұраныс жіберуге бейімдеуге болады, мақсаты – алынған деректерді жинақтау. Мұндай бағдарламалық жасақтаманы бірнеше веб-сайттардағы бірнеше веб-формаларды қамту үшін пайдалануға болады. Бір веб-форманы тапсыру нәтижесінен алынған деректерді екінші веб-формаға енгізу ретінде қолдануға болады, осылайша дәстүрлі веб-краулерлерге мүмкін емес жолмен терең желіде байланыстылықты қамтамасыз етуге болады. AJAX технологиясымен құрылған беттер веб-шолушылар үшін қиындық тудыратындығын көрсетеді. Google өз шолушысының тани алатын және индекстей алатын AJAX шақыруларының форматын ұсынды.

Көрнекі және бағдарламалық сканерлер

Интернетте пайдаланушылардың талаптарына сәйкес беттерді сканерлеп, деректерді бағандар мен жолдарға құрылымдайтын бірнеше "визуалды веб-скрепер/сканер" өнімдері бар. Классикалық және визуалды сканердің арасындағы басты айырмашылық – сканерді құру үшін қажетті бағдарламалау білімінің деңгейі. "Визуалды скреперлердің" соңғы буыны веб-деректерді жинау үшін бағдарламалауды бастауға қажетті бағдарламалау дағдыларының көп бөлігін жояды. Визуалды скрепинг/сканерлеу әдісі пайдаланушының сканерлеу технологиясының бөлігін "оқытуына" негізделеді, содан кейін жартылай құрылымдалған деректер көздеріндегі үлгілерді қадағалайды. Визуалды сканерді оқытудың басты әдісі – браузерде деректерді бөліп көрсету және бағандар мен жолдарды оқыту. Технология жаңа болмаса да, мысалы, Google компаниясы Needlebase-ті сатып алған (ITA Labs-тің толық сатып алуының бір бөлігі ретінде), инвесторлар мен соңғы пайдаланушылар осы саладағы өсім мен инвестицияларды жалғастыруда.

Тарихи веб-караулер

World Wide Web Worm – құжат тақырыптары мен URL мекенжайларының қарапайым тізімін жасауға қолданылған іздеу роботы. Тізімді grep Unix командасын қолдану арқылы іздеуге болады. Yahoo! Slurp – Yahoo! іздеу роботының аты, Yahoo! Microsoft компаниясымен келісімшарт жасасып, Bingbot-ты пайдалануға көшкенге дейін.

Ішкі веб-караулер

Applebot — Apple компаниясының веб-шолушысы. Ол Siri және басқа да өнімдерді қолдайды. Bingbot — Microsoft компаниясының Bing веб-шолушысының атауы. Ол Msnbot-ты алмастырды. Baiduspider — Baidu-дың веб-шолушысы. DuckDuckBot — DuckDuckGo веб-шолушысы. Googlebot кейбір егжей-тегжейлі сипатталған, бірақ сілтеме оның архитектурасының C++ және Python тілдерінде жазылған ерте нұсқасы туралы ғана. Шолушы индекстеу процесімен біріктірілді, себебі мәтінді талдау толық мәтіндік индекстеу үшін, сондай-ақ URL-ді алу үшін жасалды. URL сервері бар, ол бірнеше шолу процестері арқылы алынатын URL-дер тізімін жібереді. Талдау кезінде табылған URL-дер URL серверіне жіберіледі, ол URL-дің бұрын көрілген-көрмегенін тексереді. Егер көрілмеген болса, URL URL серверінің кезегіне қосылады. WebCrawler вебтің кіші бөлігінің алғашқы ашық толық мәтіндік индексін құру үшін пайдаланылды. Ол веб-беттерді жүктеу үшін lib WWW және веб-графты кеңінен зерттеу үшін URL-ді талдау және реттеу үшін тағы бір бағдарламаға негізделген. Сондай-ақ, ол якорь мәтінінің берілген сұраныспен ұқсастығына негізделген сілтемелерді іздейтін нақты уақыттық шолуды қамтыды. WebFountain — Mercator-ға ұқсас, бірақ C++ тілінде жазылған, таралған модульдік шолушы. Xenon — мемлекеттік салық органдарының алаяқтықты анықтау үшін пайдаланатын веб-шолушысы.