Введение

Программная система для поиска релевантной информации в Интернете, осуществляющая поиск в сети World Wide Web.

Поисковая система – это программная система, которая предоставляет гиперссылки на веб-страницы и другую релевантную информацию в Интернете в ответ на запрос пользователя. Пользователь вводит запрос в веб-браузере или мобильном приложении, и результаты поиска обычно представляют собой список гиперссылок, сопровождаемый текстовыми выдержками и изображениями. Пользователи также могут ограничить поиск определенным типом результатов, например, изображениями, видео или новостями. Для поставщика поисковых услуг его система является частью распределенной вычислительной системы, которая может включать множество центров обработки данных по всему миру. Скорость и точность ответа поисковой системы на запрос основаны на сложной системе индексирования, которая постоянно обновляется автоматическими веб-сканерами (пауками). Это может включать в себя извлечение данных из файлов и баз данных, хранящихся на веб-серверах, но часть контента может быть недоступна для сканирования. С момента появления Интернета в 1990-х годах существовало множество поисковых систем, но Google Search стала доминирующей в 2000-х годах и сохраняет это положение. В настоящее время её доля на мировом рынке составляет 91%. Бизнес, связанный с улучшением видимости веб-сайтов в результатах поиска, известный как маркетинг и оптимизация, в основном ориентирован на Google.

История

+ Хронология (полный список) Год Поисковая система Текущий статус 1993W3КаталогALIWEBJumpStationWWW Worm1994WebCrawlerGo.com, перенаправляет на DisneyLycosInfoseek, перенаправляет на Disney1995Yahoo! Search, изначально функция поиска в Yahoo! DirectoryDaumSearch.chMagellanExciteMetaCrawlerAltaVista, приобретена Yahoo! в 2003 году, с 2013 года перенаправляет на Yahoo!1996RankDex, включена в Baidu в 2000 годуDogpileHotBot (использовала технологию поиска Inktomi)Ask Jeeves (переименована в ask.com)1997AOL NetFind (переименована в AOL Search с 1999 года)goo.ne.jpNorthern LightYandex1998GoogleIxquick как Startpage.comMSN Search как Bingempas (объединена с NATE)1999AlltheWeb (URL перенаправлен на Yahoo!)GenieKnows, переименована в Yellowee (перенаправляла на justlocalbusiness.com)NaverTeoma (перенаправление на Ask.com)2000BaiduExaleadGigablast2001Kartoo2003Info.com2004A9.comClusty (перенаправление на DuckDuckGo)MojeekSogou2005SearchMeKidzSearch, Google Search2006Soso, объединена с SogouQuaeroSearch.comChaChaAsk.comLive Search как Bing, переименована в MSN Search2007wikiseekSprooseWikia SearchBlackle.com, Google Search2008Powerset (перенаправляет на Bing)PicollatorViewziBoogamiLeapFishForestle (перенаправляет на Ecosia)DuckDuckGoTinEye2009Bing, переименована в Live SearchYebolScout (Goby)NATEEcosiaStartpage.com, партнерский поисковик Ixquick2010Blekko, продана IBMCuilYandex (английский)Parsijoo2011YaCy, P2P2012Volunia2013Qwant2014Egerin, курдский / сораниSwisscowsSearx2015YoozCliqz2016Kiddle, Google Search2017Presearch2018Kagi2020Petal2021Brave SearchQueyeYou.com

До 1990-х годов

В 1945 году Ванневар Буш описал систему поиска информации, которая позволяла бы пользователю получать доступ к огромному объему данных, не покидая своего рабочего места. Он назвал её "мемекс". Описание системы было представлено в статье "Как мы можем думать", опубликованной в журнале The Atlantic Monthly. "Мемекс" задумывался как инструмент, позволяющий преодолеть растущую сложность поиска информации в постоянно увеличивающихся централизованных индексах научных работ. Ванневар Буш предвидел библиотеки исследований с взаимосвязанными аннотациями, аналогичными современным гиперссылкам. Анализ ссылок впоследствии стал ключевым компонентом поисковых систем благодаря алгоритмам, таким как Hyper Search и PageRank.

1990-е: Появление поисковых систем

Первые поисковые системы в Интернете появились до дебюта Всемирной паутины в декабре 1990 года: поиск пользователей WHOIS датируется 1982 годом, а многосетевой поиск пользователей Knowbot Information Service был впервые реализован в 1989 году. Первой хорошо документированной поисковой системой, которая искала файлы содержимого, а именно FTP-файлы, был Archie, дебютировавший 10 сентября 1990 года. До сентября 1993 года Всемирная паутина индексировалась исключительно вручную. Существовал список веб-серверов, редактируемый Тимом Бернерсом-Ли и размещенный на веб-сервере CERN. Сохранился один снимок списка 1992 года, но по мере появления все большего количества веб-серверов центральный список перестал успевать за обновлениями. На сайте NCSA новые серверы объявлялись под заголовком "Что нового!". Первым инструментом для поиска контента (в отличие от пользователей) в Интернете был Archie. Название происходит от слова "archive" без буквы "v". Он был разработан студентом-компьютерщиком из университета Макгилла в Монреале, Квебек, Канада. Программа загружала списки каталогов всех файлов, расположенных на публичных анонимных FTP-сайтах (File Transfer Protocol), создавая базу данных имен файлов для поиска; однако Archie не индексировал содержимое этих сайтов, поскольку объем данных был настолько мал, что их можно было легко искать вручную. Появление Gopher (созданного в 1991 году Марком МакКахиллом в Университете Миннесоты) привело к созданию двух новых поисковых программ: Veronica и Jughead. Как и Archie, они искали имена файлов и заголовки, хранящиеся в индексах системы Gopher. Veronica (Very Easy Rodent-Oriented Net-wide Index to Computerized Archives) обеспечивала поиск по ключевым словам в большинстве заголовков меню Gopher во всех списках Gopher. Jughead (Jonzy's Universal Gopher Hierarchy Excavation And Display) был инструментом для получения информации о меню с конкретных серверов Gopher. Хотя название поисковой системы "Archie Search Engine" не отсылало к серии комиксов "Арчи", "Вероника" и "Джугхед" – персонажи этой серии, таким образом, отсылая к своему предшественнику. Летом 1993 года поисковой системы для Всемирной паутины не существовало, хотя многочисленные специализированные каталоги велись вручную. Оскар Ниерстраш из Женевского университета написал серию скриптов Perl, которые периодически копировали эти страницы и переписывали их в стандартный формат. Это легло в основу W3Catalog, первой примитивной поисковой системы для Всемирной паутины, выпущенной 2 сентября 1993 года. В июне 1993 года Мэтью Грей, работавший в то время в MIT, создал, вероятно, первого веб-робота World Wide Web Wanderer на основе Perl и использовал его для создания индекса под названием "Wandex". Целью Wanderer было измерение размера Всемирной паутины, что он делал до конца 1995 года. Вторая поисковая система для сети, Aliweb, появилась в ноябре 1993 года. Aliweb не использовал веб-робота, а полагался на уведомления от администраторов веб-сайтов о наличии на каждом сайте индексного файла в определенном формате. JumpStation (созданный в декабре 1993 года Джонатаном Флетчером) использовал веб-робота для поиска веб-страниц и создания своего индекса, а также использовал веб-форму в качестве интерфейса для своей программы запросов. Таким образом, это был первый инструмент для обнаружения ресурсов WWW, объединявший три основные функции веб-поисковой системы (сканирование, индексация и поиск), как описано ниже. Из-за ограниченных ресурсов, доступных на платформе, на которой он работал, его индексация и, следовательно, поиск ограничивались заголовками и подзаголовками, найденными на веб-страницах, которые сканер встречал. Одной из первых "полнотекстовых" поисковых систем на основе сканера был WebCrawler, появившийся в 1994 году. В отличие от своих предшественников, он позволял пользователям искать любое слово на любой веб-странице, что стало стандартом для всех основных поисковых систем с тех пор. Он также был поисковой системой, широко известной публике. В 1994 году также был запущен Lycos (начавшийся в Университете Карнеги-Меллона) и стал крупным коммерческим проектом. Первой популярной поисковой системой в Интернете была Yahoo! Search. Первым продуктом Yahoo!, основанного Джерри Янгом и Дэвидом Фило в январе 1994 года, был веб-каталог под названием Yahoo! Directory. В 1995 году была добавлена функция поиска, позволяющая пользователям искать в Yahoo! Directory. Он стал одним из самых популярных способов поиска веб-страниц, но его функция поиска работала с веб-каталогом, а не с полнотекстовыми копиями веб-страниц. Вскоре после этого появилось множество поисковых систем, конкурировавших за популярность. Среди них были Magellan, Excite, Infoseek, Inktomi, Northern Light и AltaVista. Пользователи также могли просматривать каталоги вместо выполнения поиска по ключевым словам. В 1996 году Робин Ли разработал алгоритм RankDex для ранжирования результатов поиска и получил патент США на эту технологию. Это была первая поисковая система, которая использовала гиперссылки для оценки качества веб-сайтов, которые она индексировала, что предшествовало очень похожему алгоритму, запатентованному Google два года спустя, в 1998 году. Ларри Пейдж ссылался на работу Ли в некоторых своих патентах США на PageRank. Позже Ли использовал свою технологию Rankdex для поисковой системы Baidu, которую он основал в Китае и запустил в 2000 году. В 1996 году Netscape стремилась заключить эксклюзивное соглашение с одной поисковой системой, чтобы она была основной поисковой системой в веб-браузере Netscape. Однако интерес был настолько велик, что Netscape заключила соглашения с пятью крупными поисковыми системами: за 5 миллионов долларов в год каждая поисковая система будет поочередно отображаться на странице поиска Netscape. Этими системами были Yahoo!, Magellan, Lycos, Infoseek и Excite. Google переняла идею продажи поисковых запросов в 1998 году у небольшой поисковой компании под названием goto.com. Этот шаг оказал значительное влияние на бизнес поисковых систем, который перешел от борьбы к одной из самых прибыльных отраслей в Интернете. Поисковые системы также были известны как одни из самых ярких звезд инвестиционного бума в Интернете в конце 1990-х годов. Несколько компаний эффектно вошли на рынок, получив рекордные прибыли во время первичного публичного размещения акций. Некоторые прекратили работу своих публичных поисковых систем и продают версии только для предприятий, такие как Northern Light. Многие компании, занимающиеся поиском, оказались втянутыми в пузырь доткомов, спекулятивный рыночный бум, достигший пика в марте 2000 года.

Локальный поиск

Местный поиск — это процесс, который помогает местным предприятиям привлекать клиентов. Они работают над тем, чтобы информация о них в поисковых системах была актуальной и единообразной. Это важно, поскольку многие люди принимают решения о том, куда пойти и что купить, основываясь на результатах поиска.

Доля рынка

По состоянию на 2022 год Google является самой используемой поисковой системой в мире, с долей рынка 90,6%, а другими наиболее используемыми поисковыми системами в мире были Bing, Yahoo!, Baidu, Yandex и DuckDuckGo. В Китае Baidu является самой популярной поисковой системой. В Южной Корее собственный поисковый портал Naver используется для 62,8% онлайн-поисков в стране. Yahoo! Japan и Yahoo! Taiwan являются самыми популярными способами поиска в Интернете в Японии и Тайване соответственно. Китай – одна из немногих стран, где Google не входит в тройку лидеров по доле рынка. Ранее Google была одной из ведущих поисковых систем в Китае, но вышла из страны после разногласий с правительством по вопросам цензуры и в связи с кибератакой. Bing входит в тройку лидеров с долей рынка 14,95%. Baidu занимает первое место с долей рынка 49,1%.

Европа

На рынках большинства стран Европейского Союза доминирует Google, за исключением Чешской Республики, где Seznam является сильным конкурентом. Поисковая система Qwant базируется в Париже, Франция, и привлекает оттуда большинство из своих 50 миллионов ежемесячных зарегистрированных пользователей.

Поисковая система

Хотя поисковые системы запрограммированы на ранжирование веб-сайтов на основе некоторой комбинации их популярности и релевантности, эмпирические исследования указывают на различные политические, экономические и социальные предубеждения в предоставляемой ими информации и лежащих в основе технологии предположениях. Эти предубеждения могут быть прямым результатом экономических и коммерческих процессов (например, компании, которые размещают рекламу в поисковой системе, могут также получать более высокие позиции в результатах органического поиска) и политических процессов (например, удаление результатов поиска в соответствии с местным законодательством). Так, Google не выдает определенные неонацистские веб-сайты во Франции и Германии, где отрицание Холокоста запрещено законом. Предубеждения могут также возникать в результате социальных процессов, поскольку алгоритмы поисковых систем часто разрабатываются таким образом, чтобы исключать нетрадиционные точки зрения в пользу более "популярных" результатов. Алгоритмы индексации крупных поисковых систем демонстрируют тенденцию к более широкому охвату сайтов, базирующихся в США, чем веб-сайтов из других стран, а также к определенному представлению спорных тем в результатах поиска, таких как терроризм в Ирландии, отрицание изменения климата и теории заговора.

Настраиваемые результаты и фильтрационные пузырьки

Высказывались опасения, что поисковые системы, такие как Google и Bing, предоставляют персонализированные результаты на основе истории активности пользователя, что, как определил Эли Паризер в 2011 году, приводит к возникновению эхо-камер или фильтрующих пузырей. Утверждается, что поисковые системы и платформы социальных сетей используют алгоритмы для выборочного определения информации, которая, по их мнению, может заинтересовать пользователя, основываясь на данных о нем (таких как местоположение, предыдущие клики и история поиска). В результате веб-сайты, как правило, показывают только информацию, соответствующую прежним взглядам пользователя. По мнению Эли Паризера, пользователи получают меньше информации, противоречащей их убеждениям, и оказываются интеллектуально изолированными в своем собственном информационном пузыре. После выявления этой проблемы появились конкурирующие поисковые системы, стремящиеся избежать ее, не отслеживая пользователей и не создавая "пузыри", например DuckDuckGo. Однако многие исследователи поставили под сомнение точку зрения Паризера, обнаружив мало доказательств существования фильтрующих пузырей. Напротив, ряд исследований, направленных на проверку существования фильтрующих пузырей, выявили лишь незначительный уровень персонализации в поисковой выдаче.

Недостаток инвестиций и медленные темпы развития технологий в мусульманском мире препятствовали прогрессу и успеху исламской поисковой системы, ориентированной на исламских пользователей. Проекты, такие как Muxlim – сайт о мусульманском образе жизни, – действительно получили миллионы долларов от инвесторов, таких как Rite Internet Ventures, но также потерпели неудачу. Другие поисковые системы, ориентированные на религию, включают Jewogle – еврейскую версию Google, и SeekFind.org – христианскую. SeekFind фильтрует сайты, которые нападают на их веру или принижают ее достоинство.

Подача в поисковую систему

Подача веб-сайта в поисковую систему — это процесс, при котором веб-мастер напрямую отправляет информацию о сайте в поисковую систему. Хотя подачу в поисковую систему иногда преподносят как способ продвижения сайта, как правило, она не требуется, поскольку основные поисковые системы используют веб-краулеры (поисковые роботы), которые в конечном итоге находят большинство сайтов в интернете самостоятельно. Веб-мастер может отправлять отдельные веб-страницы или весь сайт, используя карту сайта, но обычно достаточно отправить только главную страницу, так как поисковые системы способны просканировать хорошо структурированный сайт. Остаются две причины для подачи сайта или страницы в поисковую систему: добавление совершенно нового сайта, чтобы не ждать, пока поисковая система обнаружит его, и обновление информации о сайте после значительной переработки дизайна. Некоторые программы для подачи в поисковые системы не только отправляют сайты в несколько поисковых систем, но и добавляют ссылки на эти сайты со своих собственных страниц. Это может показаться полезным для повышения позиций сайта в выдаче, поскольку внешние ссылки — один из важнейших факторов, определяющих его рейтинг. Однако Джон Мюллер из Google заявил, что это "может привести к огромному количеству неестественных ссылок на ваш сайт", что негативно скажется на его позициях.

Арчи .

Первой веб-поисковой системой был Archie, созданный в 1990 году Аланом Эмтегом, студентом Университета Макгилла в Монреале. Автор изначально хотел назвать программу "archives", но ему пришлось сократить название, чтобы соответствовать стандарту Unix по присвоению программ и файлов коротких, неясных имен, таких как grep, cat, troff, sed, awk, perl и так далее. Основным методом хранения и поиска файлов был протокол передачи файлов (FTP). Это была (и остается) система, определяющая единый способ обмена файлами между компьютерами через Интернет. Это работает следующим образом: администратор решает предоставить доступ к файлам со своего компьютера. Он устанавливает на свой компьютер программу, называемую FTP-сервером. Когда кто-то в Интернете хочет получить файл с этого компьютера, он подключается к нему через другую программу, называемую FTP-клиентом. Любая FTP-клиентская программа может взаимодействовать с любой FTP-серверной программой, если обе программы полностью соответствуют спецификациям протокола FTP. Изначально, чтобы поделиться файлом, необходимо было настроить FTP-сервер. Позже "анонимные" FTP-сайты стали хранилищами файлов, позволяя всем пользователям загружать и скачивать файлы. Даже с появлением архивных сайтов многие важные файлы оставались разбросанными по небольшим FTP-серверам. Найти эти файлы можно было только через аналог "сарафанного радио" в Интернете: кто-то отправлял сообщение в рассылку или на форум, сообщая о доступности файла. Archie изменил это. Он объединил скриптовый сборщик данных, который собирал списки файлов с анонимных FTP-сайтов, и механизм сопоставления с регулярными выражениями для поиска файлов, соответствующих запросу пользователя. (4) Иными словами, сборщик Archie просматривал FTP-сайты по всему Интернету и индексировал все найденные файлы. Механизм сопоставления с регулярными выражениями предоставлял пользователям доступ к этой базе данных.

Ягу!

В апреле 1994 года два докторанта Стэнфордского университета, Дэвид Фило и Джерри Янг, создали несколько страниц, которые быстро стали популярными. Они назвали эту коллекцию страниц Yahoo! Их официальное объяснение выбора имени заключалось в том, что они считали себя парой "яху". По мере увеличения количества ссылок и тысяч посещений страниц в день, команда разработала способы более эффективной организации данных. Чтобы облегчить поиск информации, Yahoo! (www.yahoo.com) превратился в структурированный каталог с возможностью поиска. Функция поиска представляла собой простую поисковую систему по базе данных. Поскольку записи в Yahoo! вводились и категоризировались вручную, Yahoo! фактически не считался поисковой системой. Вместо этого его обычно рассматривали как структурированный каталог с возможностью поиска. С тех пор Yahoo! автоматизировал некоторые аспекты сбора и классификации информации, размывая грань между поисковой системой и каталогом. The Wanderer собирал только URL-адреса, что затрудняло поиск информации, не описанной непосредственно в URL. Поскольку URL-адреса изначально довольно сложны для понимания, это не помогало обычному пользователю. Поиск в Yahoo! или Galaxy был гораздо эффективнее, поскольку они содержали дополнительную описательную информацию об индексируемых сайтах.

Ликоны

В Университете Карнеги — Меллона в июле 1994 года Майкл Молдин, находясь в отпуске из CMU, разработал поисковую систему Lycos.