Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
TrustRank — это алгоритм, который проводит анализ ссылок для отделения полезных веб-страниц от спама и помогает поисковым системам ранжировать страницы в результатах поиска (Search Engine Results Pages). Это полуавтоматизированный процесс, требующий некоторой помощи человека для правильной работы. Поисковые системы используют множество различных алгоритмов и факторов ранжирования для оценки качества веб-страниц. TrustRank — один из них. Поскольку ручная проверка Интернета непрактична и очень дорога, TrustRank был разработан для более быстрого и дешевого решения этой задачи. Впервые его представили исследователи Золтан Гёнги и Гектор Гарсия Молина из Стэнфордского университета и Ян Педерсен из Yahoo! в своей статье «Борьба с веб-спамом с помощью TrustRank» в 2004 году. Сегодня этот алгоритм является частью крупных поисковых систем, таких как Yahoo! и Google. Одним из важнейших факторов, определяющих качество веб-страницы при выдаче результатов поиска, являются обратные ссылки. Поисковые системы учитывают как количество, так и качество обратных ссылок при определении места веб-страницы в результатах поиска. Многие веб-страницы-спам создаются исключительно с целью обмана поисковых систем. Эти страницы, как правило создаваемые в коммерческих целях, используют различные методы для достижения неоправданно высоких позиций в результатах поиска. В то время как эксперты могут легко выявлять спам, поисковые системы постоянно совершенствуются, чтобы делать это без участия человека. Один из популярных методов повышения рейтинга — увеличение воспринимаемой важности документа посредством сложных схем линковки. Google PageRank и другие алгоритмы ранжирования подвергались подобным манипуляциям. TrustRank борется со спамом, фильтруя веб-контент на основе надежности. Метод предполагает выбор небольшого набора исходных страниц, которые оцениваются экспертом. После ручного определения авторитетных исходных страниц, сканирование, исходящее из этого набора, ищет аналогичные надежные и заслуживающие доверия страницы. Надежность TrustRank снижается по мере увеличения расстояния между документами и исходным набором. Эта логика работает и в обратном направлении, что называется Anti Trust Rank. Чем ближе сайт к спам-ресурсам, тем выше вероятность того, что он также является спамом. Исследователи, предложившие методологию TrustRank, продолжают совершенствовать свою работу, изучая связанные темы, такие как измерение объема спама.
TrustRank is an algorithm that conducts link analysis to separate useful webpages from spam and helps search engine rank pages in SERPs (Search Engine Results Pages). It is semi automated process which means that it needs some human assistance in order to function properly. Search engines have many different algorithms and ranking factors that they use when measuring the quality of webpages. TrustRank is one of them. Because manual review of the Internet is impractical and very expensive, TrustRank was introduced in order to help achieve this task much more quickly and cheaply. It was first introduced by researchers Zoltan Gyongyi and Hector Garcia Molina of Stanford University and Jan Pedersen of Yahoo! in their paper "Combating Web Spam with TrustRank" in 2004. Today, this algorithm is a part of major web search engines like Yahoo! and Google. One of the most important factors that help web search engine determine the quality of a web page when returning results are backlinks. Search engines take a number and quality of backlinks into consideration when assigning a place to a certain web page in SERPs. Many web spam pages are created only with the intention of misleading search engines. These pages, chiefly created for commercial reasons, use various techniques to achieve higher than deserved rankings in the search engines' result pages. While human experts can easily identify spam, search engines are still being improved daily in order to do it without help of humans. One popular method for improving rankings is to increase the perceived importance of a document through complex linking schemes. Google's PageRank and other search ranking algorithms have been subjected to such manipulation. TrustRank seeks to combat spam by filtering the web based upon reliability. The method calls for selecting a small set of seed pages to be evaluated by an expert. Once the reputable seed pages are manually identified, a crawl extending outward from the seed set seeks out similarly reliable and trustworthy pages. TrustRank's reliability diminishes with increased distance between documents and the seed set. The logic works in the opposite way as well, which is called Anti Trust Rank. The closer a site is to spam resources, the more likely it is to be spam as well. The researchers who proposed the TrustRank methodology have continued to refine their work by evaluating related topics, such as measuring spam mass.