Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Оценка важности слова в документе
Estimate of the importance of a word in a document
В информационном поиске tf–idf (также TF*IDF, TFIDF, TF–IDF или Tf–idf), сокращение от «частота термина – обратная частота документа», является мерой важности слова для документа в коллекции или корпусе, учитывающей тот факт, что некоторые слова встречаются в языке чаще других. Он часто использовался в качестве весового коэффициента при поиске информации, анализе текстов и построении моделей пользователей. Опрос, проведенный в 2015 году, показал, что 83% текстовых рекомендательных систем в цифровых библиотеках использовали tf–idf. Различные варианты схемы взвешивания tf–idf часто применялись поисковыми системами как основной инструмент для оценки и ранжирования релевантности документа относительно запроса пользователя. Одна из самых простых функций ранжирования вычисляется путем суммирования значений tf–idf для каждого термина запроса; многие более сложные функции ранжирования являются модификациями этой простой модели.
In information retrieval, tf–idf (also TF*IDF, TFIDF, TF–IDF, or Tf–idf), short for term frequency–inverse document frequency, is a measure of importance of a word to a document in a collection or corpus, adjusted for the fact that some words appear more frequently in general. It was often used as a weighting factor in searches of information retrieval, text mining, and user modeling. A survey conducted in 2015 showed that 83% of text based recommender systems in digital libraries used tf–idf. Variations of the tf–idf weighting scheme were often used by search engines as a central tool in scoring and ranking a document's relevance given a user query. One of the simplest ranking functions is computed by summing the tf–idf for each query term; many more sophisticated ranking functions are variants of this simple model.
Определение
tf-idf – это произведение двух статистических показателей: частоты термина и обратной частоты документа. Существуют различные способы определения точных значений обоих показателей. Это формула, предназначенная для определения важности ключевого слова или фразы в документе или на веб-странице. + Варианты схемы взвешивания частоты терминов (tf): бинарный вес, исходное количество, логарифмическая нормализация частоты, двойная нормализация (0,5), двойная нормализация (K).
The tf–idf is the product of two statistics, term frequency and inverse document frequency. There are various ways for determining the exact values of both statistics. A formula that aims to define the importance of a keyword or phrase within a document or a web page. + Variants of term frequency (tf) weight weighting scheme tf weight binary raw count term frequency log normalization double normalization 0.5 double normalization K
Деривативы
Ряд схем взвешивания терминов произошли от tf–idf. Одной из них является TF–PDF (частота терминов * пропорциональная частота документов). TF–PDF был представлен в 2001 году в контексте выявления новых тем в медиа. Компонент PDF измеряет разницу в частоте появления термина в различных областях. Другой вариант – TF–IDuF. В TF–IDuF idf не вычисляется на основе корпуса документов, по которому осуществляется поиск или выдаются рекомендации. Вместо этого idf вычисляется на основе персональных коллекций документов пользователей. Авторы сообщают, что TF–IDuF был столь же эффективен, как и tf–idf, но также может применяться в ситуациях, когда, например, система моделирования пользователей не имеет доступа к глобальному корпусу документов.
A number of term weighting schemes have derived from tf–idf. One of them is TF–PDF (term frequency * proportional document frequency). TF–PDF was introduced in 2001 in the context of identifying emerging topics in the media. The PDF component measures the difference of how often a term occurs in different domains. Another derivate is TF–IDuF. In TF–IDuF, idf is not calculated based on the document corpus that is to be searched or recommended. Instead, idf is calculated on users' personal document collections. The authors report that TF–IDuF was equally effective as tf–idf but could also be applied in situations when, e. g., a user modeling system has no access to a global document corpus.