Введение

Оценка важности слова в документе

В информационном поиске tf–idf (также TF*IDF, TFIDF, TF–IDF или Tf–idf), сокращение от «частота термина – обратная частота документа», является мерой важности слова для документа в коллекции или корпусе, учитывающей тот факт, что некоторые слова встречаются в языке чаще других. Он часто использовался в качестве весового коэффициента при поиске информации, анализе текстов и построении моделей пользователей. Опрос, проведенный в 2015 году, показал, что 83% текстовых рекомендательных систем в цифровых библиотеках использовали tf–idf. Различные варианты схемы взвешивания tf–idf часто применялись поисковыми системами как основной инструмент для оценки и ранжирования релевантности документа относительно запроса пользователя. Одна из самых простых функций ранжирования вычисляется путем суммирования значений tf–idf для каждого термина запроса; многие более сложные функции ранжирования являются модификациями этой простой модели.

Определение

tf-idf – это произведение двух статистических показателей: частоты термина и обратной частоты документа. Существуют различные способы определения точных значений обоих показателей. Это формула, предназначенная для определения важности ключевого слова или фразы в документе или на веб-странице. + Варианты схемы взвешивания частоты терминов (tf): бинарный вес, исходное количество, логарифмическая нормализация частоты, двойная нормализация (0,5), двойная нормализация (K).

Деривативы

Ряд схем взвешивания терминов произошли от tf–idf. Одной из них является TF–PDF (частота терминов * пропорциональная частота документов). TF–PDF был представлен в 2001 году в контексте выявления новых тем в медиа. Компонент PDF измеряет разницу в частоте появления термина в различных областях. Другой вариант – TF–IDuF. В TF–IDuF idf не вычисляется на основе корпуса документов, по которому осуществляется поиск или выдаются рекомендации. Вместо этого idf вычисляется на основе персональных коллекций документов пользователей. Авторы сообщают, что TF–IDuF был столь же эффективен, как и tf–idf, но также может применяться в ситуациях, когда, например, система моделирования пользователей не имеет доступа к глобальному корпусу документов.