Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Құжаттағы сөздің маңыздылығын бағалау
Estimate of the importance of a word in a document
Ақпаратты іздестіруде tf–idf (сондай-ақ TF*IDF, TFIDF, TF–IDF немесе Tf–idf), терминнің жиілігі – құжаттың жиілігінің кері шамасы деген аббревиатура, бір құжаттар жиынтығындағы немесе корпустағы сөздің маңыздылығын өлшеу үшін қолданылады, бұл ретте кейбір сөздердің жалпы алғанда жиірек кездесуі ескеріледі. Бұл өлшем ақпаратты іздеу, мәтін өндіру және пайдаланушы модельдеуде салмақ коэффициенті ретінде жиі қолданылды. 2015 жылы жүргізілген сауалнама көрсеткендей, цифрлық кітапханалардағы мәтіндік ұсыным жүйелерінің 83% tf–idf қолданған. tf–idf салмақтау схемасының түрлері іздеу жүйелерінде пайдаланушы сұранысына қатысты құжаттың маңыздылығын бағалау және реттеу үшін басты құрал ретінде жиі пайдаланылды. Ең қарапайым рейтингтік функциялардың бірі әр сұраныс термині үшін tf–idf мәнін қосу арқылы есептеледі; көптеген күрделі рейтингтік функциялар осы қарапайым модельдің өзгеше нұсқалары болып табылады.
In information retrieval, tf–idf (also TF*IDF, TFIDF, TF–IDF, or Tf–idf), short for term frequency–inverse document frequency, is a measure of importance of a word to a document in a collection or corpus, adjusted for the fact that some words appear more frequently in general. It was often used as a weighting factor in searches of information retrieval, text mining, and user modeling. A survey conducted in 2015 showed that 83% of text based recommender systems in digital libraries used tf–idf. Variations of the tf–idf weighting scheme were often used by search engines as a central tool in scoring and ranking a document's relevance given a user query. One of the simplest ranking functions is computed by summing the tf–idf for each query term; many more sophisticated ranking functions are variants of this simple model.
Анықтама
tfidf – екі статистиканың көбейтіндісі, терминнің жиілігі және құжаттың жиілігіне кері шама. Бұл екі статистиканың нақты мәнін анықтаудың әртүрлі тәсілдері бар. Кілт сөздің немесе сөз тіркесінің құжатта немесе веб-беттегі маңыздылығын анықтауға арналған формула. + Терминнің жиілігінің (tf) салмақтау схемасы: tf салмағы, бинарлық, шикі сан, терминнің жиілігінің логарифмдік нормалауы, қос нормалау 0.5, қос нормалау K.
The tf–idf is the product of two statistics, term frequency and inverse document frequency. There are various ways for determining the exact values of both statistics. A formula that aims to define the importance of a keyword or phrase within a document or a web page. + Variants of term frequency (tf) weight weighting scheme tf weight binary raw count term frequency log normalization double normalization 0.5 double normalization K
Деривативтер
Бірқатар термин салмақтау схемалары tf-idf негізінде жасалған. Олардың бірі – TF–PDF (терминнің жиілігі * пропорционалдық құжат жиілігі). TF–PDF 2001 жылы медиада жаңа тақырыптарды анықтау контекстінде ұсынылған. PDF компоненті әртүрлі салаларда терминнің қанша рет кездесетінінің айырмашылығын өлшейді. Тағы бір туындысы – TF–IDuF. TF–IDuF-та idf іздеу немесе ұсынуға арналған құжат корпусына сүйенбейді. Оның орнына, idf пайдаланушылардың жеке құжаттар жинағы бойынша есептеледі. Авторлар TF–IDuF-тың tf-idf-қа тең тиімді екенін, бірақ, мысалы, пайдаланушыны модельдеу жүйесінің жалпы құжат корпусына қол жеткізе алмайтын жағдайларда да қолданылуы мүмкін екенін хабарлайды.
A number of term weighting schemes have derived from tf–idf. One of them is TF–PDF (term frequency * proportional document frequency). TF–PDF was introduced in 2001 in the context of identifying emerging topics in the media. The PDF component measures the difference of how often a term occurs in different domains. Another derivate is TF–IDuF. In TF–IDuF, idf is not calculated based on the document corpus that is to be searched or recommended. Instead, idf is calculated on users' personal document collections. The authors report that TF–IDuF was equally effective as tf–idf but could also be applied in situations when, e. g., a user modeling system has no access to a global document corpus.