Ақпаратты іздеудегі рандомдықтан ауытқу – ықтималдық модель, құжаттардағы ақпарат мөлшерін анықтайды. Гартердің 2 Пуассон индекстеу моделіне негізделген.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Ақпаратты іздеу саласында кездейсоқтықтан ауытқу, алғашқы модельдердің бірі, ықтималдық модельдің бір түрі болып табылады. Ол негізінен құжаттардағы ақпарат мөлшерін бағалау үшін қолданылады. Ол Хартердің 2 Пуассон индекстеу моделіне негізделген. 2 Пуассон моделі құжаттардың маңыздылығы сөздердің жиі кездесетін жиынтығына байланысты, ал қалған құжаттарда олардың жиілігі салыстырмалы түрде төмен деген гипотезаға ие. Бұл толыққанды "модель" емес, ықтималдық әдістерді қолдана отырып, терминдерді салмақтаудың аясы және ол элиталық ұғымға негізделген терминдерді салмақтау үшін ерекше қатынас ұсынады. Терминдердің салмағы белгілі бір сөздің осы жиынға жата ма, жатпай ма деген өлшем ретінде қарастырылады. Терминдердің салмағы кездейсоқ процесс арқылы алынған терминдердің таралуы мен нақты терминдердің таралуы арасындағы айырманы өлшеу арқылы есептеледі. Кездейсоқтықтан ауытқу модельдері аяның үш негізгі компонентін анықтау арқылы құрылады: біріншіден, негізгі кездейсоқтық моделін таңдау, содан кейін бірінші нормалдауды қолдану және соңында терминдердің жиілігін нормалдау. Негізгі модельдер келесі кестелерде келтірілген.
In the field of information retrieval, divergence from randomness, one of the first models, is one type of probabilistic model. It is basically used to test the amount of information carried in the documents. It is based on Harter's 2 Poisson indexing model. The 2 Poisson model has a hypothesis that the level of the documents is related to a set of documents which contains words occur relatively greater than the rest of the documents. It is not a 'model', but a framework for weighting terms using probabilistic methods, and it has a special relationship for term weighting based on notion of eliteness. Term weights are being treated as the standard of whether a specific word is in that set or not. Term weights are computed by measuring the divergence between a term distribution produced by a random process and the actual term distribution. Divergence from randomness models set up by instantiating the three main components of the framework: first selecting a basic randomness model, then applying the first normalization and at last normalizing the term frequencies. The basic models are from the following tables.
DFR үлгілері
BB2 Бернулли Эйнштейн моделі, Бернулли кейін әсері және 2 нормализациясы. IFB2 Бернулли кейін әсері және 2 нормализациясы бар кері жиілік моделі. expB2 Бернулли кейін әсері және 2 нормализациясы бар күтілетін құжат жиілігі моделі. Логарифмдер 2 негізінде есептеледі. Бұл модель классикалық ad hoc тапсырмалар үшін қолданылуы мүмкін. expC2 Бернулли кейін әсері және 2 нормализациясы бар күтілетін құжат жиілігі моделі. Логарифмдер e негізінде есептеледі. Бұл модель классикалық ad hoc тапсырмалар үшін қолданылуы мүмкін. InL2 Лаплас кейін әсері және 2 нормализациясы бар кері құжат жиілігі моделі. Бұл модель ерте дәлдік қажет болатын тапсырмалар үшін қолданылуы мүмкін. PL2 Лаплас кейін әсері және 2 нормализациясы бар Пуассон моделі. Бұл модель ерте дәлдік қажет болатын тапсырмалар үшін қолданылуы мүмкін [7,8].
BB2 Bernoulli Einstein model with Bernoulli after effect and normalization 2. IFB2 Inverse Term Frequency model with Bernoulli after effect and normalization 2. In expB2 Inverse Expected Document Frequency model with Bernoulli after effect and normalization 2. The logarithms are base 2. This model can be used for classic ad hoc tasks. In expC2 Inverse Expected Document Frequency model with Bernoulli after effect and normalization 2. The logarithms are base e. This model can be used for classic ad hoc tasks. InL2 Inverse Document Frequency model with Laplace after effect and normalization 2. This model can be used for tasks that require early precision. PL2 Poisson model with Laplace after effect and normalization 2. This model can be used for tasks that require early precision[7,8].
Бірінші қалыпқа келтіру
Егер құжатта белгілі бір сирек термин табылмаса, онда сол құжатта осы терминнің ақпаратты болу ықтималдығы шамамен нөлге жақын болады. Керісінше, егер сирек термин құжатта жиі кездеседі, онда ол құжатта талқыланған тақырып бойынша ақпаратты болудың 100%-ға жуық ықтималдығына ие болуы мүмкін. Понте мен Крофттың тілдік моделін қолдану да пайдалы болуы мүмкін. Назар аударыңыз, DFR моделінде тәуекел факторы ескеріледі. Логикалық тұрғыдан алғанда, егер құжаттағы терминнің жиілігі салыстырмалы түрде жоғары болса, онда терминнің ақпаратты болмауының тәуекелі де салыстырмалы түрде төмен болады. Мысалы, егер Формула 1 жоғары мән көрсетсе, минималды тәуекелдің кері әсері ақпараттық пайданың аздығынан көрінеді. Сондықтан біз Формула 1 салмағын термин арқылы алынған ақпарат мөлшерін ғана ескеретіндей етіп құрастырамыз. Элиталық жиынтықта термин неғұрлым көп кездесетін болса, терминнің жиілігі соғұрлым кездейсоқтыққа байланысты болмайды, демек, осыған байланысты тәуекел де азаяды. Біз негізінен екі модельді қолданамыз: Лаплас L моделі және екі Бернулли процесінің арақатынасы B, олар құжаттағы термин арқылы алынған ақпараттық пайданы есептеуге мүмкіндік береді.
When a specific rare term cannot be found in a document, then in that document the term has approximately zero probability of being informative. On the other hand, if a rare term occurs frequently in a document, therefore it can have a very high, near 100% probability to be informative for the topic that mentioned by the document. Applying to Ponte and Croft's language model can also be a good idea. Notice that a risk component is considered in the DFR. Logically speaking, if the term frequency in the document is relatively high, then inversely the risk for the term of not being informative is relatively small. Say we have a Formula 1 giving a high value, then a minimal risk has the negative effect of showing small information gain. So we choose to organize the weight of Formula 1 to only consider the portion of which is the amount of information gained with the term. The more the term occurs in the elite set, the less term frequency is due to randomness, and thus the smaller the associated risk is. We basically apply two models to compute the information gain with a term within a document:
the Laplace L model, the ratio of two Bernoulli's processes B.
Қорытынды
Кездейсоқтық моделінен айырмашылық Бернулли моделіне және оның лимиттегі формаларына, гипергеометриялық үлестірілімге, Бозе-Эйнштейн статистикасына және оның лимиттегі формаларына, биномдық үлестірілімнің бета-үлестіріліммен қосылысына, сондай-ақ қалың құйрықты үлестірілімге негізделген. Кездейсоқтық моделінен ауытқу – ИЖ-ның көптеген әртүрлі тиімді модельдерін құруға әлеуеті бар біріктіруші аясты көрсетеді.
The divergence from Randomness Model is based on the Bernoulli model and its limiting forms, the hypergeometric distribution, Bose Einstein statistics and its limiting forms, the compound of the binomial distribution with the beta distribution, and the fat tailed distribution. Divergence from randomness model shows a unifying framework that has the potential constructing a lot of different effective models of IR.
Қолданылу түрлері мен сипаттамалары
Кездейсоқтықтан ауытқу моделі ақпаратты іздеуде автоматты индекстеуге қолданылуы мүмкін. Бұл диссертациялық элиталық ретінде, яғни құжаттағы терминнің ақпараттық мазмұнының көрсеткіші ретінде түсіндірілуі мүмкін. Кездейсоқтықтан ауытқуға негізделген модельдердің тиімділігі BM25 және тілдік модельдермен салыстырғанда өте жоғары. Ұзындығы қысқа сұраныстар үшін кездейсоқтықтан ауытқу модельдерінің нәтижесі 1994 жылдан бері модельдерді салыстыру үшін стандартты өлшемшарт ретінде қолданылып келе жатқан BM25 моделінен айқын артық. Кездейсоқтықтан ауытқу моделі басқа сұранысты кеңейту әдістерімен салыстырғанда, аздаған құжаттармен ең жақсы нәтижелерді көрсете алады. Кездейсоқтықтан ауытқу моделінің құрылымы өте жалпы және икемді. Әрбір компонент үшін сұранысты кеңейту мүмкіндігі болғандықтан, ең жақсы нәтиже алу үшін әртүрлі технологияларды қолдануға болады.
The Divergence from randomness model can be applied in automatic indexing in Information Retrieval. These can be explained as the dissertation eliteness,the notion of an informative content of a term within a document. The effectiveness of the models based on divergence from randomness is very high in comparison with both BM25 and language model. For short queries, the performance of the models of divergence from randomness is definitely better than the BM25 Model, which since 1994 has been used as a standard baseline for the comparison of the models. The Divergence from randomness model can show the best performance with only a few documents comparing to other query expansion skills. The framework of Divergence from randomness model is very general and flexible. With the query expansion provided for each component, we can apply different technologies in order to get the best performance.
Жақындық
Жақындық, алдын ала анықталған өлшемдегі терезе ішінде сұрау сөздерінің жұптарының қайталану санын ескере отырып, кездейсоқтықтан ауытқу арқылы қарастырылуы мүмкін. Нақтырақ айтқанда, DFR тәуелділік балын өзгертуші (DSM) pBiL және pBiL2 модельдерін іске асырады, бұл модельдер корпустағы жұптың статистикасы емес, құжаттың ұзындығына бөлінген кездейсоқтықты есептейді.
Proximity can be handled within divergence from randomness to consider the number of occurrences of a pair of query terms within a window of pre defined size. To specify, the DFR Dependence Score Modifier DSM implements both the pBiL and pBiL2 models, which calculate the randomness divided by the document's length, rather than the statistics of the pair in the corpus the pair in the corpus.
Кездейсоқтықтан ауытқу мысалдары
t – термин, c – жиынтық. Термин tfc=nL(t,c) = 200 орын және df(t,c) = nL(t,c) = 100 құжатта кездесін. Күтілетін орташа термин жиілігі: avgtf(t,c) = 200/100=2; бұл термин кездесетін құжаттардағы орташа көрсеткіш. N.D(c) = 1000 құжаттардың жалпы саны болсын. Терминнің құжаттарда пайда болу ықтималдығы: P.D(t|c) = 100/1000. Күтілетін орташа термин жиілігі 200/1000=1/5, бұл барлық құжаттар бойынша орташа көрсеткіш. Термин жиілігі Kt = 0,6 ретінде көрсетілген. Келесі кестеде nD бағаны t терминінің kt рет кездесетін құжаттар санын, nD(t,c,kt) ретінде көрсетеді. nL бағаны терминнің кездесетін орындарының санын көрсетеді және nL=kt*nD теңдеуімен анықталады. Оң жақтағы бағандар байқалған және Пуассон ықтималдықтарын көрсетеді. Pobs,elite(Kt) – барлық құжаттар бойынша байқалған ықтималдық. Ppoisson,all,lambda(Kt) – Пуассон ықтималдығы, мұндағы lambda(t,c) = nL(t,c)/N.D(c) = 0,20 – Пуассон параметрі. Кесте байқалған ықтималдықтың Пуассон ықтималдығынан қаншалықты ерекшеленетінін көрсетеді. Ppoisson(1) Pobs(1)-ден үлкен, ал kt>1 болғанда байқалған ықтималдықтар Пуассон ықтималдықтарынан жоғары. Байқалған таралудың құйрығында Пуассон таралымы болжағаннан көп масса бар. Сонымен қатар, оң жақтағы бағандар барлық құжаттардың орнына элиталық құжаттарды пайдалануды көрсетеді. Бұл жерде бір оқиғаның ықтималдығы тек элиталық құжаттардың орналасуына негізделген.
Let t be a term and c be a collection. Let the term occur in tfc=nL(t,c)=200 locations, and in df(t,c)=nL(t,c)=100 documents. The expected average term frequency is avgtf(t,c)=200/100=2; this is the average over the documents in which the term occurs. Let N. D(c)=1000 be the total amounts of documents. The term's occurrence is 10% in the documents: P. D(t|c)=100/1000. The expected average term frequency is 200/1000=1/5, and this is the average over all documents. The term frequency is shown as Kt =0, ,6. The following table show the column nD is the number of Documents that contains kt occurrence of t, shown as nD(t,c,kt). Another column nL is the number of Locations at which the term occurs follows by this equation: nL=kt*nD. The columns to the right show the observed and Poisson probabilities. P obs,elite(Kt) is the observed probability over all documents. P poisson,all,lambda(Kt) is the Poisson probability, where lambda(t,c)=nL(t,c)/N D(c)=0.20 is the Poisson parameter. The table illustrates how the observed probability is different from the Poisson probability. P poisson(1) is greater than P obs(1), whereas for kt>1. the observed probabilities are greater than the Poisson probabilities. There is more mass in the tail of the observed distribution than the Poisson distribution assumes. Moreover, the columns to the right illustrate the usage of the elite documents instead of all documents. Here, the single event probability is based on the locations of elite documents only.