Кіріспе

Ақпаратты іздеу саласында кездейсоқтықтан ауытқу, алғашқы модельдердің бірі, ықтималдық модельдің бір түрі болып табылады. Ол негізінен құжаттардағы ақпарат мөлшерін бағалау үшін қолданылады. Ол Хартердің 2 Пуассон индекстеу моделіне негізделген. 2 Пуассон моделі құжаттардың маңыздылығы сөздердің жиі кездесетін жиынтығына байланысты, ал қалған құжаттарда олардың жиілігі салыстырмалы түрде төмен деген гипотезаға ие. Бұл толыққанды "модель" емес, ықтималдық әдістерді қолдана отырып, терминдерді салмақтаудың аясы және ол элиталық ұғымға негізделген терминдерді салмақтау үшін ерекше қатынас ұсынады. Терминдердің салмағы белгілі бір сөздің осы жиынға жата ма, жатпай ма деген өлшем ретінде қарастырылады. Терминдердің салмағы кездейсоқ процесс арқылы алынған терминдердің таралуы мен нақты терминдердің таралуы арасындағы айырманы өлшеу арқылы есептеледі. Кездейсоқтықтан ауытқу модельдері аяның үш негізгі компонентін анықтау арқылы құрылады: біріншіден, негізгі кездейсоқтық моделін таңдау, содан кейін бірінші нормалдауды қолдану және соңында терминдердің жиілігін нормалдау. Негізгі модельдер келесі кестелерде келтірілген.

DFR үлгілері

BB2 Бернулли Эйнштейн моделі, Бернулли кейін әсері және 2 нормализациясы. IFB2 Бернулли кейін әсері және 2 нормализациясы бар кері жиілік моделі. expB2 Бернулли кейін әсері және 2 нормализациясы бар күтілетін құжат жиілігі моделі. Логарифмдер 2 негізінде есептеледі. Бұл модель классикалық ad hoc тапсырмалар үшін қолданылуы мүмкін. expC2 Бернулли кейін әсері және 2 нормализациясы бар күтілетін құжат жиілігі моделі. Логарифмдер e негізінде есептеледі. Бұл модель классикалық ad hoc тапсырмалар үшін қолданылуы мүмкін. InL2 Лаплас кейін әсері және 2 нормализациясы бар кері құжат жиілігі моделі. Бұл модель ерте дәлдік қажет болатын тапсырмалар үшін қолданылуы мүмкін. PL2 Лаплас кейін әсері және 2 нормализациясы бар Пуассон моделі. Бұл модель ерте дәлдік қажет болатын тапсырмалар үшін қолданылуы мүмкін [7,8].

Бірінші қалыпқа келтіру

Егер құжатта белгілі бір сирек термин табылмаса, онда сол құжатта осы терминнің ақпаратты болу ықтималдығы шамамен нөлге жақын болады. Керісінше, егер сирек термин құжатта жиі кездеседі, онда ол құжатта талқыланған тақырып бойынша ақпаратты болудың 100%-ға жуық ықтималдығына ие болуы мүмкін. Понте мен Крофттың тілдік моделін қолдану да пайдалы болуы мүмкін. Назар аударыңыз, DFR моделінде тәуекел факторы ескеріледі. Логикалық тұрғыдан алғанда, егер құжаттағы терминнің жиілігі салыстырмалы түрде жоғары болса, онда терминнің ақпаратты болмауының тәуекелі де салыстырмалы түрде төмен болады. Мысалы, егер Формула 1 жоғары мән көрсетсе, минималды тәуекелдің кері әсері ақпараттық пайданың аздығынан көрінеді. Сондықтан біз Формула 1 салмағын термин арқылы алынған ақпарат мөлшерін ғана ескеретіндей етіп құрастырамыз. Элиталық жиынтықта термин неғұрлым көп кездесетін болса, терминнің жиілігі соғұрлым кездейсоқтыққа байланысты болмайды, демек, осыған байланысты тәуекел де азаяды. Біз негізінен екі модельді қолданамыз: Лаплас L моделі және екі Бернулли процесінің арақатынасы B, олар құжаттағы термин арқылы алынған ақпараттық пайданы есептеуге мүмкіндік береді.

Қорытынды

Кездейсоқтық моделінен айырмашылық Бернулли моделіне және оның лимиттегі формаларына, гипергеометриялық үлестірілімге, Бозе-Эйнштейн статистикасына және оның лимиттегі формаларына, биномдық үлестірілімнің бета-үлестіріліммен қосылысына, сондай-ақ қалың құйрықты үлестірілімге негізделген. Кездейсоқтық моделінен ауытқу – ИЖ-ның көптеген әртүрлі тиімді модельдерін құруға әлеуеті бар біріктіруші аясты көрсетеді.

Қолданылу түрлері мен сипаттамалары

Кездейсоқтықтан ауытқу моделі ақпаратты іздеуде автоматты индекстеуге қолданылуы мүмкін. Бұл диссертациялық элиталық ретінде, яғни құжаттағы терминнің ақпараттық мазмұнының көрсеткіші ретінде түсіндірілуі мүмкін. Кездейсоқтықтан ауытқуға негізделген модельдердің тиімділігі BM25 және тілдік модельдермен салыстырғанда өте жоғары. Ұзындығы қысқа сұраныстар үшін кездейсоқтықтан ауытқу модельдерінің нәтижесі 1994 жылдан бері модельдерді салыстыру үшін стандартты өлшемшарт ретінде қолданылып келе жатқан BM25 моделінен айқын артық. Кездейсоқтықтан ауытқу моделі басқа сұранысты кеңейту әдістерімен салыстырғанда, аздаған құжаттармен ең жақсы нәтижелерді көрсете алады. Кездейсоқтықтан ауытқу моделінің құрылымы өте жалпы және икемді. Әрбір компонент үшін сұранысты кеңейту мүмкіндігі болғандықтан, ең жақсы нәтиже алу үшін әртүрлі технологияларды қолдануға болады.

Жақындық

Жақындық, алдын ала анықталған өлшемдегі терезе ішінде сұрау сөздерінің жұптарының қайталану санын ескере отырып, кездейсоқтықтан ауытқу арқылы қарастырылуы мүмкін. Нақтырақ айтқанда, DFR тәуелділік балын өзгертуші (DSM) pBiL және pBiL2 модельдерін іске асырады, бұл модельдер корпустағы жұптың статистикасы емес, құжаттың ұзындығына бөлінген кездейсоқтықты есептейді.

Кездейсоқтықтан ауытқу мысалдары

t – термин, c – жиынтық. Термин tfc=nL(t,c) = 200 орын және df(t,c) = nL(t,c) = 100 құжатта кездесін. Күтілетін орташа термин жиілігі: avgtf(t,c) = 200/100=2; бұл термин кездесетін құжаттардағы орташа көрсеткіш. N.D(c) = 1000 құжаттардың жалпы саны болсын. Терминнің құжаттарда пайда болу ықтималдығы: P.D(t|c) = 100/1000. Күтілетін орташа термин жиілігі 200/1000=1/5, бұл барлық құжаттар бойынша орташа көрсеткіш. Термин жиілігі Kt = 0,6 ретінде көрсетілген. Келесі кестеде nD бағаны t терминінің kt рет кездесетін құжаттар санын, nD(t,c,kt) ретінде көрсетеді. nL бағаны терминнің кездесетін орындарының санын көрсетеді және nL=kt*nD теңдеуімен анықталады. Оң жақтағы бағандар байқалған және Пуассон ықтималдықтарын көрсетеді. Pobs,elite(Kt) – барлық құжаттар бойынша байқалған ықтималдық. Ppoisson,all,lambda(Kt) – Пуассон ықтималдығы, мұндағы lambda(t,c) = nL(t,c)/N.D(c) = 0,20 – Пуассон параметрі. Кесте байқалған ықтималдықтың Пуассон ықтималдығынан қаншалықты ерекшеленетінін көрсетеді. Ppoisson(1) Pobs(1)-ден үлкен, ал kt>1 болғанда байқалған ықтималдықтар Пуассон ықтималдықтарынан жоғары. Байқалған таралудың құйрығында Пуассон таралымы болжағаннан көп масса бар. Сонымен қатар, оң жақтағы бағандар барлық құжаттардың орнына элиталық құжаттарды пайдалануды көрсетеді. Бұл жерде бір оқиғаның ықтималдығы тек элиталық құжаттардың орналасуына негізделген.