Кіріспе
Ақпаратты іздеу зерттеулеріне арналған жиналыстар
Мәтінді іздеу конференциясы (TREC) – әртүрлі ақпаратты іздеу (IR) зерттеу салаларына немесе бағыттарына арналған семинарлар сериясы. Ол Ұлттық стандарттар және технология институты (NIST) және Ұлттық барлау директоры кеңсесінің бөлігі болып табылатын Интеллектуалды алдыңғы зерттеулер жобалары (IARPA) бірлесіп ұйымдастырады. TREC 1992 жылы TIPSTER мәтіндік бағдарламасының аясында бастау алды. Оның мақсаты – мәтінді іздеу әдістемелерін кең ауқымда бағалау үшін қажетті инфрақұрылымды ұсыну арқылы ақпаратты іздеу қауымдастығындағы зерттеулерді қолдау және ынталандыру, сондай-ақ технологияны зертханадан өнімге көшіру жылдамдығын арттыру. TREC-тің бағалау протоколдары көптеген іздеу технологияларын жақсартты. 2010 жылы жасалған зерттеуде «TREC болмағанда, 1999 мен 2009 жылдар аралығында АҚШ интернет қолданушылары веб-іздеу жүйелерін пайдалануға 3,15 миллиард сағаттан астам уақыт жұмсаған болар еді» деген қорытынды жасалды. Google компаниясының бас экономисі Хэл Вариан «TREC деректері ақпаратты іздеу зерттеулерін жандандырды. Стандартталған, кеңінен қолжетімді және мұқият құрастырылған деректер жиынтығы осы саладағы одан әрі инновациялардың негізін қалады» деп жазды. Әр бағыттың өзіндік қиындықтары бар, онда NIST қатысушы топтарға деректер жиынтығын және тесттік тапсырмаларды ұсынады. Бағытқа байланысты, тесттік тапсырмалар сұрақтар, тақырыптар немесе анықтамалы ерекшеліктер болуы мүмкін. Жүйелерді әділ бағалау үшін бірыңғай бағалау жүргізіледі. Нәтижелерді бағалаудан кейін семинар қатысушыларға ойлар мен идеяларды бөлісіп, ағымдағы және болашақ зерттеу жұмыстарын ұсынуға мүмкіндік береді. Мәтінді іздеу конференциясы 1992 жылы DARPA (АҚШ Қорғаныс ғылыми-зерттеу жобасы) қаржыландыруымен және NIST басқаруымен басталды. Оның мақсаты – мәтінді іздеу әдістемелерін кең ауқымда бағалау үшін қажетті инфрақұрылымды ұсыну арқылы ақпаратты іздеу қауымдастығындағы зерттеулерді қолдау болды.
TREC-тегі маңызды шешімдер
TREC сәйкес келуін былай анықтайды: "Егер сіз тақырып бойынша есеп жазып жатсаңыз және есепте құжаттағы ақпаратты қолдансаңыз, онда құжат сәйкес келеді". TREC іздеу тапсырмаларының көпшілігі екілік сәйкес келуді қолданады: құжат сәйкес немесе сәйкес емес болып табылады. Кейбір TREC тапсырмалары бірнеше деңгейдегі сәйкес келуді қамтитын, бағаланған сәйкес келуді қолданады. TREC жинақтарының көпшілігі толық сәйкес келуді бағалау үшін тым үлкен; осы жинақтар үшін әрбір сұраныс бойынша абсолютті толықтықты есептеу мүмкін емес. Қай құжаттарды бағалау керектігін анықтау үшін TREC әдетте "пулинг" әдісін қолданады. Бұл әдісте әрбір қатысушының жоғары бағаланған n құжаты біріктіріледі, ал нәтижедегі құжаттар жиынтығы толығымен бағаланады.
Қазіргі жолдар
Жаңа зерттеу қажеттіліктері анықталған сайын жаңа тректер қосылады, бұл тізім TREC 2018 үшін жаңартылған. CENTRE Track мақсаты: IR қайталанатындығын бағалау протоколын әзірлеу және баптау үшін CLEF 2018, NTCIR 14, TREC 2018 іс-шараларын қатар жүргізу (2018 жылға арналған жаңа трек). Common Core Track мақсаты: жаңалықтар құжаттары бойынша жүйелі іздеу тапсырмасын орындау. Complex Answer Retrieval (CAR) мақсаты: бүкіл деректер жинағынан ақпарат жинақтау арқылы күрделі ақпараттық сұраныстарға жауап бере алатын жүйелерді әзірлеу. Incident Streams Track мақсаты: төтенше жағдайларда әлеуметтік желілерден келетін ақпарат ағындарын автоматты түрде өңдеу технологияларын зерттеу (TREC 2018 үшін жаңа трек). The News Track мақсаты: The Washington Post газетімен серіктестік орнатып, жаңалықтар ортасында тест жинақтарын жасау (2018 жылға арналған жаңа трек). Precision Medicine Track мақсаты: Клиникалық шешімдерді қолдау трекінің мамандануы, онкологиялық пациенттердің деректерін клиникалық сынақтармен байланыстыруға бағыттау. Real Time Summarization Track (RTS) мақсаты: әлеуметтік желілерден келетін ақпарат ағындарынан нақты уақыт режимінде жаңартылатын қорытындыларды жасау техникаларын зерттеу.
Байланысты оқиғалар
1997 жылы TREC-тің жапон аналогы (алғашқы семинар 1999 жылы) іске қосылды, ол NTCIR (IR жүйелері үшін Ұлттық институтының сынақ жинағы) деп аталды, ал 2000 жылы тілдер аралық ақпаратты іздестіруді зерттеуге бағытталған CLEF еуропалық аналогы іске қосылды. Ақпаратты іздестіруді бағалау форумы (FIRE) 2008 жылы TREC, CLEF және NTCIR сияқты Оңтүстік Азиядағы баламасын құру мақсатымен құрылды.
Конференцияның іздеу тиімділігіне үлесі
NIST-тің мәлімдемесінше, семинарлардың алғашқы алты жылында ақпаратты іздеу жүйелерінің тиімділігі шамамен екі есеге артқан. Конференция сондай-ақ ағылшыл тілінен басқа тілдердегі құжаттарды, сөйлеуді, бейнелерді және көптілді іздеуді кең ауқымда бағалауды алғаш рет өткізді. Бұған қоса, бұл сынақтар көптеген ғылыми еңбектердің жарық көруіне ықпал етті. TREC-те алғаш рет әзірленген технологиялар қазір әлемдегі көптеген коммерциялық іздеу жүйелеріне енгізілген. RTII жүргізген тәуелсіз зерттеуде «1999 жылдан 2009 жылға дейінгі кезеңде веб-іздеу жүйелерінің жақсаруының шамамен үштен бірі TREC-ке тиесілі. Бұл жақсартулар веб-іздеу жүйелерін пайдалану кезінде 3 миллиард сағатқа дейін үнемдеуге мүмкіндік берді. Сонымен қатар, есепте NIST және оның серіктестері TREC-ке салған әрбір 1 доллар үшін жеке және мемлекеттік сектордағы АҚШ ақпаратты іздеу зерттеушілеріне кем дегенде 3,35-тен 5,07 долларға дейін пайда әкелгені көрсетілді». Бір зерттеу 2009 жылға дейінгі он жылдық ішінде дереу іздеудің жетістіктері айтарлықтай жоғарыламағанын көрсетеді, бірақ бұл бірнеше гигабайт көлеміндегі жаңалықтар мен веб-жинақтардағы тақырыптық мазмұнды іздеуге ғана қатысты. Басқа да дереу іздеу түрлерінде жетістіктер болды. Мысалы, белгілі элементтерді вебтен іздеу үшін сынақ жинақтары құрылды, олар анкорлық мәтін, тақырып салмағы және URL ұзындығын пайдалану арқылы жақсартылды, бұл бұрынғы дереу іздеу сынақтарында пайдалы емес еді. 2009 жылы жаңа миллиард беттік веб-жинақ енгізілді, және спам-сүзгілеу бұрынғы сынақ жинақтарына қарағанда веб-іздеу үшін пайдалы техника болып табылды. TREC-те әзірленген сынақ жинақтары зерттеушілерге (потенциалды) жаңа жетістіктерге қол жеткізуге көмектесу үшін ғана емес, сонымен қатар жаңа (коммерциялық) іздеу өнімдерін әзірлеушілерге стандартты сынақтарда олардың тиімділігін бағалауға мүмкіндік береді. Соңғы он жылда TREC корпоративтік электрондық поштаны іздеу, геномиканы іздеу, спам-сүзгілеу, электрондық ашу және басқа да бірнеше іздеу салалары үшін жаңа сынақтар жасады. TREC жүйелері көбінесе қосымша зерттеулер үшін базалық деңгейді қамтамасыз етеді. Мысалы, Google компаниясының бас экономисі Хэл Вариан: «Жақсы деректер жақсы ғылымға жол ашады. Ақпаратты іздеу тарихы осы қағиданы жақсы көрсетеді» дейді және TREC-тің үлесін сипаттайды. TREC-тің құқықтық бағыты электрондық ашу қауымдастығына коммерциялық жеткізушілерді зерттеу және бағалау салаларында әсер етті. IBM Watson (DeepQA) құрастырған IBM зерттеушілер тобы, әлемдегі ең үздік Jeopardy! ойыншыларын жеңіп алды, TREC-тің сұрақ-жауап трекінен алынған деректер мен жүйелерді базалық өлшемдер ретінде пайдаланды.
Hal Varian, Chief Economist at Google, says ''Better data makes for better science. The history of information retrieval illustrates this principle well," and describes TREC's contribution. TREC's Legal track has influenced the e Discovery community both in research and in evaluation of commercial vendors. The IBM researcher team building IBM Watson (aka DeepQA), which beat the world's best Jeopardy! players, used data and systems from TREC's QA Track as baseline performance measurements.
Қатысу
Конференция әртүрлі, халықаралық зерттеушілер мен әзірлеушілерден құралған. 2003 жылы 22 елден академиялық және өнеркәсіптік саладан 93 топ қатысты.