Кіріспе
Ақпаратты қайтару және мәтін өндіруді зерттеу Лемур жобасы - Массачусетс Амхерст университетінің Ақылды ақпараттарды қайтару орталығы мен Карнеги Меллон университетінің Тіл технологиялары институты арасындағы ынтымақтастық. Lemur жобасы іздеу жүйелерін, шолғыштың құралдар панелін, мәтінді талдау құралдарын және ақпараттарды іздеу мен мәтін өндіру бағдарламалық жасақтамасын зерттеу мен әзірлеуді қолдайтын дерек ресурстарын әзірлейді. Жоба ең алдымен Indri және Galago іздеу жүйелері, ClueWeb09 және ClueWeb12 деректер жиынтығы және RankLib кітапханасын рейтингтеуді үйренуімен танымал. Бағдарламалық қамтамасыз ету мен деректер жиынтығы ғылыми және ғылыми-зерттеу салаларында, сондай-ақ кейбір коммерциялық салаларда кеңінен қолданылады. Lemur жобасының бағдарламалық қамтамасыз етуді дамыту философиясы соңғы дәрежедегі дәлдікке, икемділікке және тиімділікке баса назар аударады. Мысалы, Indri іздеу жүйесі үлкен мәтіндік жинақтарды дәл іздеуді қамтамасыз етеді, ал деректер жаңа іздеу стратегиясын әзірлеуді қолдау үшін қол жетімді түрде сақталады. Lemur жобасының бағдарламалық жасақтамасы ашық кодтық лицензиялар бойынша таратылады, бұл ғалымдар мен бағдарламалық жасақтама әзірлеушілерге икемділік береді. Lemur бағдарламалау тілдері C, C++ және Java болып табылады, және ол бастапқы файлдармен және нұсқаулармен бірге келеді. Жаңа кітапханаларды әзірлеу мақсатында берілген бастапқы кодты өзгерту мүмкін. Ол Linux және Windows сияқты түрлі операциялық жүйелермен үйлесімді.
The Lemur Project is a collaboration between the Center for Intelligent Information Retrieval at the University of Massachusetts Amherst and the Language Technologies Institute at Carnegie Mellon University. The Lemur Project develops search engines, browser toolbars, text analysis tools, and data resources that support research and development of information retrieval and text mining software. The project is best known for its Indri and Galago search engines, the ClueWeb09 and ClueWeb12 datasets, and the RankLib learning to rank library. The software and datasets are used widely in scientific and research applications, as well as in some commercial applications. The Lemur Project's software development philosophy emphasizes state of the art accuracy, flexibility, and efficiency. For example, the Indri search engine provides accurate search for large text collections 'out of the box', and data is stored in an accessible manner to support development of new retrieval strategies. Software from the Lemur Project is distributed under open source licenses that provide flexibility to scientists and software developers. The programming languages used to create Lemur are C, C++, and Java, and it comes along with the source files and build instructions. The provided source code can be modified for the purpose of developing new libraries. It is compatible with various operating systems which include Linux and Windows.
Соңғы нұсқасы
Lemur жобасының компоненттері жылына екі рет, маусым мен желтоқсанда жаңартылады. Индри іздеу жүйесінің соңғы нұсқасы 5.17 болып табылады. Галаго іздеу жүйесінің соңғы нұсқасы 3.18 нұсқасы. RankLib-тің рейтингтік кітапхананы үйренудің соңғы нұсқасы 2.14 болып табылады. Sifaka деректер өндіру бағдарламасының соңғы нұсқасы 1.8.
Индри іздеу жүйесі
Индри іздеу жүйесі - Лемур жобасының құрауыштарының бірі. Бұл ашық код. Индриде қолданылатын сұраныс тілі зерттеушілерге деректерді индекстеуге немесе қарапайым командалық жол нұсқауларын қолдана отырып, құжаттарды құрылымдауға мүмкіндік береді. "Indri" қазіргі заманғы түрлі қолданбаларға бейімделу тұрғысынан икемділік ұсынады. Сондай-ақ, жоғары өнімділік үшін түйіндер кластерінде таратылуы мүмкін. Indri іздеу жүйесі үлкен деректер жиынтығын және HTML және XML сияқты әртүрлі деректер пішімдерін түсіне алады. Indri API C++, Java, C# және PHP сияқты әртүрлі бағдарламалау және скрипт тілдерін қолдайды.