Введение

Поиск информации и исследования текстовой добычи Проект Lemur - это сотрудничество между Центром интеллектуального поиска информации в Университете Массачусетса в Амхерсте и Институтом языковых технологий в Университете Карнеги-Меллона. Проект Lemur разрабатывает поисковые системы, панели инструментов браузера, инструменты анализа текста и ресурсы данных, которые поддерживают исследования и разработку программного обеспечения для поиска информации и добычи текста. Проект наиболее известен своими поисковыми системами Indri и Galago, набором данных ClueWeb09 и ClueWeb12 и библиотекой RankLib для ранжирования. Программное обеспечение и наборы данных широко используются в научных и исследовательских целях, а также в некоторых коммерческих целях. Философия разработки программного обеспечения проекта Lemur подчеркивает высокую точность, гибкость и эффективность. Например, поисковая система Indri обеспечивает точный поиск больших текстовых коллекций "из коробки", а данные хранятся доступным образом для поддержки разработки новых стратегий поиска. Программное обеспечение проекта Lemur распространяется по лицензиям с открытым исходным кодом, которые обеспечивают гибкость ученым и разработчикам программного обеспечения. Языки программирования, используемые для создания Lemur, - это C, C++ и Java, и он поставляется вместе с исходными файлами и инструкциями по сборке. Предоставленный исходный код может быть изменен с целью разработки новых библиотек. Он совместим с различными операционными системами, включая Linux и Windows.

Последняя версия

Обновления компонентов проекта "Лемур" проводятся два раза в год, в июне и декабре. Последняя версия поисковой системы Indri - 5.17. Последняя версия поисковой системы Galago - версия 3.18. Последняя версия RankLib, которая учится ранжировать библиотеку, - 2.14. Последняя версия приложения Sifaka для добычи данных - 1.8.

Поисковая система Indri

Поисковая система Indri является одним из компонентов, разработанных в рамках проекта Lemur. Это открытый код. Язык запросов, используемый в Indri, позволяет исследователям индексировать данные или структурировать документы с помощью простых командных строк. Indri предлагает гибкость в плане адаптации к различным текущим приложениям. Он также может быть распределен по кластеру узлов для высокой производительности. Поисковая система Indri может обрабатывать большие объемы данных и понимать различные форматы данных, такие как HTML и XML. API Indri поддерживает различные языки программирования и скриптов, такие как C ++, Java, C # и PHP.