Введение
Поиск информации и исследования текстовой добычи Проект Lemur - это сотрудничество между Центром интеллектуального поиска информации в Университете Массачусетса в Амхерсте и Институтом языковых технологий в Университете Карнеги-Меллона. Проект Lemur разрабатывает поисковые системы, панели инструментов браузера, инструменты анализа текста и ресурсы данных, которые поддерживают исследования и разработку программного обеспечения для поиска информации и добычи текста. Проект наиболее известен своими поисковыми системами Indri и Galago, набором данных ClueWeb09 и ClueWeb12 и библиотекой RankLib для ранжирования. Программное обеспечение и наборы данных широко используются в научных и исследовательских целях, а также в некоторых коммерческих целях. Философия разработки программного обеспечения проекта Lemur подчеркивает высокую точность, гибкость и эффективность. Например, поисковая система Indri обеспечивает точный поиск больших текстовых коллекций "из коробки", а данные хранятся доступным образом для поддержки разработки новых стратегий поиска. Программное обеспечение проекта Lemur распространяется по лицензиям с открытым исходным кодом, которые обеспечивают гибкость ученым и разработчикам программного обеспечения. Языки программирования, используемые для создания Lemur, - это C, C++ и Java, и он поставляется вместе с исходными файлами и инструкциями по сборке. Предоставленный исходный код может быть изменен с целью разработки новых библиотек. Он совместим с различными операционными системами, включая Linux и Windows.
The Lemur Project is a collaboration between the Center for Intelligent Information Retrieval at the University of Massachusetts Amherst and the Language Technologies Institute at Carnegie Mellon University. The Lemur Project develops search engines, browser toolbars, text analysis tools, and data resources that support research and development of information retrieval and text mining software. The project is best known for its Indri and Galago search engines, the ClueWeb09 and ClueWeb12 datasets, and the RankLib learning to rank library. The software and datasets are used widely in scientific and research applications, as well as in some commercial applications. The Lemur Project's software development philosophy emphasizes state of the art accuracy, flexibility, and efficiency. For example, the Indri search engine provides accurate search for large text collections 'out of the box', and data is stored in an accessible manner to support development of new retrieval strategies. Software from the Lemur Project is distributed under open source licenses that provide flexibility to scientists and software developers. The programming languages used to create Lemur are C, C++, and Java, and it comes along with the source files and build instructions. The provided source code can be modified for the purpose of developing new libraries. It is compatible with various operating systems which include Linux and Windows.
Последняя версия
Обновления компонентов проекта "Лемур" проводятся два раза в год, в июне и декабре. Последняя версия поисковой системы Indri - 5.17. Последняя версия поисковой системы Galago - версия 3.18. Последняя версия RankLib, которая учится ранжировать библиотеку, - 2.14. Последняя версия приложения Sifaka для добычи данных - 1.8.
Поисковая система Indri
Поисковая система Indri является одним из компонентов, разработанных в рамках проекта Lemur. Это открытый код. Язык запросов, используемый в Indri, позволяет исследователям индексировать данные или структурировать документы с помощью простых командных строк. Indri предлагает гибкость в плане адаптации к различным текущим приложениям. Он также может быть распределен по кластеру узлов для высокой производительности. Поисковая система Indri может обрабатывать большие объемы данных и понимать различные форматы данных, такие как HTML и XML. API Indri поддерживает различные языки программирования и скриптов, такие как C ++, Java, C # и PHP.