Введение

В феврале 2014 года проект Common Crawl использовал Nutch для своего открытого, масштабного обхода веб-сайтов. Хотя ранее проект Nutch ставил целью выпуск глобальной, крупномасштабной поисковой системы, сейчас это уже не является его целью.

История релизов

1. x Ветвь 2. x Ветвь Дата выпуска Описание 1.1 2010 06 06 Этот релиз включает в себя несколько основных обновлений существующих библиотек (Hadoop, Solr, Tika и т. д.), от которых зависит Nutch. Также включены различные исправления ошибок и оптимизации (например, для Fetcher2). 1.2 2010 10 24 Этот релиз включает в себя несколько улучшений (добавление парсера HTML в качестве выбираемого парсера, настраиваемого индексирования по полям), новые функции (включая добавление информации о времени выполнения для всех классов инструментов и реализацию таймаутов парсера) и исправления ошибок (исправление NPE в распределенном поиске, исправление проблем с форматированием XML для полей документа). 1.3 2011 06 07 Этот релиз включает в себя несколько улучшений (улучшенная поддержка разбора RSS, более тесная интеграция с Apache Tika, поддержка внешнего разбора, улучшенная идентификация языка и значительно уменьшенный архив исходного кода — всего около 2 МБ). 1.4 2011 11 26 Этот релиз включает в себя несколько улучшений, включая возможность для парсеров объявлять поддержку нескольких типов MIME, настраиваемую глубину очереди Fetcher, улучшения скорости Fetcher, более тесную интеграцию с Tika и поддержку HTTP-аутентификации при индексации в Solr. 1.5 2012 06 07 Этот релиз включает в себя несколько улучшений, включая обновления нескольких основных компонентов, включая Tika 1.1 и Hadoop 1.0.0, улучшения элементов LinkRank и WebGraph, а также ряд новых плагинов для черного списка, фильтрации и разбора. 2.0 2012 07 07 Этот релиз предлагает пользователям версию, ориентированную на крупномасштабный обход, основанную на абстракции хранилища (через Apache Gora) для хранилищ больших данных, таких как Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase, HDFS, хранилище данных в памяти и различные высокопроизводительные SQL-хранилища. 1.5.1 2012 07 10 Этот релиз является релизом поддержки популярной версии 1.5.x основной ветви Nutch, которая широко используется в сообществе. 2.1 2012 10 05 Этот релиз продолжает предоставлять пользователям Nutch упрощенный дистрибутив Nutch, основанный на разработке 2.x, которая набирает популярность в сообществе. Помимо исправления около 20 ошибок, этот релиз также предлагает улучшенные свойства для лучшей конфигурации Solr, обновления различных зависимостей Gora и возможность создания индексов в Elasticsearch. 1.6 2012 12 06 Этот релиз включает в себя более 20 исправлений ошибок, столько же улучшений, а также новые функции, включая новый HostNormalizer, возможность динамически устанавливать fetchInterval по типу MIME и функциональные улучшения API Indexer, включая нормализацию URL-адресов и удаление документов robots.txt с директивой noindex. Другие заметные улучшения включают обновление ключевых зависимостей до Tika 1.2 и Automaton 1.11. 2.2 2013 06 08 Этот релиз включает в себя более 30 исправлений ошибок и более 25 улучшений, представляя собой третий релиз все более популярной серии 2.x Nutch. В этом релизе включены Crawler Commons, которые Nutch теперь использует для улучшения разбора robots.txt, обновления библиотек до Apache Hadoop 1.1.1, Apache Gora 0.3, Apache Tika 1.2 и Automaton 1.11. 1.7 2013 06 24 Этот релиз включает в себя более 20 исправлений ошибок и столько же улучшений; наиболее заметно представлена новая подключаемая архитектура индексации, которая в настоящее время поддерживает Apache Solr и Elasticsearch. После выхода Nutch 2.2 разбор robots.txt теперь делегируется Crawler Commons. Ключевые библиотеки были обновлены до Apache Hadoop 1.2.0 и Apache Tika 1.3. 2.2.1 2013 07 02 Этот релиз включает в себя обновления библиотек до Apache Hadoop 1.2.0 и Apache Tika 1.3, это в основном исправление ошибок для NUTCH-1591: некорректное преобразование ByteBuffer в String. 1.8 2014 03 17 Хотя этот релиз включает в себя обновления библиотек для Crawler Commons 0.3 и Apache Tika 1.5, он также предоставляет более 30 исправлений ошибок и 18 улучшений. 2.3 2015 01 22 Релиз Nutch 2.3 теперь поставляется с автономным веб-приложением на основе Apache Wicket. SQL-бэкенд для Gora устарел. 1.10 2015 05 06 Этот релиз включает в себя обновления библиотек до Tika 1.6, также предоставляет более 46 исправлений ошибок, 37 улучшений и 12 новых функций. 1.11 2015 12 07 Этот релиз включает в себя обновления библиотек Hadoop 2.x и Tika 1.11, также содержит более 32 исправлений ошибок, 35 улучшений и 14 новых функций. 2.3.1 2016 01 21 Этот релиз исправляет около 40 проблем. 1.12 2016 06 18 1.13 2017 04 02 1.14 2017 12 23 1.15 2018 08 09 1.16 2019 10 11 2.4 2019 10 11 Ожидается, что это последний релиз в серии 2.x, поскольку "никто из разработчиков активно над ним не работает". 1.17 2020 07 02 1.18 2021 01 24

Масштабируемость

IBM Research изучила производительность Nutch/Lucene в рамках проекта Commercial Scale Out (CSO). Их исследования показали, что масштабируемая система, такая как Nutch/Lucene, способна достичь уровня производительности на кластере серверов, недостижимого на любом высокопроизводительном компьютере, таком как POWER5. Набор данных ClueWeb09 (используемый, в частности, в TREC) был собран с помощью Nutch со средней скоростью 755,31 документа в секунду.

Связанные проекты

Hadoop – это Java-фреймворк, поддерживающий запуск распределенных приложений на больших кластерах.