Введение
В феврале 2014 года проект Common Crawl использовал Nutch для своего открытого, масштабного обхода веб-сайтов. Хотя ранее проект Nutch ставил целью выпуск глобальной, крупномасштабной поисковой системы, сейчас это уже не является его целью.
In February 2014 the Common Crawl project adopted Nutch for its open, large scale web crawl. While it was once a goal for the Nutch project to release a global large scale web search engine, that is no longer the case.
История релизов
1. x Ветвь 2. x Ветвь Дата выпуска Описание 1.1 2010 06 06 Этот релиз включает в себя несколько основных обновлений существующих библиотек (Hadoop, Solr, Tika и т. д.), от которых зависит Nutch. Также включены различные исправления ошибок и оптимизации (например, для Fetcher2). 1.2 2010 10 24 Этот релиз включает в себя несколько улучшений (добавление парсера HTML в качестве выбираемого парсера, настраиваемого индексирования по полям), новые функции (включая добавление информации о времени выполнения для всех классов инструментов и реализацию таймаутов парсера) и исправления ошибок (исправление NPE в распределенном поиске, исправление проблем с форматированием XML для полей документа). 1.3 2011 06 07 Этот релиз включает в себя несколько улучшений (улучшенная поддержка разбора RSS, более тесная интеграция с Apache Tika, поддержка внешнего разбора, улучшенная идентификация языка и значительно уменьшенный архив исходного кода — всего около 2 МБ). 1.4 2011 11 26 Этот релиз включает в себя несколько улучшений, включая возможность для парсеров объявлять поддержку нескольких типов MIME, настраиваемую глубину очереди Fetcher, улучшения скорости Fetcher, более тесную интеграцию с Tika и поддержку HTTP-аутентификации при индексации в Solr. 1.5 2012 06 07 Этот релиз включает в себя несколько улучшений, включая обновления нескольких основных компонентов, включая Tika 1.1 и Hadoop 1.0.0, улучшения элементов LinkRank и WebGraph, а также ряд новых плагинов для черного списка, фильтрации и разбора. 2.0 2012 07 07 Этот релиз предлагает пользователям версию, ориентированную на крупномасштабный обход, основанную на абстракции хранилища (через Apache Gora) для хранилищ больших данных, таких как Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase, HDFS, хранилище данных в памяти и различные высокопроизводительные SQL-хранилища. 1.5.1 2012 07 10 Этот релиз является релизом поддержки популярной версии 1.5.x основной ветви Nutch, которая широко используется в сообществе. 2.1 2012 10 05 Этот релиз продолжает предоставлять пользователям Nutch упрощенный дистрибутив Nutch, основанный на разработке 2.x, которая набирает популярность в сообществе. Помимо исправления около 20 ошибок, этот релиз также предлагает улучшенные свойства для лучшей конфигурации Solr, обновления различных зависимостей Gora и возможность создания индексов в Elasticsearch. 1.6 2012 12 06 Этот релиз включает в себя более 20 исправлений ошибок, столько же улучшений, а также новые функции, включая новый HostNormalizer, возможность динамически устанавливать fetchInterval по типу MIME и функциональные улучшения API Indexer, включая нормализацию URL-адресов и удаление документов robots.txt с директивой noindex. Другие заметные улучшения включают обновление ключевых зависимостей до Tika 1.2 и Automaton 1.11. 2.2 2013 06 08 Этот релиз включает в себя более 30 исправлений ошибок и более 25 улучшений, представляя собой третий релиз все более популярной серии 2.x Nutch. В этом релизе включены Crawler Commons, которые Nutch теперь использует для улучшения разбора robots.txt, обновления библиотек до Apache Hadoop 1.1.1, Apache Gora 0.3, Apache Tika 1.2 и Automaton 1.11. 1.7 2013 06 24 Этот релиз включает в себя более 20 исправлений ошибок и столько же улучшений; наиболее заметно представлена новая подключаемая архитектура индексации, которая в настоящее время поддерживает Apache Solr и Elasticsearch. После выхода Nutch 2.2 разбор robots.txt теперь делегируется Crawler Commons. Ключевые библиотеки были обновлены до Apache Hadoop 1.2.0 и Apache Tika 1.3. 2.2.1 2013 07 02 Этот релиз включает в себя обновления библиотек до Apache Hadoop 1.2.0 и Apache Tika 1.3, это в основном исправление ошибок для NUTCH-1591: некорректное преобразование ByteBuffer в String. 1.8 2014 03 17 Хотя этот релиз включает в себя обновления библиотек для Crawler Commons 0.3 и Apache Tika 1.5, он также предоставляет более 30 исправлений ошибок и 18 улучшений. 2.3 2015 01 22 Релиз Nutch 2.3 теперь поставляется с автономным веб-приложением на основе Apache Wicket. SQL-бэкенд для Gora устарел. 1.10 2015 05 06 Этот релиз включает в себя обновления библиотек до Tika 1.6, также предоставляет более 46 исправлений ошибок, 37 улучшений и 12 новых функций. 1.11 2015 12 07 Этот релиз включает в себя обновления библиотек Hadoop 2.x и Tika 1.11, также содержит более 32 исправлений ошибок, 35 улучшений и 14 новых функций. 2.3.1 2016 01 21 Этот релиз исправляет около 40 проблем. 1.12 2016 06 18 1.13 2017 04 02 1.14 2017 12 23 1.15 2018 08 09 1.16 2019 10 11 2.4 2019 10 11 Ожидается, что это последний релиз в серии 2.x, поскольку "никто из разработчиков активно над ним не работает". 1.17 2020 07 02 1.18 2021 01 24
Branch 2. x
Branch Release date Description 1.1 2010 06 06 This release includes several major upgrades of existing libraries (Hadoop, Solr, Tika, etc.) on which Nutch depends. Various bug fixes, and speedups (e. g., to Fetcher2) have also been included. 1.2 2010 10 24 This release includes several improvements (addition of parse html as a selectable parser again, configurable per field indexing), new features (including adding timing information to all Tool classes, and implementation of parser timeouts), and bug fixes (fixing an NPE in distributed search, fixing of XML formatting issues per Document fields). 1.3 2011 06 07 This release includes several improvements (improved RSS parsing support, tighter integration with Apache Tika, external parsing support, improved language identification and an order of magnitude smaller source release tarball—only about 2 MB). 1.4 2011 11 26 This release includes several improvements including allowing Parsers to declare support for multiple MIME types, configurable Fetcher Queue depth, Fetcher speed improvements, tighter Tika integration, and support for HTTP auth in Solr indexing. 1.5 2012 06 07 This release includes several improvements including upgrades of several major components including Tika 1.1 and Hadoop 1.0.0, improvements to LinkRank and WebGraph elements as well as a number of new plugins covering blacklisting, filtering and parsing to name a few. 2.0 2012 07 07 This release offers users an edition focused on large scale crawling which builds on storage abstraction (via Apache Gora) for big data stores such as Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase, HDFS, an in memory data store and various high profile SQL stores. 1.5.1 2012 07 10 This release is a maintenance release of the popular 1.5. X mainstream version of Nutch which has been widely adopted within the community. 2.1 2012 10 05 This release continues to provide Nutch users with a simplified Nutch distribution building on the 2. x development drive which is growing in popularity amongst the community. As well as addressing ~20 bugs this release also offers improved properties for better Solr configuration, upgrades to various Gora dependencies and the introduction of the option to build indexes in elastic search. 1.6 2012 12 06 This release includes over 20 bug fixes, the same in improvements, as well as new functionalities including a new HostNormalizer, the ability to dynamically set fetchInterval by MIME type and functional enhancements to the Indexer API including the normalization of URLs and the deletion of robots noIndex documents. Other notable improvements include the upgrade of key dependencies to Tika 1.2 and Automaton 1.11 8. 2.2 2013 06 08 This release includes over 30 bug fixes and over 25 improvements representing the third release of increasingly popular 2. x Nutch series. This release features inclusion of Crawler Commons which Nutch now utilizes for improved robots. txt parsing, library upgrades to Apache Hadoop 1.1.1, Apache Gora 0.3, Apache Tika 1.2 and Automaton 1.11 8. 1.7 2013 06 24 This release includes over 20 bug fixes, as many improvements; most noticeably featuring a new pluggable indexing architecture which currently supports Apache Solr and Elastic Search. Shadowing the recent Nutch 2.2 release, parsing of Robots. txt is now delegated to Crawler Commons. Key library upgrades have been made to Apache Hadoop 1.2.0 and Apache Tika 1.3. 2.2.1 2013 07 02 This release includes library upgrades to Apache Hadoop 1.2.0 and Apache Tika 1.3, it is predominantly a bug fix for NUTCH 1591 Incorrect conversion of ByteBuffer to String. 1.8 2014 03 17 Although this release includes library upgrades to Crawler Commons 0.3 and Apache Tika 1.5, it also provides over 30 bug fixes as well as 18 improvements. 2.3 2015 01 22 Nutch 2.3 release now comes packaged with a self contained Apache Wicket based Web Application. The SQL backend for Gora has been deprecated. 1.10 2015 05 06 This release includes library upgrades to Tika 1.6, also provides over 46 bug fixes as well as 37 improvements and 12 new features. 1.11 2015 12 07 This release includes library upgrades to Hadoop 2. X, Tika 1.11, also provides over 32 bug fixes as well as 35 improvements and 14 new features.2.3.12016 01 21This bug fix release contains around 40 issues addressed.1.122016 06 181.132017 04 021.142017 12 231.152018 08 091.162019 10 112.42019 10 11Expected to be the last release on the 2. X series, as "no committer is actively working on it".1.172020 07 021.182021 01 24
Масштабируемость
IBM Research изучила производительность Nutch/Lucene в рамках проекта Commercial Scale Out (CSO). Их исследования показали, что масштабируемая система, такая как Nutch/Lucene, способна достичь уровня производительности на кластере серверов, недостижимого на любом высокопроизводительном компьютере, таком как POWER5. Набор данных ClueWeb09 (используемый, в частности, в TREC) был собран с помощью Nutch со средней скоростью 755,31 документа в секунду.
Связанные проекты
Hadoop – это Java-фреймворк, поддерживающий запуск распределенных приложений на больших кластерах.