Кіріспе
Ашық кодты веб-шолушы 2014 жылдың ақпан айында Common Crawl жобасы өздерінің ашық, кең көлемді веб-шолуы үшін Nutch-ті пайдаланды. Бұрын Nutch жобасының мақсаты жаһандық кең көлемді веб-іздеу жүйесін жасау болған, бірақ қазір бұл мақсат жоқ.
In February 2014 the Common Crawl project adopted Nutch for its open, large scale web crawl. While it was once a goal for the Nutch project to release a global large scale web search engine, that is no longer the case.
Шығару тарихы
1. x тармақ 2. x тармақ шығарылу күні Сипаттамасы 1.1 2010 06 06 Бұл нұсқада Nutch-қа байланысты қолданыстағы кітапханалардың (Hadoop, Solr, Tika және т.б.) бірнеше маңызды жаңартулары бар. Сонымен қатар, әртүрлі қателер түзетілді және жылдамдық арттырылды (мысалы, Fetcher2). 1.2 2010 10 24 Бұл нұсқада бірнеше жақсартулар бар (parse html-ді тағы да таңдалатын талдаушы ретінде қосу, әр өріс бойынша индекстеуді конфигурациялау), жаңа мүмкіндіктер (барлық Құралдар кластарына уақыт туралы ақпаратты қосу және талдаушы уақыт шегін іске асыру) және қателерді түзету (таратылған іздеудегі NPE-ді түзету, Құжат өрістері бойынша XML пішімдеу мәселелерін түзету) кірді. 1.3 2011 06 07 Бұл нұсқада бірнеше жақсартулар бар (RSS талдауын жақсарту, Apache Tika-мен тығыз интеграция, сыртқы талдау қолдауы, тілді анықтауды жақсарту және әлдеқайда кішірек кодтық таралым – шамамен 2 МБ). 1.4 2011 11 26 Бұл нұсқада бірнеше жақсартулар бар, соның ішінде Parsers-ке бірнеше MIME түрлерін қолдауға мүмкіндік беру, Fetcher Queue тереңдігін конфигурациялау, Fetcher жылдамдығын жақсарту, тығыз Tika интеграциясы және Solr индекстеуінде HTTP авторизациясын қолдау. 1.5 2012 06 07 Бұл нұсқада бірнеше жақсартулар бар, соның ішінде Tika 1.1 және Hadoop 1.0.0 сияқты бірнеше негізгі компоненттерді жаңарту, LinkRank және WebGraph элементтерін жақсарту, сондай-ақ қара тізімді, сүзгілеуді және талдауды қамтитын бірқатар жаңа плагиндер бар. 2.0 2012 07 07 Бұл нұсқа пайдаланушыларға Apache Gora арқылы үлкен деректерді сақтау үшін (Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase, HDFS, жадтағы деректер қоймасы және түрлі жоғары деңгейлі SQL қоймалары) сақтау абстракциясына негізделген ірі масштабтағы сканерлеуге бағытталған нұсқаны ұсынады. 1.5.1 2012 07 10 Бұл нұсқа танымал 1.5 нұсқасының техникалық қызмет көрсету нұсқасы. X Nutch-тің қауымдастықта кеңінен қолданылатын нұсқасы. 2.1 2012 10 05 Бұл нұсқа Nutch пайдаланушыларына 2.x дамуының негізінде құрылған, қауымдастықта кеңінен танымал болып жатқан қарапайым Nutch таратуын ұсынады. Бұл нұсқада ~20 қателерді түзетумен қатар Solr конфигурациясын жақсарту үшін жақсартылған қасиеттер, Gora-ның әртүрлі тәуелділіктеріне жаңартулар және икемді іздеуде индекстер құру опциясын енгізу ұсынылады. 1.6 2012 12 06 Бұл нұсқада 20-дан астам қателерді түзету, жақсартулар, сондай-ақ жаңа функционалдық мүмкіндіктер бар, соның ішінде жаңа HostNormalizer, MIME түрі бойынша fetchInterval-ді динамикалық түрде орнату мүмкіндігі және индекстеуші API-ге функционалдық жақсартулар, соның ішінде URL-ді қалыпқа келтіру және роботтар noIndex құжаттарын жою. Басқа да елеулі жақсартуларға негізгі тәуелділіктерді Tika 1.2 және Automaton 1.11 8. 2.2 2013 06 08 Бұл нұсқада 30 қателерді түзету және 25 жақсарту бар. Бұл 2.x Nutch сериясының үшінші нұсқасы. Бұл нұсқада Nutch қазір жақсартылған роботтар үшін пайдаланатын Crawler Commons бар. txt талдау, Apache Hadoop 1.1.1, Apache Gora 0.3, Apache Tika 1.2 және Automaton 1.11 8. 1.7 2013 06 24 Бұл нұсқада 20-дан астам қателерді түзету, көптеген жақсартулар бар; ең байқалатын жаңа плагингтік индекстеу архитектурасы бар, ол қазіргі уақытта Apache Solr және Elastic Search-ті қолдайды. Жақында шыққан Nutch 2.2 нұсқасына көлеңке түсіріп, роботтарды талдау. txt енді Crawler Commons-қа берілді. Apache Hadoop 1.2.0 және Apache Tika 1.3 негізгі кітапханаларына жаңартулар енгізілді. 2.2.1 2013 07 02 Бұл нұсқа Apache Hadoop 1.2.0 және Apache Tika 1.3 кітапханаларын жаңартуды қамтиды, негізінен NUTCH 1591 қатесін түзетуге арналған. 1.8 2014 03 17 Бұл нұсқа Crawler Commons 0.3 және Apache Tika 1.5 кітапханаларын жаңартуды қамтыса да, 30 қателерді түзетуді және 18 жақсартуды ұсынады. 2.3 2015 01 22 Nutch 2.3 нұсқасы енді Apache Wicket негізделген веб-қосымшамен бірге шығарылады. Gora-ның SQL-ді пайдалану мерзімі өткен. 1.10 2015 05 06 Бұл нұсқада Tika 1.6 нұсқасына арналған кітапхана жаңартулары бар, сонымен қатар 46 қателерді түзету, сондай-ақ 37 жақсарту мен 12 жаңа мүмкіндіктер ұсынылады. 1.11 2015 12 07 Бұл нұсқада Hadoop 2 кітапханасының жаңартулары бар. X, Tika 1.11, 32 қателерді түзетуге, сондай-ақ 35 жақсартуға және 14 жаңа мүмкіндіктерге мүмкіндік береді. 2.3.1 2016 01 21 Бұл қателерді түзету нұсқасы шамамен 40 мәселені қамтиды. 1.12 2016 06 18 1.13 2017 04 02 1.14 2017 12 23 1.15 2018 08 09 1.16 2019 10 11 2.4 2019 10 11 Бұл 2.x сериясының соңғы нұсқасы болады деп күтілуде, себебі "оның үстінде белсенді жұмыс істейтін ешкім жоқ". 1.17 2020 07 02 1.18 2021 01 24
Branch 2. x
Branch Release date Description 1.1 2010 06 06 This release includes several major upgrades of existing libraries (Hadoop, Solr, Tika, etc.) on which Nutch depends. Various bug fixes, and speedups (e. g., to Fetcher2) have also been included. 1.2 2010 10 24 This release includes several improvements (addition of parse html as a selectable parser again, configurable per field indexing), new features (including adding timing information to all Tool classes, and implementation of parser timeouts), and bug fixes (fixing an NPE in distributed search, fixing of XML formatting issues per Document fields). 1.3 2011 06 07 This release includes several improvements (improved RSS parsing support, tighter integration with Apache Tika, external parsing support, improved language identification and an order of magnitude smaller source release tarball—only about 2 MB). 1.4 2011 11 26 This release includes several improvements including allowing Parsers to declare support for multiple MIME types, configurable Fetcher Queue depth, Fetcher speed improvements, tighter Tika integration, and support for HTTP auth in Solr indexing. 1.5 2012 06 07 This release includes several improvements including upgrades of several major components including Tika 1.1 and Hadoop 1.0.0, improvements to LinkRank and WebGraph elements as well as a number of new plugins covering blacklisting, filtering and parsing to name a few. 2.0 2012 07 07 This release offers users an edition focused on large scale crawling which builds on storage abstraction (via Apache Gora) for big data stores such as Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase, HDFS, an in memory data store and various high profile SQL stores. 1.5.1 2012 07 10 This release is a maintenance release of the popular 1.5. X mainstream version of Nutch which has been widely adopted within the community. 2.1 2012 10 05 This release continues to provide Nutch users with a simplified Nutch distribution building on the 2. x development drive which is growing in popularity amongst the community. As well as addressing ~20 bugs this release also offers improved properties for better Solr configuration, upgrades to various Gora dependencies and the introduction of the option to build indexes in elastic search. 1.6 2012 12 06 This release includes over 20 bug fixes, the same in improvements, as well as new functionalities including a new HostNormalizer, the ability to dynamically set fetchInterval by MIME type and functional enhancements to the Indexer API including the normalization of URLs and the deletion of robots noIndex documents. Other notable improvements include the upgrade of key dependencies to Tika 1.2 and Automaton 1.11 8. 2.2 2013 06 08 This release includes over 30 bug fixes and over 25 improvements representing the third release of increasingly popular 2. x Nutch series. This release features inclusion of Crawler Commons which Nutch now utilizes for improved robots. txt parsing, library upgrades to Apache Hadoop 1.1.1, Apache Gora 0.3, Apache Tika 1.2 and Automaton 1.11 8. 1.7 2013 06 24 This release includes over 20 bug fixes, as many improvements; most noticeably featuring a new pluggable indexing architecture which currently supports Apache Solr and Elastic Search. Shadowing the recent Nutch 2.2 release, parsing of Robots. txt is now delegated to Crawler Commons. Key library upgrades have been made to Apache Hadoop 1.2.0 and Apache Tika 1.3. 2.2.1 2013 07 02 This release includes library upgrades to Apache Hadoop 1.2.0 and Apache Tika 1.3, it is predominantly a bug fix for NUTCH 1591 Incorrect conversion of ByteBuffer to String. 1.8 2014 03 17 Although this release includes library upgrades to Crawler Commons 0.3 and Apache Tika 1.5, it also provides over 30 bug fixes as well as 18 improvements. 2.3 2015 01 22 Nutch 2.3 release now comes packaged with a self contained Apache Wicket based Web Application. The SQL backend for Gora has been deprecated. 1.10 2015 05 06 This release includes library upgrades to Tika 1.6, also provides over 46 bug fixes as well as 37 improvements and 12 new features. 1.11 2015 12 07 This release includes library upgrades to Hadoop 2. X, Tika 1.11, also provides over 32 bug fixes as well as 35 improvements and 14 new features.2.3.12016 01 21This bug fix release contains around 40 issues addressed.1.122016 06 181.132017 04 021.142017 12 231.152018 08 091.162019 10 112.42019 10 11Expected to be the last release on the 2. X series, as "no committer is actively working on it".1.172020 07 021.182021 01 24
Өлшегіштігі
IBM Research компаниясы Commercial Scale Out (CSO) жобасы аясында Nutch/Lucene жүйесінің жұмысын зерттеді. Олардың қорытындысы бойынша, Nutch/Lucene сияқты кеңейтілген жүйе, бледтерден құралған кластерде POWER5 сияқты бір машинаны кеңейту арқылы қол жеткізе алмайтын өнімділік деңгейіне жете алады. ClueWeb09 деректер жинағы (мысалы, TREC-те қолданылады) Nutch арқылы жиналды, орташа жылдамдығы секундына 755,31 құжатты құрады.
Қатысушы жобалар
Hadoop – Java фреймворкі, үлкен кластерлерде таратылған қосымшаларды іске қосуды қолдайды.