Введение
Сервис от Google
Google's book search engine
Google Books (previously known as Google Book Search, Google Print, and by its code name Project Ocean) is a service from Google that searches the full text of books and magazines that Google has scanned, converted to text using optical character recognition (OCR), and stored in its digital database. Books are provided either by publishers and authors through the Google Books Partner Program, or by Google's library partners through the Library Project. The Publisher Program was first known as Google Print when it was introduced at the Frankfurt Book Fair in October 2004. The Google Books Library Project, which scans works in the collections of library partners and adds them to the digital inventory, was announced in December 2004. The Google Books initiative has been hailed for its potential to offer unprecedented access to what may become the largest online body of human knowledge and promoting the democratization of knowledge. However, it has also been criticized for potential copyright violations,
Google estimated in 2010 that there were about 130 million distinct titles in the world, and stated that it intended to scan all of them. Google Book's scanning efforts have been subject to litigation, including Authors Guild v. Google, a class action lawsuit in the United States, decided in Google's favor (see below). This was a major case that came close to changing copyright practices for orphan works in the United States.
Поисковая система книг Google
Google's book search engine
Google Books (previously known as Google Book Search, Google Print, and by its code name Project Ocean) is a service from Google that searches the full text of books and magazines that Google has scanned, converted to text using optical character recognition (OCR), and stored in its digital database. Books are provided either by publishers and authors through the Google Books Partner Program, or by Google's library partners through the Library Project. The Publisher Program was first known as Google Print when it was introduced at the Frankfurt Book Fair in October 2004. The Google Books Library Project, which scans works in the collections of library partners and adds them to the digital inventory, was announced in December 2004. The Google Books initiative has been hailed for its potential to offer unprecedented access to what may become the largest online body of human knowledge and promoting the democratization of knowledge. However, it has also been criticized for potential copyright violations,
Google estimated in 2010 that there were about 130 million distinct titles in the world, and stated that it intended to scan all of them. Google Book's scanning efforts have been subject to litigation, including Authors Guild v. Google, a class action lawsuit in the United States, decided in Google's favor (see below). This was a major case that came close to changing copyright practices for orphan works in the United States.
Google Books (ранее известная как Google Book Search, Google Print и под кодовым названием Project Ocean) — это сервис от Google, который осуществляет поиск по полному тексту книг и журналов, отсканированных Google, преобразованных в текст с использованием оптического распознавания символов (OCR) и сохраненных в его цифровой базе данных. Книги предоставляются издателями и авторами через партнерскую программу Google Books или библиотечными партнерами Google в рамках Библиотечного проекта. Программа для издателей впервые была известна как Google Print, когда её представили на Франкфуртской книжной ярмарке в октябре 2004 года. Библиотечный проект Google Books, который сканирует произведения из коллекций библиотечных партнеров и добавляет их в цифровой каталог, был объявлен в декабре 2004 года. Инициатива Google Books получила высокую оценку за свой потенциал в обеспечении беспрецедентного доступа к тому, что может стать крупнейшим в мире онлайн-хранилищем человеческих знаний, и за содействие демократизации знаний. Однако она также подверглась критике за возможное нарушение авторских прав.
Google's book search engine
Google Books (previously known as Google Book Search, Google Print, and by its code name Project Ocean) is a service from Google that searches the full text of books and magazines that Google has scanned, converted to text using optical character recognition (OCR), and stored in its digital database. Books are provided either by publishers and authors through the Google Books Partner Program, or by Google's library partners through the Library Project. The Publisher Program was first known as Google Print when it was introduced at the Frankfurt Book Fair in October 2004. The Google Books Library Project, which scans works in the collections of library partners and adds them to the digital inventory, was announced in December 2004. The Google Books initiative has been hailed for its potential to offer unprecedented access to what may become the largest online body of human knowledge and promoting the democratization of knowledge. However, it has also been criticized for potential copyright violations,
Google estimated in 2010 that there were about 130 million distinct titles in the world, and stated that it intended to scan all of them. Google Book's scanning efforts have been subject to litigation, including Authors Guild v. Google, a class action lawsuit in the United States, decided in Google's favor (see below). This was a major case that came close to changing copyright practices for orphan works in the United States.
В 2010 году Google оценил общее количество различных названий книг в мире примерно в 130 миллионов и заявил о намерении отсканировать их все. Усилия Google по сканированию книг стали предметом судебных разбирательств, включая дело Authors Guild v. Google, коллективный иск в Соединенных Штатах, который был решен в пользу Google (см. ниже). Это было знаковое дело, которое почти привело к изменению практики авторского права в отношении невостребованных произведений в Соединенных Штатах.
Google's book search engine
Google Books (previously known as Google Book Search, Google Print, and by its code name Project Ocean) is a service from Google that searches the full text of books and magazines that Google has scanned, converted to text using optical character recognition (OCR), and stored in its digital database. Books are provided either by publishers and authors through the Google Books Partner Program, or by Google's library partners through the Library Project. The Publisher Program was first known as Google Print when it was introduced at the Frankfurt Book Fair in October 2004. The Google Books Library Project, which scans works in the collections of library partners and adds them to the digital inventory, was announced in December 2004. The Google Books initiative has been hailed for its potential to offer unprecedented access to what may become the largest online body of human knowledge and promoting the democratization of knowledge. However, it has also been criticized for potential copyright violations,
Google estimated in 2010 that there were about 130 million distinct titles in the world, and stated that it intended to scan all of them. Google Book's scanning efforts have been subject to litigation, including Authors Guild v. Google, a class action lawsuit in the United States, decided in Google's favor (see below). This was a major case that came close to changing copyright practices for orphan works in the United States.
Сканирование книг
Проект начался в 2002 году под кодовым названием Project Ocean. Соучредитель Google Ларри Пейдж всегда проявлял интерес к оцифровке книг. Когда он и Марисса Майер начали экспериментировать со сканированием книг в 2002 году, им требовалось 40 минут для оцифровки 300-страничной книги. Но вскоре технология была развита до такой степени, что операторы сканирования могли сканировать до 6000 страниц в час. Многие книги сканируются с помощью специально разработанной камеры Elphel 323 со скоростью 1000 страниц в час. Патент, выданный Google в 2009 году, показал, что компания разработала инновационную систему сканирования книг, использующую две камеры и инфракрасный свет для автоматической коррекции искривления страниц. Создавая трехмерную модель каждой страницы и затем "выравнивая" ее, Google может представлять страницы, выглядящие плоскими, без необходимости физически разглаживать страницы, что потребовало бы использования разрушительных методов, таких как отделение переплета или использование стеклянных пластин для индивидуального разглаживания каждой страницы, что неэффективно при крупномасштабном сканировании. Google решил отказаться от цветовой информации в пользу более высокого пространственного разрешения, поскольку большинство книг, срок действия авторских прав на которые истек, в то время не содержали цветных изображений. Каждое изображение страницы обрабатывалось алгоритмами, которые различали текстовые и иллюстративные области. Текстовые области затем обрабатывались с помощью OCR для обеспечения полнотекстового поиска. Google приложил значительные усилия для разработки оптимальных методов сжатия, стремясь к высокому качеству изображения при минимальном размере файлов, чтобы обеспечить доступ пользователям Интернета с низкой пропускной способностью.
Функциональность веб-сайта
Для каждой работы Google Книги автоматически генерирует страницу обзора. На этой странице отображается информация, извлеченная из книги — ее библиографические данные, карта наиболее часто встречающихся слов, оглавление, а также дополнительный материал, такой как краткое содержание, отзывы читателей (недоступные в мобильной версии сайта) и ссылки на другие релевантные тексты. Посетитель страницы, например, может увидеть список книг со схожим жанром и тематикой или список современных исследований, посвященных этой книге. Более того, этот контент предоставляет интерактивные возможности для пользователей, вошедших в свою учетную запись Google: они могут экспортировать библиографические данные и цитаты в стандартных форматах, писать собственные рецензии, добавлять книгу в свою библиотеку для присвоения меток, организации и обмена с другими. Таким образом, Google Книги собирает эти интерпретативные элементы из различных источников, включая пользователей, сторонние сайты, такие как Goodreads, а также часто автора и издателя книги. Фактически, чтобы стимулировать авторов к загрузке собственных книг, Google добавил на сайт несколько функций. Авторы могут разрешить посетителям бесплатно скачивать свою электронную книгу или устанавливать собственную цену продажи. Они могут изменять цену и предлагать скидки по своему усмотрению. Кроме того, если автор книги укажет номер ISBN, LCCN или OCLC, сервис обновит URL-адрес книги, включив его в ссылку. Затем автор может установить конкретную страницу в качестве точки привязки ссылки, что облегчает поиск его книги.
Просмотрник Ngram
Ngram Viewer — это сервис, связанный с Google Books, который отображает частоту употребления слов в их книжном собрании в виде графиков. Этот инструмент важен для историков и лингвистов, поскольку позволяет получить представление о развитии человеческой культуры через изменение использования слов на протяжении времени. Эта программа подвергалась критике из-за ошибок в метаданных, используемых для её работы.
Ошибки сканирования
Процесс сканирования подвержен ошибкам. Например, некоторые страницы могут быть нечитаемыми, перевернутыми или расположены в неправильном порядке. Исследователи даже сообщали о помятых страницах, частично скрытых пальцах и размытых или смазанных изображениях. По этому поводу в декларации Google, размещенной в конце сканированных книг, говорится:
В 2009 году Google заявил о начале использования reCAPTCHA для исправления ошибок, обнаруженных при сканировании книг Google Books. Этот метод позволит улучшить распознавание слов, которые сложно прочитать из-за процесса сканирования, но не решит проблемы, связанные с перевернутыми страницами или заслоненными словами. Ошибки сканирования послужили вдохновением для создания произведений искусства, таких как опубликованные сборники аномальных страниц и блог в Tumblr.
Ошибки в метаданных
Ученые часто сообщают о многочисленных ошибках в метаданных Google Books, включая неверно указанных авторов и ошибочные даты публикации. Джеффри Нунберг, лингвист, изучающий изменения в употреблении слов с течением времени, заметил, что поиск книг, опубликованных до 1950 года и содержащих слово "интернет", выдал невероятные 527 результатов. Вуди Аллен упоминается в 325 книгах, предположительно опубликованных до его рождения. Google ответил Нунбергу, возложив вину за большинство ошибок на сторонних подрядчиков. Среди других ошибок в метаданных отмечаются даты публикации, предшествующие рождению автора (например, 182 работы Чарльза Диккенса до его рождения в 1812 году); неверные тематические классификации (издание «Моби Дика», найденное в разделе «компьютеры», биография Мэй Уэст, классифицированная как «религия»), противоречивые классификации (10 изданий «Листьев травы» Уитмена, все классифицированные одновременно как «художественная литература» и «нон-фикшн»), неправильно написанные названия, имена авторов и названия издательств («Моби Дик, или Белый «Вал»»), а также метаданные одной книги, ошибочно прикрепленные к совершенно другой книге (метаданные математического труда 1818 года ведут к любовному роману 1963 года). Был проведен анализ метаданных, включающих автора, название, издателя и год публикации, для 400 случайно выбранных записей Google Books. Результаты показали, что 36% книг, вошедших в проект оцифровки, содержали ошибки в метаданных. Этот процент ошибок выше, чем можно было бы ожидать в типичном онлайн-каталоге библиотеки. Общий уровень ошибок в 36,75%, выявленный в данном исследовании, свидетельствует о высокой частоте ошибок в метаданных Google Books. Хотя разграничение между «серьезными» и «незначительными» ошибками является субъективным и основано на довольно неопределенном понятии «находимости», все ошибки, обнаруженные в четырех элементах метаданных, рассмотренных в этом исследовании, следует считать серьезными.
Языковые проблемы
Некоторые европейские политики и интеллектуалы критикуют усилия Google, мотивируя это соображениями лингвистического империализма. Они утверждают, что поскольку подавляющее большинство книг, предлагаемых для оцифровки, написано на английском языке, это приведет к непропорциональному представлению языков в цифровом мире. Немецкий, русский, французский и испанский, например, широко используются в научных исследованиях. Однако чрезмерный акцент на английском языке в сети может повлиять на доступ к историческим научным трудам и, в конечном итоге, на развитие и направление будущих исследований. Среди критиков – Жан Ноэль Жаннени, бывший президент Национальной библиотеки Франции.
Книги Google против Ученого Google
Хотя Google Books оцифровал большое количество старых выпусков журналов, его сканы не содержат метаданных, необходимых для идентификации конкретных статей в определенных номерах. Это побудило разработчиков Google Scholar начать собственную программу по оцифровке и хостингу старых журнальных статей (с согласия издателей).
Статус
Google хранит в секрете свои планы относительно будущего проекта Google Books. Операции по сканированию замедлялись как минимум с 2012 года, что подтвердили библиотекари нескольких партнерских учреждений Google. В Университете Висконсина скорость снизилась более чем вдвое по сравнению с 2006 годом. Однако библиотекари отметили, что замедление темпов может быть естественным следствием развития проекта – изначально для сканирования отбирались целые стопки книг, в то время как сейчас необходимо рассматривать только те названия, которые еще не были отсканированы. На странице с хронологией проекта Google Books на сайте компании не было информации после 2007 года даже в 2017 году, а блог Google Books был объединен с блогом Google Search в 2012 году.
Юридические вопросы
В рамках проекта библиотечные книги оцифровывались довольно безразборно, независимо от статуса авторского права, что привело к ряду судебных исков против Google. К концу 2008 года Google оцифровал более семи миллионов книг, из которых только около миллиона были произведениями, находящимися в общественном достоянии. Из оставшихся, один миллион был защищен авторским правом и издавался, а пять миллионов были защищены авторским правом, но были сняты с печати. В 2005 году группа авторов и издателей подала крупный групповой иск против Google за нарушение авторских прав. Google утверждал, что он сохраняет "сиротские произведения" – книги, на которые все еще распространяются авторские права, но правообладателей которых не удалось установить. Гильдия авторов и Ассоциация американских издателей подали в суд на Google в 2005 году по поводу его книжного проекта, ссылаясь на "масштабное нарушение авторских прав". Google возразил, что его проект представляет собой добросовестное использование и является цифровым эквивалентом карточного каталога, где каждое слово в публикации проиндексировано. Издатели вскоре после этого урегулировали вопрос с Google. Гильдия авторов продолжила судебное разбирательство, и в 2011 году их предложенная группа была сертифицирована. Google обжаловал это решение, и ряд сторонних наблюдателей заявили о неадекватности группы, после чего Второй апелляционный суд отклонил сертификацию группы в июле 2013 года, направив дело в окружной суд для рассмотрения аргумента Google о добросовестном использовании. В 2015 году Гильдия авторов подала еще одну апелляцию против Google, которую должен был рассмотреть Второй окружной апелляционный суд США в Нью-Йорке. Google единогласно выиграл дело, основываясь на том, что он не демонстрировал людям полные тексты, а только фрагменты, и не позволял людям незаконно читать книги. В отчете суды заявили, что не нарушили законы об авторском праве, поскольку их действия подпадали под положение о добросовестном использовании. Гильдия авторов снова попыталась обжаловать решение в 2016 году и обратилась в Верховный суд. Дело было отклонено, решение Второго апелляционного суда осталось в силе, что означает, что Google не нарушил законы об авторском праве. Это дело также создало прецедент для других подобных дел, касающихся добросовестного использования, поскольку оно дополнительно уточнило и расширило закон. Такое уточнение влияет на другие проекты сканирования, подобные проекту Google. В июне 2006 года Hervé de la Martinière, французский издатель, известный как La Martinière и Éditions du Seuil, объявил о своем намерении подать в суд на Google France. В 2009 году Парижский гражданский суд присудил 300 000 евро (приблизительно 430 000 долларов США) в качестве компенсации ущерба и процентов и обязал Google выплачивать 10 000 евро в день, пока он не удалит книги издателя из своей базы данных. Суд постановил, что "Google нарушил авторские права, полностью воспроизводя и делая доступными" книги, принадлежащие Seuil, без его разрешения. Также в ноябре того же года Китайское общество защиты авторских прав на произведения литературы и искусства (CWWCS) обвинило Google в сканировании 18 000 книг 570 китайских писателей без разрешения. 20 ноября Google согласился предоставить список отсканированных китайских книг, но компания отказалась признать, что "нарушила" законы об авторском праве. В марте 2007 года Томас Рубин, заместитель генерального советника по вопросам авторских прав, товарных знаков и коммерческой тайны в Microsoft, обвинил Google в нарушении закона об авторском праве с помощью своей службы поиска книг. Рубин особенно критиковал политику Google по свободному копированию любых произведений до тех пор, пока правообладатель не потребует прекратить это. Лицензирование Google произведений, находящихся в общественном достоянии, также вызывает опасения из-за использования методов цифровой водяной маркировки для книг. Некоторые опубликованные произведения, находящиеся в общественном достоянии, такие как все произведения, созданные федеральным правительством США, по-прежнему рассматриваются как произведения, защищенные авторским правом, и поэтому заблокированы после 1922 года.
In March 2007, Thomas Rubin, associate general counsel for copyright, trademark, and trade secrets at Microsoft, accused Google of violating copyright law with their book search service. Rubin specifically criticized Google's policy of freely copying any work until notified by the copyright holder to stop. Google licensing of public domain works is also an area of concern due to using of digital watermarking techniques with the books. Some published works that are in the public domain, such as all works created by the U. S. Federal government, are still treated like other works under copyright, and therefore locked after 1922.