Введение

Сервис от Google

Поисковая система книг Google

Google Books (ранее известная как Google Book Search, Google Print и под кодовым названием Project Ocean) — это сервис от Google, который осуществляет поиск по полному тексту книг и журналов, отсканированных Google, преобразованных в текст с использованием оптического распознавания символов (OCR) и сохраненных в его цифровой базе данных. Книги предоставляются издателями и авторами через партнерскую программу Google Books или библиотечными партнерами Google в рамках Библиотечного проекта. Программа для издателей впервые была известна как Google Print, когда её представили на Франкфуртской книжной ярмарке в октябре 2004 года. Библиотечный проект Google Books, который сканирует произведения из коллекций библиотечных партнеров и добавляет их в цифровой каталог, был объявлен в декабре 2004 года. Инициатива Google Books получила высокую оценку за свой потенциал в обеспечении беспрецедентного доступа к тому, что может стать крупнейшим в мире онлайн-хранилищем человеческих знаний, и за содействие демократизации знаний. Однако она также подверглась критике за возможное нарушение авторских прав.

В 2010 году Google оценил общее количество различных названий книг в мире примерно в 130 миллионов и заявил о намерении отсканировать их все. Усилия Google по сканированию книг стали предметом судебных разбирательств, включая дело Authors Guild v. Google, коллективный иск в Соединенных Штатах, который был решен в пользу Google (см. ниже). Это было знаковое дело, которое почти привело к изменению практики авторского права в отношении невостребованных произведений в Соединенных Штатах.

Сканирование книг

Проект начался в 2002 году под кодовым названием Project Ocean. Соучредитель Google Ларри Пейдж всегда проявлял интерес к оцифровке книг. Когда он и Марисса Майер начали экспериментировать со сканированием книг в 2002 году, им требовалось 40 минут для оцифровки 300-страничной книги. Но вскоре технология была развита до такой степени, что операторы сканирования могли сканировать до 6000 страниц в час. Многие книги сканируются с помощью специально разработанной камеры Elphel 323 со скоростью 1000 страниц в час. Патент, выданный Google в 2009 году, показал, что компания разработала инновационную систему сканирования книг, использующую две камеры и инфракрасный свет для автоматической коррекции искривления страниц. Создавая трехмерную модель каждой страницы и затем "выравнивая" ее, Google может представлять страницы, выглядящие плоскими, без необходимости физически разглаживать страницы, что потребовало бы использования разрушительных методов, таких как отделение переплета или использование стеклянных пластин для индивидуального разглаживания каждой страницы, что неэффективно при крупномасштабном сканировании. Google решил отказаться от цветовой информации в пользу более высокого пространственного разрешения, поскольку большинство книг, срок действия авторских прав на которые истек, в то время не содержали цветных изображений. Каждое изображение страницы обрабатывалось алгоритмами, которые различали текстовые и иллюстративные области. Текстовые области затем обрабатывались с помощью OCR для обеспечения полнотекстового поиска. Google приложил значительные усилия для разработки оптимальных методов сжатия, стремясь к высокому качеству изображения при минимальном размере файлов, чтобы обеспечить доступ пользователям Интернета с низкой пропускной способностью.

Функциональность веб-сайта

Для каждой работы Google Книги автоматически генерирует страницу обзора. На этой странице отображается информация, извлеченная из книги — ее библиографические данные, карта наиболее часто встречающихся слов, оглавление, а также дополнительный материал, такой как краткое содержание, отзывы читателей (недоступные в мобильной версии сайта) и ссылки на другие релевантные тексты. Посетитель страницы, например, может увидеть список книг со схожим жанром и тематикой или список современных исследований, посвященных этой книге. Более того, этот контент предоставляет интерактивные возможности для пользователей, вошедших в свою учетную запись Google: они могут экспортировать библиографические данные и цитаты в стандартных форматах, писать собственные рецензии, добавлять книгу в свою библиотеку для присвоения меток, организации и обмена с другими. Таким образом, Google Книги собирает эти интерпретативные элементы из различных источников, включая пользователей, сторонние сайты, такие как Goodreads, а также часто автора и издателя книги. Фактически, чтобы стимулировать авторов к загрузке собственных книг, Google добавил на сайт несколько функций. Авторы могут разрешить посетителям бесплатно скачивать свою электронную книгу или устанавливать собственную цену продажи. Они могут изменять цену и предлагать скидки по своему усмотрению. Кроме того, если автор книги укажет номер ISBN, LCCN или OCLC, сервис обновит URL-адрес книги, включив его в ссылку. Затем автор может установить конкретную страницу в качестве точки привязки ссылки, что облегчает поиск его книги.

Просмотрник Ngram

Ngram Viewer — это сервис, связанный с Google Books, который отображает частоту употребления слов в их книжном собрании в виде графиков. Этот инструмент важен для историков и лингвистов, поскольку позволяет получить представление о развитии человеческой культуры через изменение использования слов на протяжении времени. Эта программа подвергалась критике из-за ошибок в метаданных, используемых для её работы.

Ошибки сканирования

Процесс сканирования подвержен ошибкам. Например, некоторые страницы могут быть нечитаемыми, перевернутыми или расположены в неправильном порядке. Исследователи даже сообщали о помятых страницах, частично скрытых пальцах и размытых или смазанных изображениях. По этому поводу в декларации Google, размещенной в конце сканированных книг, говорится:

В 2009 году Google заявил о начале использования reCAPTCHA для исправления ошибок, обнаруженных при сканировании книг Google Books. Этот метод позволит улучшить распознавание слов, которые сложно прочитать из-за процесса сканирования, но не решит проблемы, связанные с перевернутыми страницами или заслоненными словами. Ошибки сканирования послужили вдохновением для создания произведений искусства, таких как опубликованные сборники аномальных страниц и блог в Tumblr.

Ошибки в метаданных

Ученые часто сообщают о многочисленных ошибках в метаданных Google Books, включая неверно указанных авторов и ошибочные даты публикации. Джеффри Нунберг, лингвист, изучающий изменения в употреблении слов с течением времени, заметил, что поиск книг, опубликованных до 1950 года и содержащих слово "интернет", выдал невероятные 527 результатов. Вуди Аллен упоминается в 325 книгах, предположительно опубликованных до его рождения. Google ответил Нунбергу, возложив вину за большинство ошибок на сторонних подрядчиков. Среди других ошибок в метаданных отмечаются даты публикации, предшествующие рождению автора (например, 182 работы Чарльза Диккенса до его рождения в 1812 году); неверные тематические классификации (издание «Моби Дика», найденное в разделе «компьютеры», биография Мэй Уэст, классифицированная как «религия»), противоречивые классификации (10 изданий «Листьев травы» Уитмена, все классифицированные одновременно как «художественная литература» и «нон-фикшн»), неправильно написанные названия, имена авторов и названия издательств («Моби Дик, или Белый «Вал»»), а также метаданные одной книги, ошибочно прикрепленные к совершенно другой книге (метаданные математического труда 1818 года ведут к любовному роману 1963 года). Был проведен анализ метаданных, включающих автора, название, издателя и год публикации, для 400 случайно выбранных записей Google Books. Результаты показали, что 36% книг, вошедших в проект оцифровки, содержали ошибки в метаданных. Этот процент ошибок выше, чем можно было бы ожидать в типичном онлайн-каталоге библиотеки. Общий уровень ошибок в 36,75%, выявленный в данном исследовании, свидетельствует о высокой частоте ошибок в метаданных Google Books. Хотя разграничение между «серьезными» и «незначительными» ошибками является субъективным и основано на довольно неопределенном понятии «находимости», все ошибки, обнаруженные в четырех элементах метаданных, рассмотренных в этом исследовании, следует считать серьезными.

Языковые проблемы

Некоторые европейские политики и интеллектуалы критикуют усилия Google, мотивируя это соображениями лингвистического империализма. Они утверждают, что поскольку подавляющее большинство книг, предлагаемых для оцифровки, написано на английском языке, это приведет к непропорциональному представлению языков в цифровом мире. Немецкий, русский, французский и испанский, например, широко используются в научных исследованиях. Однако чрезмерный акцент на английском языке в сети может повлиять на доступ к историческим научным трудам и, в конечном итоге, на развитие и направление будущих исследований. Среди критиков – Жан Ноэль Жаннени, бывший президент Национальной библиотеки Франции.

Книги Google против Ученого Google

Хотя Google Books оцифровал большое количество старых выпусков журналов, его сканы не содержат метаданных, необходимых для идентификации конкретных статей в определенных номерах. Это побудило разработчиков Google Scholar начать собственную программу по оцифровке и хостингу старых журнальных статей (с согласия издателей).

Статус

Google хранит в секрете свои планы относительно будущего проекта Google Books. Операции по сканированию замедлялись как минимум с 2012 года, что подтвердили библиотекари нескольких партнерских учреждений Google. В Университете Висконсина скорость снизилась более чем вдвое по сравнению с 2006 годом. Однако библиотекари отметили, что замедление темпов может быть естественным следствием развития проекта – изначально для сканирования отбирались целые стопки книг, в то время как сейчас необходимо рассматривать только те названия, которые еще не были отсканированы. На странице с хронологией проекта Google Books на сайте компании не было информации после 2007 года даже в 2017 году, а блог Google Books был объединен с блогом Google Search в 2012 году.

Юридические вопросы

В рамках проекта библиотечные книги оцифровывались довольно безразборно, независимо от статуса авторского права, что привело к ряду судебных исков против Google. К концу 2008 года Google оцифровал более семи миллионов книг, из которых только около миллиона были произведениями, находящимися в общественном достоянии. Из оставшихся, один миллион был защищен авторским правом и издавался, а пять миллионов были защищены авторским правом, но были сняты с печати. В 2005 году группа авторов и издателей подала крупный групповой иск против Google за нарушение авторских прав. Google утверждал, что он сохраняет "сиротские произведения" – книги, на которые все еще распространяются авторские права, но правообладателей которых не удалось установить. Гильдия авторов и Ассоциация американских издателей подали в суд на Google в 2005 году по поводу его книжного проекта, ссылаясь на "масштабное нарушение авторских прав". Google возразил, что его проект представляет собой добросовестное использование и является цифровым эквивалентом карточного каталога, где каждое слово в публикации проиндексировано. Издатели вскоре после этого урегулировали вопрос с Google. Гильдия авторов продолжила судебное разбирательство, и в 2011 году их предложенная группа была сертифицирована. Google обжаловал это решение, и ряд сторонних наблюдателей заявили о неадекватности группы, после чего Второй апелляционный суд отклонил сертификацию группы в июле 2013 года, направив дело в окружной суд для рассмотрения аргумента Google о добросовестном использовании. В 2015 году Гильдия авторов подала еще одну апелляцию против Google, которую должен был рассмотреть Второй окружной апелляционный суд США в Нью-Йорке. Google единогласно выиграл дело, основываясь на том, что он не демонстрировал людям полные тексты, а только фрагменты, и не позволял людям незаконно читать книги. В отчете суды заявили, что не нарушили законы об авторском праве, поскольку их действия подпадали под положение о добросовестном использовании. Гильдия авторов снова попыталась обжаловать решение в 2016 году и обратилась в Верховный суд. Дело было отклонено, решение Второго апелляционного суда осталось в силе, что означает, что Google не нарушил законы об авторском праве. Это дело также создало прецедент для других подобных дел, касающихся добросовестного использования, поскольку оно дополнительно уточнило и расширило закон. Такое уточнение влияет на другие проекты сканирования, подобные проекту Google. В июне 2006 года Hervé de la Martinière, французский издатель, известный как La Martinière и Éditions du Seuil, объявил о своем намерении подать в суд на Google France. В 2009 году Парижский гражданский суд присудил 300 000 евро (приблизительно 430 000 долларов США) в качестве компенсации ущерба и процентов и обязал Google выплачивать 10 000 евро в день, пока он не удалит книги издателя из своей базы данных. Суд постановил, что "Google нарушил авторские права, полностью воспроизводя и делая доступными" книги, принадлежащие Seuil, без его разрешения. Также в ноябре того же года Китайское общество защиты авторских прав на произведения литературы и искусства (CWWCS) обвинило Google в сканировании 18 000 книг 570 китайских писателей без разрешения. 20 ноября Google согласился предоставить список отсканированных китайских книг, но компания отказалась признать, что "нарушила" законы об авторском праве. В марте 2007 года Томас Рубин, заместитель генерального советника по вопросам авторских прав, товарных знаков и коммерческой тайны в Microsoft, обвинил Google в нарушении закона об авторском праве с помощью своей службы поиска книг. Рубин особенно критиковал политику Google по свободному копированию любых произведений до тех пор, пока правообладатель не потребует прекратить это. Лицензирование Google произведений, находящихся в общественном достоянии, также вызывает опасения из-за использования методов цифровой водяной маркировки для книг. Некоторые опубликованные произведения, находящиеся в общественном достоянии, такие как все произведения, созданные федеральным правительством США, по-прежнему рассматриваются как произведения, защищенные авторским правом, и поэтому заблокированы после 1922 года.