Кіріспе

Google қызметі

Google-дың кітап іздеу жүйесі

Google Books (бұрын Google Book Search, Google Print деп белгілі болған, сондай-ақ Project Ocean кодтық атауымен танымал) – Google-дың кітаптар мен журналдардың толық мәтінін сканерлеп, оптикалық таңбаларды тану (OCR) технологиясын қолданып мәтінге айналдырып, цифрлық деректер қорында сақтайтын қызметі. Кітаптар Google Books серіктестік бағдарламасы арқылы баспагерлер мен авторлар немесе Google кітапханаларының серіктестік жобасы арқылы ұсынылады. Publisher бағдарламасы алғаш рет 2004 жылғы қазан айында Франкфурт кітап көрмесінде Google Print ретінде таныстырылды. Google Books кітапханалық жобасы 2004 жылғы желтоқсанда жарияланды, ол кітапхана серіктестерінің қорындағы еңбектерді сканерлеп, оларды цифрлық тізімге қосады. Google Books жобасы адамзат білімінің бесiнiң ең үлкен онлайн жинағына қол жеткізу және білімді демократияландыру мүмкіндігі үшін жоғары бағаланды. Дегенмен, ол авторлық құқықты бұзу мүмкіндігі үшін де сынға ұшырады. Google 2010 жылы әлемде шамамен 130 миллион түрлі атау бар екенін және олардың бәрін сканерлеуді жоспарлағанын мәлімдеді. Google Book-тың сканерлеу жұмыстары сот процесіне түсті, соның ішінде АҚШ-тағы Authors Guild v. Google топтық сот ісі Google-дың пайдасына шешілді (төменде қараңыз). Бұл АҚШ-тағы авторлық құқықтарды қорғау тәжірибесін өзгертуге жақын болған маңызды сот ісі болды.

Кітаптарды сканерлеу

Жоба 2002 жылы "Океан жобасы" деген кодтық атпен басталды. Google-дың негізін қалаушы Ларри Пейдж кітаптарды цифрландыруға үнемі қызығушылық танытқан. Ол және Марисса Майер 2002 жылы кітаптарды сканерлеуді тәжірибелеп көргенде, 300 беттік кітапты цифрландыруға 40 минут кеткен. Бірақ көп ұзамай технология жетілдіріліп, сканерлеушілер сағатына 6000 бетке дейін сканерлей алатын болды. Көптеген кітаптар арнайы Elphel 323 камерасымен сағатына 1000 беттен сканерленеді. 2009 жылы Google-ға берілген патент Google-дың кітаптарды сканерлеу үшін жаңашыл жүйені ойлап тапқанын көрсетті, ол кітап беттерінің қисықтығын автоматты түрде түзету үшін екі камера мен инфрақызыл сәулені пайдаланады. Әрбір беттің 3D-моделін жасап, содан кейін оны "деформациядан өткізу" арқылы Google беттерді нақты түземей-ақ тегіс көрінетіндей ете алады, бұл үлкен көлемде сканерлеу үшін тиімсіз әр бетті жеке-жеке тегістеу үшін кітапты бөлу немесе шыны пластиналар сияқты бұзушы әдістерді қолдануды қажет етеді. Google жақсы кеңістіктік ажыратымдылыққа қол жеткізу үшін түс туралы ақпаратты жоюды шешті, өйткені сол кезде авторлық құқығы бұзылмаған көптеген кітаптарда түс болмаған. Әрбір беттің суреті мәтін мен иллюстрация бөлімдерін ажырататын алгоритмдерден өтті. Мәтін бөлімдері толық мәтінді іздеуге мүмкіндік беру үшін OCR арқылы өңделді. Google жоғары сапалы суреттерді сақтай отырып, файл өлшемдерін ең аз деңгейде ұстау үшін интернет қолданушыларына қол жеткізуді жеңілдету мақсатында оптималдық сығымдау техникаларын әзірлеуге көп күш жұмсады.

Веб-сайттың функционалдылығы

Әр жұмыс үшін Google Кітаптар автоматты түрде шолу бетін жасайды. Бұл бетте кітаптан алынған ақпарат көрсетіледі – оның басылым мәліметтері, жоғары жиілікті сөздер картасы, мазмұны, сондай-ақ қосымша материалдар, мысалы, тұжырымдамалар, оқырмандар пікірлері (сайттың мобильді нұсқасында оқу мүмкін емес) және басқа да тиісті мәтіндерге сілтемелер. Мысалы, бетке кірген адам осыған ұқсас жанр мен тақырыпты қамтитын кітаптар тізімін немесе кітапқа қатысты ағымдағы ғылыми зерттеулер тізімін көре алады. Бұл мазмұн, сонымен қатар, Google тіркелгісіне кірген пайдаланушыларға өзара әрекеттесу мүмкіндіктерін ұсынады. Олар библиографиялық деректер мен цитаталарды стандартты форматта экспорттай алады, өз пікірлерін жаза алады, кітапханаларына қосып, белгілеп, ұйымдастырып, басқалармен бөлісе алады. Осылайша, Google Кітаптар осы интерпретациялық элементтерді пайдаланушылардан, Goodreads сияқты үшінші тарап сайттарынан және көбінесе кітап авторы мен баспашысынан қоса алғанда, әртүрлі көздерден жинақтайды. Шындығында, авторларды өз кітаптарын жүктеуге ынталандыру үшін Google веб-сайтқа бірнеше мүмкіндіктер қосты. Авторлар келушілерге электрондық кітапты тегін жүктеуге рұқсат бере алады немесе өздері сатып алу бағасын белгілей алады. Олар бағаны қалауынша өзгертіп, уақыт-уақыт жеңілдіктер ұсына алады. Сонымен қатар, егер кітап авторы ISBN, LCCN немесе OCLC тіркеу нөмірін қосуды шешсе, қызмет кітаптың URL-ін жаңартып, оны қосады. Содан кейін автор сілтемеде нақты бетті белгі ретінде орната алады. Бұл мүмкіндік олардың кітабын іздеуді жеңілдетеді.

Ngram қарау құралы

Ngram Viewer – Google Books-қа қосылған, кітаптар жинағындағы сөздердің қолданылу жиілігін график түрінде көрсететін қызмет. Бұл қызмет тарихшылар мен тіл білімі мамандары үшін маңызды, себебі ол уақыт өте келе сөздердің қолданылуы арқылы адам мәдениетіне терең үңілуге мүмкіндік береді. Алайда, бұл бағдарламада қолданылған метадеректердегі қателерге байланысты сынға ұшырады.

Сканерлеу қателері

Сканерлеу процесінде қателер кездесуі мүмкін. Мысалы, кейбір беттерді оқу қиын болуы, кері бұрылып немесе реті дұрыс келмеуі мүмкін. Ғалымдар тіпті бүлінген беттер, бас бармақтар мен саусақтардың көрінбейтіні, сондай-ақ нашар немесе бүлінген суреттер туралы хабарлаған. Осы мәселе бойынша Google сканерленген кітаптардың соңында былай деп мәлімдейді:

2009 жылы Google, Google Book сканерлеуіндегі қателерді түзету үшін reCAPTCHA қолдана бастайтынын мәлімдеді. Бұл әдіс сканерлеу процесі салдарынан тану қиын сөздерді жақсартуға ғана бағытталған, ал беттердің бұрылуы немесе сөздердің жасырынуы сияқты қателерді шеше алмайды. Сканерлеу қателері аномальды беттер жинақтары мен Tumblr блогы сияқты көркем туындыларға шабыт берді.

Метадеректердегі қателер

Ғалымдар Google Books-тағы метадеректерде жиі кездесетін қателер туралы, соның ішінде дұрыс емес көрсетілген авторлар мен жариялану күндері туралы хабарлаған. Сөздердің уақыт өте келе қолданылуындағы өзгерістерді зерттейтін лингвист Джеффри Нунберг 1950 жылға дейін жарық көрген және "интернет" сөзін қамтитын кітаптарды іздегенде 527 нәтиже табылып, бұл күтпеген жағдай екенін байқады. Вуди Алленнің есімі туылмастан бұрын жарық көргендей көрсетілген 325 кітапта айтылған. Google компаниясы Нунбергке жауап ретінде қателердің көп бөлігін сыртқы мердігерлерге жатқызды. Басқа метадеректердегі қателерге автордың туған күнінен бұрын жарық көрген жарияланымдар (мысалы, Чарльз Диккенстің 1812 жылы туғанға дейін жарық көрген 182 туындысы); дұрыс емес тақырыптық жіктелімдер (Мобьи Дик кітабының "компьютерлер" бөлімінде табылуы, Мэй Уэсттің өмірбаяны "дін" бөлімінде жіктелгені), қарама-қайшы жіктелімдер (Уитманның "Жабайы шөптер" кітабының 10 басылымы "көркем әдебиет" және "көркем емес әдебиет" деп жіктелгені), дұрыс жазылмаған кітап атаулары, авторлар мен баспагерлер (Мобьи Дик: немесе ақ "Қабырға"), және бір кітаптың метадеректері мүлдем басқа кітапқа тіркелгені (1818 жылғы математикалық еңбектің метадеректері 1963 жылғы романға сілтеме береді) кіреді. Google Books-тағы кездейсоқ таңдалған 400 жазбаның автор, атау, баспагер және жариялану жылы метадерек элементтеріне шолу жүргізілді. Нәтижелерге сәйкес, цифрландыру жобасындағы іріктелген кітаптардың 36%-ында метадеректерде қателер анықталды. Бұл қателік деңгейі әдеттегі кітапхананың онлайн каталогында кездесетіннен жоғары. Осы зерттеуде анықталған жалпы қателік көрсеткіші 36,75% Google Books метадеректерінің қателік деңгейі жоғары екенін көрсетеді. "Маңызды" және "ұсақ" қателердің ажыратуы "табу мүмкіндігі" тұжырымына байланысты субъективті болғанымен, осы зерттеуде қарастырылған төрт метадерек элементіндегі қателердің барлығы маңызды деп есептелуі керек.

Тіл мәселесі

Кейбір еуропалық саясаткерлер мен зиялы қауым Google-дің тілдік империализмге ұмтылуын сынға алды. Олардың пікірінше, сканерлеуге ұсынылған кітаптардың көп бөлігі ағылшын тілінде болғандықтан, цифрлық әлемде тілдердің тең емес өкілдігіне алып келеді. Мысалы, неміс, орыс, француз және испан тілдері ғылыми еңбектерде жиі қолданылады. Дегенмен, ағылшын тіліне артық көңіл бөлу тарихи зерттеулерге қолжетімділікті және болашақ зерттеулердің өсуі мен бағытын қалыптастыруы мүмкін. Осы сыншылардың бірі – Франция Ұлттық кітапханасының бұрынғы президенті Жан Ноэль Жаннейн.

Google Books пен Google Scholar арасындағы айырмашылық

Google Books көптеген журналдардың архивтік нөмірлерін цифрлық форматқа келтіргенімен, оның скандары нақты мәселелердегі нақты мақалаларды анықтау үшін қажетті метадеректерді қамтымайды. Осы себепті Google Scholar жасаушылары ескі журнал мақалаларын цифрландыру және жариялау үшін өздерінің жеке бағдарламасын іске қосуға бел буды (олардың баспагерлерімен келісімде).

Мәртебе

Google кітап жобасының болашағына қатысты жоспарларын құпия ұстап отыр. Google-дің бірнеше әріптес мекемелерінің кітапханашылары растағандай, 2012 жылдан бері сканерлеу жұмыстары баяулап келеді. Висконсин университетінде жылдамдық 2006 жылғы көрсеткіштен кем дегенде екі есеге төмендеген. Бірақ кітапханашылар бұл қарқындың төмендеуі жобаның дамуының табиғи салдары болуы мүмкін дейді. Алғашқыда кітаптардың барлық жинағы сканерлеуге алынса, қазір тек бұрын сканерленбеген кітаптар қарастырылуда. Компанияның Google Books уақыт жобасы бетінде тіпті 2017 жылы да 2007 жылдан кейінгі ақпарат жоқ, ал Google Books блогы 2012 жылы Google Search блогымен біріктірілді.

Құқықтық мәселелер

Жоба арқылы кітапхана кітаптары авторлық құқыққа қарамастан біршама бейтараптықпен цифрландырылды, бұл Google-ға қарсы бірқатар сот процесіне әкелді. 2008 жылдың соңына қарай Google жеті миллионнан астам кітапты цифрлық форматқа келтірді, оның ішінде тек шамамен бір миллионы ғана жалпыға қолжетімді шығармалар болды. Қалғандарының бір миллионы авторлық құқықпен қорғалған және басылған, ал бесеуі авторлық құқықпен қорғалған, бірақ басылмай қалған. 2005 жылы авторлар мен баспагерлер тобы Google-ге қарсы авторлық құқықты бұзғаны үшін ірі топтық сотқа шағым түсірді. Google авторлық құқығы иесін табу мүмкін болмайтын "жетім туған шығармаларды" сақтап отырғанын мәлімдеді. Сол жылы Авторлар гильдиясы мен Америка баспагерлері қауымдастығы Google-ді "үлкен авторлық құқық бұзушылық" деп айыптап, кітап жобасына қатысты жеке сотқа берді. Google өзінің жобасының әділ пайдалану екенін және цифрлық дәуірдегі әрбір сөзі тізімделген картотекаға тең екенін айтты. Баспагерлер көп ұзамай Google-мен келісімге келді. Авторлар гильдиясы істі жалғастырды және 2011 жылы олардың ұсынған тобы сертификатталды. Google бұл шешімге шағымданып, бірнеше сарапшылар топтың жеткіліксіздігін мәлімдеді, ал Екінші апелляциялық сот 2013 жылдың шілдесінде топтық сертификатты қабылдамады, істі Google-дің әділ пайдалану қорғанысын қарастыру үшін аудандық сотқа қайтарды. 2015 жылы Авторлар гильдиясы Нью-Йорктегі АҚШ-тың 2-ші апелляциялық сотында Google-ге қарсы тағы бір шағым түсірді. Google істі бірауыздан жеңіп алды, себебі олар кітаптардың толық мәтінін емес, тек үзінділерін көрсетіп, кітапты заңсыз оқуға рұқсат бермеді. Соттар Google авторлық құқық заңдарын бұзбағанын, өйткені олар әділ пайдалану шартымен қорғалғанын мәлімдеді. 2016 жылы Авторлар гильдиясы бұл шешімге қайта шағымдануға тырысты және істі Жоғарғы Сот қарауына жіберді. Іс қабылданбады, Екінші апелляциялық соттың шешімі күшінде қалды, яғни Google авторлық құқықтарды бұзған жоқ. Бұл іс әділ пайдалану заңдарына қатысты басқа да ұқсас істерге прецедент болды, себебі ол заңды одан әрі нақтылап, кеңейтті. Мұндай нақтылау Google-ге ұқсас басқа сканерлеу жобаларына да әсер етеді. 2006 жылдың маусым айында француз баспагері Hervé de la Martinière, La Martinière және Éditions du Seuil компаниялары Google France компаниясын сотқа беру ниетін жариялады. 2009 жылы Париж азаматтық соты 300 000 еуро (шамамен 430 000 АҚШ доллары) өтемақы және проценттер төлеуге міндеттеді және Google баспагердің кітаптарын дерекқорынан алып тастағанға дейін күніне 10 000 еуро төлеуді бұйырды. Сотта "Google авторлық құқықты бұзуға тырысқан, Сеуилге тиесілі кітаптардың толық көшірмесін жасап, қолжетімді ету арқылы" деп жазылған. Сол жылдың қарашасында Қытай Жазбалық шығармалар авторлық құқықтарының қоғамы (CWWCS) Google-ді 570 қытай жазушысының 18 000 кітабын рұқсатсыз сканерлеумен айыптады. Google 20 қарашада сканерленген қытай кітаптарының тізімін ұсынуға келісті, бірақ компания авторлық құқықты "бұзғанын" мойындаудан бас тартты. 2007 жылдың наурызында Microsoft компаниясының авторлық құқық, сауда белгілері және коммерциялық құпиялар жөніндегі бас кеңесшісі Томас Рубин Google-ді кітап іздеу қызметі арқылы авторлық құқық заңдарын бұзғаны үшін айыптады. Рубин Google-дің авторлық құқық иесі тоқтату туралы хабарлама бергенше кез келген жұмысты тегін көшіру саясатын сынға алды. Google-дің жалпыға қолжетімді шығармаларға лицензия беруі де кітаптардағы цифрлық су таңбаларын қолданудан туындаған мәселе. Кейбір жарияланған, жалпыға қолжетімді шығармалар, мысалы АҚШ Федералды үкіметі жасаған барлық жұмыстар, әлі де авторлық құқықпен қорғалған басқа жұмыстар сияқты қарастырылады және 1922 жылдан кейін жабық.