Введение

Поисковая система и цифровая библиотека для научных и академических статей

DISPLAYTITLE:CiteSeerX
CiteSeer считается предшественником академических поисковых инструментов, таких как Google Scholar и Microsoft Academic Search. CiteSeer, как и другие поисковые системы и архивы, обычно индексирует документы только с общедоступных веб-сайтов и не осуществляет обход сайтов издателей. По этой причине авторы, чьи документы находятся в свободном доступе, с большей вероятностью будут представлены в индексе. CiteSeer в определенный момент изменил свое название на ResearchIndex, а затем вернулся к исходному.

CiteSeer и CiteSeer.IST

CiteSeer был создан исследователями Ли Джайлсом, Куртом Боллакером и Стивом Лоуренсом в 1997 году, когда они работали в Исследовательском институте NEC (ныне NEC Labs), Принстон, Нью-Джерси, США. Целью CiteSeer было активное сканирование и сбор академических и научных документов в сети Интернет и использование автономной индексации цитирования для обеспечения поиска по цитированию или по документу с ранжированием результатов по влиянию цитирования. В какой-то момент он назывался ResearchIndex. CiteSeer стал общедоступным в 1998 году и предлагал множество новых функций, недоступных в академических поисковых системах того времени. Среди них:
Автономная индексация цитирования автоматически создавала индекс цитирования, который можно было использовать для поиска и оценки литературы. Статистика цитирования и связанные документы рассчитывались для всех статей, упомянутых в базе данных, а не только для индексированных. Реализована поддержка ссылок, позволяющая просматривать базу данных по ссылкам на цитаты. Контекст цитирования отображал контекст, в котором статья была процитирована, позволяя исследователю быстро и легко узнать, что другие исследователи говорят об интересующей его работе. Связанные документы отображались на основе цитирования и анализа ключевых слов, а для каждого документа предоставлялась активная и постоянно обновляемая библиография. CiteSeer получил патент США № 6289342 под названием «Автономная индексация цитирования и просмотр литературы с использованием контекста цитирования» 11 сентября 2001 года. Заявка на патент была подана 20 мая 1998 года, а приоритет был установлен 5 января 1998 года. 16 мая 2001 года была подана заявка на патент-продолжение (US Patent # 6738780), который был выдан 18 мая 2004 года. После NEC в 2004 году CiteSeer был размещен на платформе CiteSeer.IST в Колледже информационных наук и технологий Пенсильванского государственного университета, где хранилось более 700 000 документов. Для улучшения доступа, производительности и проведения исследований аналогичные версии CiteSeer поддерживались в таких университетах, как Массачусетский технологический институт, Цюрихский университет и Национальный университет Сингапура. Однако эти версии CiteSeer оказались сложными в поддержке и больше не доступны. Поскольку CiteSeer индексирует только свободно доступные материалы в сети Интернет и не имеет доступа к метаданным издателей, количество найденных цитирований у него меньше, чем на сайтах, таких как Google Scholar, которые используют метаданные издателей. CiteSeer не обновлялся комплексно с 2005 года из-за ограничений в архитектуре. Он содержал репрезентативную выборку исследовательских работ по компьютерным и информационным наукам, но охват был ограничен, поскольку индексировались только общедоступные работы, обычно размещенные на личных страницах авторов или представленные самими авторами. Для преодоления этих ограничений была разработана модульная и открытая архитектура для CiteSeer – CiteSeerX.

Цитаты

CiteSeerX заменил CiteSeer, и все запросы к CiteSeer были перенаправлены. CiteSeerX — это общедоступная поисковая система и цифровая библиотека, служащая хранилищем научных и академических публикаций, преимущественно в области компьютерных и информационных наук. Проект финансируется Национальным научным фондом, NASA и Microsoft Research. CiteSeerX по-прежнему входит в число ведущих мировых хранилищ и занимал первое место в июле 2010 года. В настоящее время в нём содержится более 6 миллионов документов, созданных почти 6 миллионами уникальных авторов, с общим количеством 120 миллионов цитирований. CiteSeerX также предоставляет другим исследователям доступ к своему программному обеспечению, данным, базам данных и метаданным, используя Amazon S3 и rsync. Его новая модульная архитектура с открытым исходным кодом и программное обеспечение (ранее доступное на SourceForge, а теперь на GitHub) основаны на Apache Solr и других инструментах Apache и с открытым исходным кодом, что позволяет использовать его в качестве полигона для тестирования новых алгоритмов сбора, ранжирования, индексирования и извлечения информации. CiteSeerX кэширует некоторые отсканированные PDF-файлы, поэтому каждая страница содержит ссылку DMCA для сообщений о нарушениях авторских прав.

Автоматизированная выемка информации

CiteSeerX использует автоматизированные инструменты извлечения информации, как правило, основанные на методах машинного обучения, таких как ParsCit, для извлечения метаданных научных документов, включая название, авторов, аннотацию, список цитируемой литературы и т.д. В связи с этим, в данных об авторах и названиях иногда возникают ошибки. Аналогичные ошибки встречаются и в других академических поисковых системах.

Фокусированный ползание

CiteSeerX сканирует общедоступные научные документы, преимущественно с веб-страниц авторов и других открытых источников, и не имеет доступа к метаданным издательств. В связи с этим, количество цитирований в CiteSeerX обычно ниже, чем в Google Scholar и Microsoft Academic Search, которые имеют доступ к этим метаданным.

Использование

CiteSeerX насчитывает почти миллион пользователей по всему миру, идентифицированных по уникальным IP-адресам, и ежедневно получает миллионы обращений. В 2015 году было скачано почти 200 миллионов PDF-файлов документов.

Данные

Данные CiteSeerX регулярно предоставляются исследователям по всему миру под лицензией Creative Commons BY NC SA и используются во многих экспериментах и соревнованиях. Благодаря наличию OAI PMH-интерфейса, CiteSeerX является открытым архивом, а его содержание индексируется в академических поисковых системах, таких как BASE и Unpaywall, подобно институциональному репозиторию.

Другие поисковые системы на основе SeerSuite

Модель CiteSeer была расширена для охвата академических документов в области бизнеса с помощью SmealSearch и в области электронной коммерции с помощью eBizSearch. Однако эти системы больше не поддерживались их спонсорами. Более старые версии обеих из них когда-то можно было найти на BizSeer. IST, но сейчас они не функционируют. Другие поисковые и архивные системы, подобные CiteSeer, были созданы для химии (ChemXSeer) и археологии (ArchSeer). Также была создана система для поиска файлов robots.txt (BotSeer). Все они построены на базе инструмента SeerSuite с открытым исходным кодом, который использует поисковый индекс Lucene с открытым исходным кодом.