Введение
Поисковая система и цифровая библиотека для научных и академических статей
DISPLAYTITLE:CiteSeerX
CiteSeer считается предшественником академических поисковых инструментов, таких как Google Scholar и Microsoft Academic Search. CiteSeer, как и другие поисковые системы и архивы, обычно индексирует документы только с общедоступных веб-сайтов и не осуществляет обход сайтов издателей. По этой причине авторы, чьи документы находятся в свободном доступе, с большей вероятностью будут представлены в индексе. CiteSeer в определенный момент изменил свое название на ResearchIndex, а затем вернулся к исходному.
CiteSeer is considered a predecessor of academic search tools such as Google Scholar and Microsoft Academic Search. CiteSeer like engines and archives usually only harvest documents from publicly available websites and do not crawl publisher websites. For this reason, authors whose documents are freely available are more likely to be represented in the index. CiteSeer changed its name to ResearchIndex at one point and then changed it back.
CiteSeer и CiteSeer.IST
CiteSeer был создан исследователями Ли Джайлсом, Куртом Боллакером и Стивом Лоуренсом в 1997 году, когда они работали в Исследовательском институте NEC (ныне NEC Labs), Принстон, Нью-Джерси, США. Целью CiteSeer было активное сканирование и сбор академических и научных документов в сети Интернет и использование автономной индексации цитирования для обеспечения поиска по цитированию или по документу с ранжированием результатов по влиянию цитирования. В какой-то момент он назывался ResearchIndex. CiteSeer стал общедоступным в 1998 году и предлагал множество новых функций, недоступных в академических поисковых системах того времени. Среди них:
Автономная индексация цитирования автоматически создавала индекс цитирования, который можно было использовать для поиска и оценки литературы. Статистика цитирования и связанные документы рассчитывались для всех статей, упомянутых в базе данных, а не только для индексированных. Реализована поддержка ссылок, позволяющая просматривать базу данных по ссылкам на цитаты. Контекст цитирования отображал контекст, в котором статья была процитирована, позволяя исследователю быстро и легко узнать, что другие исследователи говорят об интересующей его работе. Связанные документы отображались на основе цитирования и анализа ключевых слов, а для каждого документа предоставлялась активная и постоянно обновляемая библиография. CiteSeer получил патент США № 6289342 под названием «Автономная индексация цитирования и просмотр литературы с использованием контекста цитирования» 11 сентября 2001 года. Заявка на патент была подана 20 мая 1998 года, а приоритет был установлен 5 января 1998 года. 16 мая 2001 года была подана заявка на патент-продолжение (US Patent # 6738780), который был выдан 18 мая 2004 года. После NEC в 2004 году CiteSeer был размещен на платформе CiteSeer.IST в Колледже информационных наук и технологий Пенсильванского государственного университета, где хранилось более 700 000 документов. Для улучшения доступа, производительности и проведения исследований аналогичные версии CiteSeer поддерживались в таких университетах, как Массачусетский технологический институт, Цюрихский университет и Национальный университет Сингапура. Однако эти версии CiteSeer оказались сложными в поддержке и больше не доступны. Поскольку CiteSeer индексирует только свободно доступные материалы в сети Интернет и не имеет доступа к метаданным издателей, количество найденных цитирований у него меньше, чем на сайтах, таких как Google Scholar, которые используют метаданные издателей. CiteSeer не обновлялся комплексно с 2005 года из-за ограничений в архитектуре. Он содержал репрезентативную выборку исследовательских работ по компьютерным и информационным наукам, но охват был ограничен, поскольку индексировались только общедоступные работы, обычно размещенные на личных страницах авторов или представленные самими авторами. Для преодоления этих ограничений была разработана модульная и открытая архитектура для CiteSeer – CiteSeerX.
Autonomous Citation Indexing automatically created a citation index that can be used for literature search and evaluation. Citation statistics and related documents were computed for all articles cited in the database, not just the indexed articles. Reference linking, allowing browsing of the database using citation links. Citation context showed the context of citations to a given paper, allowing a researcher to quickly and easily see what other researchers have to say about an article of interest. Related documents were shown using citation and word based measures, and an active and continuously updated bibliography is shown for each document. CiteSeer was granted a United States patent # 6289342, titled "Autonomous citation indexing and literature browsing using citation context", on September 11, 2001. The patent was filed on May 20, 1998, and has priority to January 5, 1998. A continuation patent (US Patent # 6738780) was filed on May 16, 2001, and granted on May 18, 2004. After NEC, in 2004 it was hosted as CiteSeer. IST on the World Wide Web at the College of Information Sciences and Technology, The Pennsylvania State University, and had over 700,000 documents. For enhanced access, performance and research, similar versions of CiteSeer were supported at universities such as the Massachusetts Institute of Technology, University of Zürich and the National University of Singapore. However, these versions of CiteSeer proved difficult to maintain and are no longer available. Because CiteSeer only indexes freely available papers on the web and does not have access to publisher metadata, it returns fewer citation counts than sites, such as Google Scholar, that have publisher metadata. CiteSeer had not been comprehensively updated since 2005 due to limitations in its architecture design. It had a representative sampling of research documents in computer and information science but was limited in coverage because it was limited to papers that are publicly available, usually at an author's homepage, or those submitted by an author. To overcome some of these limitations, a modular and open source architecture for CiteSeer was designed – CiteSeerX.
Цитаты
CiteSeerX заменил CiteSeer, и все запросы к CiteSeer были перенаправлены. CiteSeerX — это общедоступная поисковая система и цифровая библиотека, служащая хранилищем научных и академических публикаций, преимущественно в области компьютерных и информационных наук. Проект финансируется Национальным научным фондом, NASA и Microsoft Research. CiteSeerX по-прежнему входит в число ведущих мировых хранилищ и занимал первое место в июле 2010 года. В настоящее время в нём содержится более 6 миллионов документов, созданных почти 6 миллионами уникальных авторов, с общим количеством 120 миллионов цитирований. CiteSeerX также предоставляет другим исследователям доступ к своему программному обеспечению, данным, базам данных и метаданным, используя Amazon S3 и rsync. Его новая модульная архитектура с открытым исходным кодом и программное обеспечение (ранее доступное на SourceForge, а теперь на GitHub) основаны на Apache Solr и других инструментах Apache и с открытым исходным кодом, что позволяет использовать его в качестве полигона для тестирования новых алгоритмов сбора, ранжирования, индексирования и извлечения информации. CiteSeerX кэширует некоторые отсканированные PDF-файлы, поэтому каждая страница содержит ссылку DMCA для сообщений о нарушениях авторских прав.
Автоматизированная выемка информации
CiteSeerX использует автоматизированные инструменты извлечения информации, как правило, основанные на методах машинного обучения, таких как ParsCit, для извлечения метаданных научных документов, включая название, авторов, аннотацию, список цитируемой литературы и т.д. В связи с этим, в данных об авторах и названиях иногда возникают ошибки. Аналогичные ошибки встречаются и в других академических поисковых системах.
Фокусированный ползание
CiteSeerX сканирует общедоступные научные документы, преимущественно с веб-страниц авторов и других открытых источников, и не имеет доступа к метаданным издательств. В связи с этим, количество цитирований в CiteSeerX обычно ниже, чем в Google Scholar и Microsoft Academic Search, которые имеют доступ к этим метаданным.
Использование
CiteSeerX насчитывает почти миллион пользователей по всему миру, идентифицированных по уникальным IP-адресам, и ежедневно получает миллионы обращений. В 2015 году было скачано почти 200 миллионов PDF-файлов документов.
Данные
Данные CiteSeerX регулярно предоставляются исследователям по всему миру под лицензией Creative Commons BY NC SA и используются во многих экспериментах и соревнованиях. Благодаря наличию OAI PMH-интерфейса, CiteSeerX является открытым архивом, а его содержание индексируется в академических поисковых системах, таких как BASE и Unpaywall, подобно институциональному репозиторию.
Другие поисковые системы на основе SeerSuite
Модель CiteSeer была расширена для охвата академических документов в области бизнеса с помощью SmealSearch и в области электронной коммерции с помощью eBizSearch. Однако эти системы больше не поддерживались их спонсорами. Более старые версии обеих из них когда-то можно было найти на BizSeer. IST, но сейчас они не функционируют. Другие поисковые и архивные системы, подобные CiteSeer, были созданы для химии (ChemXSeer) и археологии (ArchSeer). Также была создана система для поиска файлов robots.txt (BotSeer). Все они построены на базе инструмента SeerSuite с открытым исходным кодом, который использует поисковый индекс Lucene с открытым исходным кодом.