Введение
Анализ частоты, закономерностей и графиков цитирования в документах
Анализ цитирования – это исследование частоты, закономерностей и графиков цитирования в документах. Он использует ориентированный граф цитирования – ссылки из одного документа в другой – для выявления свойств документов. Типичная цель – определить наиболее важные документы в коллекции. Классический пример – цитирование между научными статьями и книгами. Другой пример – судьи, обосновывающие свои решения ссылками на решения, принятые в предыдущих делах (см. анализ цитирования в правовом контексте). Дополнительный пример предоставляют патенты, содержащие уровень техники, с указанием более ранних патентов, имеющих отношение к текущему изобретению. Оцифровка патентных данных и увеличение вычислительной мощности привели к формированию сообщества специалистов, использующих эти данные для оценки атрибутов инноваций, отслеживания потоков знаний и построения инновационных сетей. Документы могут быть связаны с множеством других характеристик, помимо цитирования, таких как авторы, издатели, журналы и их фактический текст. Общий анализ коллекций документов известен как библиометрия, а анализ цитирования является ее ключевой частью. Например, библиографическая связь и коцитирование – это меры ассоциации, основанные на анализе цитирования (совместные цитаты или общие ссылки). Цитаты в коллекции документов также могут быть представлены в виде графа цитирования, как указал Дерек Дж. де Солла Прайс в своей статье 1965 года «Сети научных работ». Это означает, что анализ цитирования опирается на аспекты анализа социальных сетей и сетевой науки. Ранним примером автоматизированного индексирования цитирования был CiteSeer, использовавшийся для цитирования между научными публикациями, в то время как Web of Science является примером современной системы, включающей не только научные книги и статьи, но и более широкий спектр источников информации. Сегодня автоматизированное индексирование цитирования изменило характер исследований в области анализа цитирования, позволяя анализировать миллионы цитат для выявления масштабных закономерностей и открытия новых знаний. Инструменты анализа цитирования могут использоваться для вычисления различных показателей влияния ученых на основе данных из индексов цитирования. Примеры включают инструменты, доступные по подписке и основанные на проприетарных данных, такие как Web of Science и Scopus, а также бесплатные инструменты, основанные на открытых данных, такие как Scholarometer, разработанный Филиппо Менчером и его командой. Они имеют различные применения, от определения экспертов для рецензирования статей и предложений грантов до предоставления прозрачных данных для оценки академических заслуг, продвижения по службе и принятия решений о присвоении званий. Эта конкуренция за ограниченные ресурсы может приводить к этически сомнительному поведению с целью увеличения количества цитирований. Значительная критика направлена на практику упрощенного использования анализа цитирования для сравнения влияния различных научных статей без учета других факторов, которые могут влиять на закономерности цитирования. Среди этой критики часто встречается замечание о «зависимости от области науки», которое указывает на то, что практика цитирования варьируется от одной научной области к другой и даже между различными направлениями исследований в рамках одной дисциплины.
Обзор
Хотя индексы цитирования изначально разрабатывались для поиска информации, они все чаще используются в библиометрии и других исследованиях, связанных с оценкой научной деятельности. Данные о цитировании также лежат в основе популярного импакт-фактора журналов. Существует обширная литература по анализу цитирования, иногда называемому наукометрией – термин, предложенный Василием Налимовым, или, более конкретно, библиометрией. Эта область получила развитие с появлением Science Citation Index, который сейчас охватывает научную литературу, начиная с 1900 года. Ведущими журналами в этой области являются *Scientometrics*, *Informetrics* и *Journal of the Association for Information Science and Technology*. ASIST также поддерживает электронную рассылку SIGMETRICS на платформе ASIST. Этот метод переживает новый подъем благодаря широкому распространению платных баз данных Web of Science и Scopus во многих университетах, а также свободно доступных инструментов цитирования, таких как CiteBase, CiteSeerX, Google Scholar и бывший Windows Live Academic (теперь доступный с расширенными функциями как Microsoft Academic). Методы исследования анализа цитирования включают качественные, количественные и вычислительные подходы. Основные направления таких наукометрических исследований включают сравнительный анализ продуктивности, рейтинги исследовательских учреждений, рейтинги журналов, определение продуктивности преподавателей и критериев для получения постоянной должности, оценку влияния ведущих научных статей, отслеживание траектории развития науки или технологии, а также создание профилей ведущих авторов и учреждений по результатам исследований. Анализ правовых цитирований – это метод анализа цитат, применяемый к юридическим документам для облегчения понимания взаимосвязанных документов, регулирующих соответствие нормативным требованиям, путем изучения цитат, связывающих положения внутри одного документа или между различными документами. Анализ юридических цитирований использует граф цитирований, извлеченный из нормативного документа, который может дополнить электронное обнаружение (E-discovery) – процесс, использующий технологические инновации в области анализа больших данных.
История
В статье 1965 года Дерек Дж. де Солла Прайс описал присущую SCI характеристику взаимосвязанности как «сети научных публикаций». В 1972 году. С появлением CD-ROM-издания установление связей стало еще проще и позволило использовать библиографическое связывание для поиска связанных записей. В 1973 году Генри Смолл опубликовал свою классическую работу по коцитационному анализу, которая стала самоорганизующейся системой классификации, приведшей к экспериментам по кластеризации документов и, в конечном итоге, к созданию «Атласа науки», позднее названного «Обзоры исследований». Топологическая и графическая природа всемирной сети цитирования, являющаяся неотъемлемым свойством научной литературы, была описана Ральфом Гарнером (Университет Дрекселя) в 1965 году. Использование количества цитирований для ранжирования журналов применялось еще в начале XIX века, но систематическое и непрерывное измерение этих показателей для научных журналов было инициировано Юджином Гарфилдом в Институте научной информации, который также стал пионером в использовании этих данных для ранжирования авторов и статей. В основополагающей работе 1965 года он и Ирвинг Шер показали корреляцию между частотой цитирования и известностью, продемонстрировав, что лауреаты Нобелевской премии публиковали в пять раз больше статей в среднем, а их работы цитировались в 30–50 раз чаще, чем в среднем. В серии эссе о Нобелевской и других премиях Гарфилд сообщал об этом явлении. Обычно используемая сводная мера известна как импакт-фактор – количество цитирований журнала за предыдущие два года, деленное на количество статей, опубликованных за эти годы. Он широко используется как в уместных, так и в неуместных целях, и, в частности, использование только этой меры для ранжирования авторов и статей вызывает значительные споры. В раннем исследовании 1964 года, посвященном применению анализа цитирования при написании истории ДНК, Гарфилд и Шер продемонстрировали возможность создания историограмм – топологических карт наиболее важных этапов в истории научных тем. Эта работа была позднее автоматизирована Э. Гарфилдом, А. И. Пудовкиным из Института морской биологии Российской академии наук и В. С. Истоминым из Центра обучения, преподавания и технологий Вашингтонского государственного университета, что привело к созданию программного обеспечения HistCite около 2002 года. Автоматическая индексация цитирования была представлена в 1998 году Ли Джайлсом, Стивом Лоуренсом и Куртом Боллакером и позволила автоматически, с помощью алгоритмов, извлекать и группировать цитаты из любого цифрового научного и академического документа. Если ранее извлечение цитат было ручным процессом, то теперь показатели цитирования можно было масштабировать и рассчитывать для любой научной области и любого издания, а не только для тех, которые выбирались такими организациями, как ISI. Это привело к созданию новых систем для публичной и автоматизированной индексации цитирования, первой из которых была CiteSeer (ныне CiteSeerX), за которой вскоре последовала Cora, ориентированная главным образом на область информатики и компьютерных наук. За ними последовали крупномасштабные академические системы цитирования, такие как Google Scholar и Microsoft Academic. Такая автономная индексация цитирования пока не является совершенной в отношении извлечения и кластеризации цитирований, при этом, по оценкам некоторых, уровень ошибок составляет около 10%, хотя тщательная статистическая выборка еще не проводилась. В результате авторам, таким как Энн-Арбор, Милтон-Кинс и Уолтон-Холл, приписывают значительный объем научных работ. SCI утверждает, что создает автоматическую индексацию цитирования исключительно программными методами. Даже в более старых записях наблюдается сопоставимый уровень ошибок.
Анализ цитирования юридических документов
Анализ цитирования юридических документов – это подход, облегчающий понимание и анализ взаимосвязанных документов, регулирующих соответствие требованиям, посредством изучения ссылок, соединяющих положения как внутри одного документа, так и между различными документами. Анализ цитирования использует граф цитирования, извлеченный из нормативного документа, который может дополнить электронное обнаружение (E-discovery) – процесс, основанный на технологических инновациях в области анализа больших данных.
Противоречия
Электронные публикации: в связи с беспрецедентным ростом доступности электронных ресурсов, один из вопросов, который сейчас исследуется, – "как часто электронные ресурсы цитируются в моей области?". Например, существуют утверждения, что онлайн-доступ к литературе по компьютерным наукам приводит к более высоким показателям цитируемости, однако статьи по гуманитарным наукам могут проигрывать, если они не издаются в печатном виде. Самоцитирование: критикуется практика, когда авторы искусственно повышают свои показатели цитируемости, чрезмерно ссылаясь на собственные работы. Например, было установлено, что мужчины склонны цитировать себя чаще, чем женщины. Загрязнение цитирования: проникновение отозванных или фальсифицированных исследований в легитимные научные работы, что негативно сказывается на их достоверности. Это обусловлено различными факторами, включая гонку за публикациями и растущее число недобросовестных практик, связанных с так называемыми хищническими или обманными издательствами, что в целом представляет угрозу для качества исследований. Справедливость цитирования и предвзятость цитирования: поскольку цитирование работ другими авторами влияет на карьерные перспективы первоначального автора, а также учитывая, что ключевые работы в некоторых областях были созданы мужчинами, старшими исследователями и представителями европеоидной расы, возникают призывы к продвижению социальной справедливости путем намеренного цитирования работ авторов из маргинализированных групп или проверки цитируемости на наличие предвзятости перед публикацией.