Введение

Два или более выражения в тексте с одним и тем же референтом. В лингвистике кореференция, иногда пишущаяся как ко-референция, возникает, когда два или более выражения относятся к одному и тому же лицу или предмету; у них один и тот же референт. Например, в предложении «Билл сказал, что Алиса скоро приедет, и она приехала», слова «Алиса» и «она» относятся к одному и тому же лицу. Определение кореференции часто не является тривиальной задачей. Например, в предложении «Билл сказал, что он придет», слово «он» может относиться к Биллу, а может и не относиться. Определение того, какие выражения являются кореферентами, является важной частью анализа или понимания значения и часто требует информации из контекста, знаний о реальном мире, таких как тенденции связывать определенные имена с конкретными видами («Рекс»), типами артефактов («Титаник»), грамматическими родами или другими свойствами. Лингвисты обычно используют индексы для обозначения кореференции, например, Bill₁ сказал, что придет₁. Такие выражения называют коиндексированными, что указывает на то, что они должны интерпретироваться как кореференциальные. Когда выражения являются кореференциальными, первое из них часто представляет собой полную или описательную форму (например, полное имя, возможно, с титулом и должностью), а последующие упоминания используют более короткие формы (например, только имя, фамилию или местоимение). Первое упоминание известно как антецедент, а второе – проформа, анафора или референция. Однако местоимения иногда могут указывать на последующее упоминание, как в предложении «Когда она пришла домой, Алиса заснула». В таких случаях кореференция называется катафорической, а не анафорической. Кореференция важна для явлений связывания в области синтаксиса. Теория связывания исследует синтаксические отношения, существующие между кореференциальными выражениями в предложениях и текстах.

Отношение к ограниченным переменным

Семантики и логики иногда проводят различие между кореференцией и так называемой связанной переменной. Связанные переменные возникают, когда антецедентом проформы является неопределённое кванторное выражение, например:

Кванторные выражения, такие как каждый студент и ни один студент, не считаются референциальными. Эти выражения грамматически единственного числа, но не указывают на конкретных референтов в дискурсе или в реальном мире. Таким образом, антецеденты к *his* в этих примерах сами по себе не являются референциальными, и *his* также не является референциальным. Вместо этого он рассматривается как переменная, связанная своим антецедентом. Его референция меняется в зависимости от того, о каком студенте в мире дискурса идёт речь. Существование связанных переменных особенно очевидно на следующем примере:

Это предложение неоднозначно. Оно может означать, что Джеку нравится его оценка, а всем остальным не нравится оценка Джека; или что никому не нравится своя собственная оценка, кроме Джека. В первом случае *his* является кореференциальным; во втором – это связанная переменная, поскольку его референция варьируется в пределах множества всех студентов. Коиндексная нотация обычно используется для обоих случаев. То есть, когда два или более выражения коиндексированы, это не указывает, имеем ли мы дело с кореференцией или связанной переменной (или, как в последнем примере, зависит ли это от интерпретации).

Резолюция о сореференции

В вычислительной лингвистике, разрешение корреференции является хорошо изученной проблемой в области дискурса. Чтобы получить правильную интерпретацию текста или даже оценить относительную важность различных упоминаемых субъектов, местоимения и другие референциальные выражения должны быть соотнесены с соответствующими объектами. Алгоритмы, предназначенные для разрешения корреференции, обычно сначала ищут ближайший предшествующий объект, совместимый с референциальным выражением. Например, местоимение "она" может соотноситься с предшествующим выражением, таким как "женщина" или "Анна", но менее вероятно – с "Биллом". Местоимения, такие как "он сам", имеют более строгие ограничения. Как и во многих лингвистических задачах, существует компромисс между точностью и полнотой. Метрики качества кластеров, обычно используемые для оценки алгоритмов разрешения корреференции, включают индекс Рэнда, скорректированный индекс Рэнда и различные методы, основанные на взаимной информации. Особую проблему для разрешения корреференции в английском языке представляет местоимение "it", которое имеет множество употреблений. Оно может относиться к объектам, как и "he" и "she", за исключением того, что обычно относится к неодушевленным предметам (правила на самом деле сложнее: животные могут быть обозначены как "it", "he" или "she"; корабли традиционно именуются как "она"; ураганы обычно обозначаются как "it", несмотря на наличие гендерных имен). Оно также может относиться к абстрактным понятиям, а не к одушевленным существам, например: "Ему платили минимальную заработную плату, но, похоже, он не возражал против этого". Наконец, оно также имеет плеонастическое употребление, которое не относится к чему-либо конкретному:

Плеонастические употребления не считаются референциальными и, следовательно, не являются частью корреференции. Подходы к разрешению корреференции можно условно разделить на алгоритмы, основанные на парах упоминаний, ранжировании упоминаний или сущностях. Алгоритмы, работающие с парами упоминаний, принимают бинарное решение о том, относятся ли два заданных упоминания к одной и той же сущности. Ограничения, относящиеся ко всей сущности, такие как пол, не учитываются, что приводит к распространению ошибок. Например, местоимения "он" или "она" могут иметь высокую вероятность корреференции с "учителем", но не могут быть корреферентными друг с другом. Алгоритмы ранжирования упоминаний развивают эту идею, но предусматривают, что одно упоминание может быть корреферентным только с одним (предыдущим) упоминанием. В результате каждому предыдущему упоминанию присваивается оценка, и соотносится упоминание с наивысшей оценкой (или ни с каким). Наконец, в методах, основанных на сущностях, упоминания связываются на основе информации о всей цепочке корреференции, а не об отдельных упоминаниях. Представление цепочки переменной ширины более сложно и вычислительно затратно, чем методы, основанные на упоминаниях, что приводит к тому, что эти алгоритмы в основном базируются на архитектурах нейронных сетей.