Введение
Изучение стиля письма
Стилометрия – это применение изучения лингвистического стиля, как правило, к письменной речи. Она также успешно применяется к музыке, живописи и шахматам. Стилометрия часто используется для установления авторства анонимных или оспариваемых документов. Она имеет применение в юридической, академической и литературной сферах, от вопросов авторства произведений Шекспира до криминалистической лингвистики, и имеет методологическое сходство с анализом удобочитаемости текста. Стилометрия может быть использована для выявления авторов, пишущих под псевдонимом или анонимно, или для получения информации об авторе без его полной идентификации. Авторы могут использовать контр-стилометрию, чтобы противостоять идентификации, устраняя свои собственные стилистические особенности, не меняя при этом смыслового содержания своих сообщений. Она может нейтрализовать анализы, не учитывающие такую возможность, но окончательная эффективность стилометрии в условиях противодействия остаётся неопределённой: стилометрическая идентификация может быть ненадежной, но и невозможность идентификации не может быть гарантирована; сама практика контр-стилометрии может быть обнаружена.
История
Стилометрия выросла из более ранних методов анализа текстов с целью установления подлинности, идентификации автора и решения других вопросов. Современная практика этой дисциплины получила известность благодаря исследованиям проблем авторства в английской драматургии эпохи Возрождения. Исследователи и читатели заметили, что у некоторых драматургов той эпохи были характерные языковые предпочтения, и попытались использовать эти особенности для определения авторов сомнительных или коллективных произведений. Первые попытки не всегда оказывались успешными: в 1901 году один исследователь попытался использовать склонность Джона Флетчера к употреблению "'em" – сокращенной формы "them" – в качестве маркера для различения Флетчера и Филиппа Массинджера в их совместных работах, но он по ошибке использовал издание трудов Массинджера, в котором редактор расширил все случаи "'em" до "them". Основы стилометрии были заложены польским философом Винцентием Лутославским в его работе "Principes de stylométrie" (1890). Лутославский применил этот метод для разработки хронологии диалогов Платона. Развитие компьютеров и их возможности по анализу больших объемов данных многократно усилили эффективность подобных исследований. Однако высокая вычислительная мощность компьютеров не гарантировала качественных результатов. В начале 1960-х годов преподобный А. К. Мортон провел компьютерный анализ четырнадцати посланий Нового Завета, приписываемых апостолу Павлу, и обнаружил, что этот корпус текстов написан шестью разными авторами. Проверка его метода на произведениях Джеймса Джойса показала, что роман "Улисс" – многоплановый и многостилевой роман Джойса – был создан пятью разными людьми, ни один из которых, по-видимому, не принимал участия в написании первого романа Джойса, "Портрета художника в юности". Однако со временем, благодаря опыту, исследователи и ученые усовершенствовали свои методы и добились лучших результатов. Одним из заметных ранних успехов стало разрешение спора об авторстве двенадцати "Федералистских записок" благодаря работе Фредерика Мостеллера и Дэвида Уоллеса. Хотя вопросы относительно исходных предположений и методов остаются (и, возможно, всегда будут оставаться), немногие сегодня ставят под сомнение основную предпосылку о том, что лингвистический анализ письменных текстов может предоставить ценную информацию и понимание. (В самом деле, это было очевидно еще до появления компьютеров: успешное применение текстолого-лингвистического анализа канона Флетчера Сайрусом Хоем и другими дало четкие результаты в конце 1950-х и начале 1960-х годов.)
Приложения
Применение стилометрии включает в себя литературные исследования, исторические исследования, социальные исследования, информационный поиск, а также множество судебных дел и исследований. Недавно, благодаря ее использованию, удалось продвинуться в давних спорах об анонимных средневековых исландских сагах. Ее также можно применять к компьютерному коду и выявлению имманентного плагиата – то есть обнаружению плагиата на основе изменений стиля письма внутри документа. Стилометрия может использоваться и для определения, является ли человек носителем или не носителем английского языка, по скорости печати. Как метод, стилометрия уязвима к искажению текста в процессе редактирования. Также существует случай, когда автор меняет свой стиль на протяжении карьеры, что было продемонстрировано на примере Платона, который использовал различные стилистические подходы в ранних и средних диалогах, касающихся сократической проблемы.
Особенности
Текстовые особенности, представляющие интерес для атрибуции авторства, включают, с одной стороны, подсчет случаев идиосинкразических выражений или конструкций (например, проверку того, как автор использует пунктуацию или как часто автор использует безличные пассивные конструкции), а с другой стороны – показатели, аналогичные тем, что используются для анализа читабельности, такие как меры лексического и синтаксического разнообразия. Поскольку авторы часто имеют предпочтения по определенным темам, в исследовательских экспериментах по атрибуции авторства обычно исключают содержательные слова, такие как существительные, прилагательные и глаголы, из набора признаков, сохраняя только структурные элементы текста, чтобы избежать переобучения моделей на тему, а не на характеристики автора. Стилистические признаки часто вычисляются как средние значения по тексту или по всему корпусу работ автора, что дает такие показатели, как средняя длина слова или средняя длина предложения. Это позволяет модели идентифицировать авторов, которые явно предпочитают многословные или лаконичные предложения, но скрывает вариативность: автор, использующий смесь длинных и коротких предложений, будет иметь такое же среднее значение, как и автор, последовательно использующий предложения средней длины. Чтобы учесть такую вариативность, в некоторых экспериментах используются последовательности или паттерны наблюдений вместо средних наблюдаемых частот, отмечая, например, что автор демонстрирует предпочтение определенной модели расстановки акцентов или что автор склонен чередовать последовательности длинных предложений с короткими. Один из первых подходов к идентификации авторства, предложенный Менденхоллом, можно считать агрегирующим наблюдения без их усреднения. Более современные модели атрибуции авторства используют векторные модели пространства для автоматического выявления особенностей стиля автора, но также полагаются на продуманную разработку признаков по тем же причинам, что и более традиционные модели.
or that an author tends to follow a sequence of long sentences with a short one. One of the first approaches to authorship identification, by Mendenhall, can be said to aggregate its observations without averaging them. More recent authorship attribution models use vector space models to automatically capture what is specific to an author's style, but they also rely on judicious feature engineering for the same reasons as more traditional models.
Противоположная стилометрия
Противоположная стилометрия – это практика изменения стиля письма для снижения вероятности установления личности автора или его характеристик с помощью стилометрии. Эта задача также известна как маскировка авторства или анонимизация авторства. Стилометрия представляет собой серьезную угрозу конфиденциальности, поскольку позволяет раскрывать анонимных авторов или связывать псевдонимы с другими личностями автора, что, например, создает проблемы для информаторов, активистов, а также обманщиков и мошенников. Ожидается, что риск для конфиденциальности будет возрастать по мере развития методов машинного обучения и текстовых корпусов. В основе всей противоположной стилометрии лежит идея точного перефразирования исходного текста таким образом, чтобы смысл оставался неизменным, но стилистические признаки были скрыты. Такая точная перефразировка является примером, вводящим в заблуждение, для стилометрического классификатора. Существует несколько основных подходов к решению этой задачи, некоторые из которых пересекаются: имитация, заключающаяся в замене стиля автора на стиль другого автора; перевод, использующий машинный перевод в надежде устранить характерный стиль исходного текста; и маскировка, представляющая собой преднамеренное изменение стиля текста, чтобы он не соответствовал стилю автора. Маскировка стиля вручную возможна, но трудоемка; в некоторых случаях она предпочтительна или необходима. Автоматизированные инструменты, полуавтоматические или полностью автоматические, могут помочь автору. Вопрос о том, как лучше всего выполнять эту задачу и разрабатывать такие инструменты, остается открытым для исследований. Хотя некоторые подходы показали свою способность обходить определенные стилометрические анализы, особенно те, которые не учитывают возможность применения противоположной стилометрии, обеспечение безопасности в отношении неизвестных анализов является сложной задачей. Обеспечение точности перефразировки – критически важная проблема для автоматизированных инструментов. Неизвестно, можно ли обнаружить саму практику противоположной стилометрии. Некоторые исследования показали, что определенные методы оставляют следы в выходном тексте, но стилометрист, не уверенный в том, какие методы могли быть использованы, может не суметь надежно их обнаружить.
Текущие исследования
Современная стилометрия использует компьютеры для статистического анализа, искусственный интеллект и доступ к растущему корпусу текстов, доступных в интернете. Программные системы, такие как Signature (бесплатное программное обеспечение, разработанное Питером Милликаном из Оксфордского университета), JGAAP (программа Java Graphical Authorship Attribution Program, разработанная доктором Патриком Джуолой из Университета Дюкейн), stylo (пакет R с открытым исходным кодом для различных стилометрических анализов, включая установление авторства, разработанный Мачеем Эдером, Яном Рыбицким и Майком Кестемонтом) и Stylene for Dutch (онлайн-бесплатное программное обеспечение, разработанное профессором Уолтером Дейлемансом из Антверпенского университета и доктором Вероникой Хосте из Гентского университета), делают её применение всё более доступным, даже для тех, кто не является экспертом.
ПАН
Семинары PAN (первоначально посвященные анализу плагиата, идентификации авторства и выявлению почти идентичных текстов, а позднее расширенные до семинара по выявлению плагиата, авторства и злоупотреблений в социальных сетях) проводятся с 2007 года, преимущественно в рамках конференций по информационному поиску, таких как ACM SIGIR, FIRE и CLEF. PAN разрабатывает общие задачи для выявления плагиата, идентификации авторства, определения пола автора, профилирования автора, обнаружения вандализма и других связанных задач анализа текста, многие из которых основаны на стилометрии.
Интересные тематические исследования
В 1439 году Лоренцо Валла показал, что «Дарение Константина» является подделкой, аргумент, основанный частично на сравнении латинского языка с языком подлинных документов IV века. В 1952 году шведский священник Дик Хеландер был избран епископом Стрэнгнеса. Кампания была конкурентной, и Хеландера обвинили в написании серии из около ста анонимных клеветнических писем о других кандидатах для избирателей епархии Стрэнгнеса. Хеландер был первоначально признан виновным в написании писем и лишился должности епископа, но позже был частично оправдан. Письма были изучены с использованием ряда стилометрических показателей (а также характеристик пишущей машинки), а различные судебные разбирательства и дальнейшие исследования, многие из которых были инициированы самим Хеландером в течение многих лет до его смерти в 1978 году, подробно обсуждали стилометрический метод и его ценность в качестве доказательства. В 1975 году, после того как Рональд Рейган занимал пост губернатора Калифорнии, он начал еженедельно выпускать радиокомментарии, распространяемые по сотням станций. После публикации его личных записей в 2001 году, в день его 90-летия, исследование с использованием стилостатистических методов позволило определить, какие из этих выступлений были написаны им, а какие – различными помощниками. В 1996 году стилометрический анализ спорной книги под псевдонимом «Первичные цвета», проведенный профессором Вассарского колледжа Дональдом Фостером, привлек внимание широкой общественности к этой теме, правильно определив автора как Джо Клейна. (Этот случай был разрешен только после того, как анализ почерка подтвердил авторство.) В 1996 году стилометрические методы были использованы для сравнения манифеста «Унабомбера» с письмами, написанными одним из подозреваемых, Теодором Качинским, что привело к его аресту и последующему осуждению. В апреле 2015 года исследователи, использующие методы стилометрии, идентифицировали пьесу «Двойная ложь» как произведение Уильяма Шекспира. Исследователи проанализировали 54 пьесы Шекспира и Джона Флетчера, сравнили среднюю длину предложения, изучили использование необычных слов и оценили сложность и психологическую валентность их языка. В 2016 году Макдональд П. Джексон, почетный профессор английского языка в Университете Окленда (Новая Зеландия) и член Королевского общества Новой Зеландии, посвятивший всю свою академическую карьеру анализу атрибуции авторства, написал книгу под названием «Кто написал «Ночь перед Рождеством»? : Анализ вопроса Клемента Кларка Мура против Генри Ливингстона», в которой он оценивает противоположные аргументы и впервые использует методы атрибуции авторства современной вычислительной стилистики для изучения давней полемики. Джексон использует ряд тестов и представляет новый – статистический анализ фонем; он приходит к выводу, что Ливингстон является истинным автором классического произведения. В 2017 году Саймон Фуллер и Джеймс О’Салливан опубликовали исследование, утверждающее, что бестселлеровский автор Джеймс Паттерсон не пишет в своих, по-видимому, написанных в соавторстве романах. По словам О’Салливана, его сотрудничество с бывшим президентом США Биллом Клинтоном, «Президент пропал», является исключением из этого правила. В 2017 году группа лингвистов, специалистов по информатике и ученых проанализировала авторство Елены Ферранте. На основе корпуса, созданного в Университете Падуи и содержащего 150 романов, написанных 40 авторами, они проанализировали стиль Ферранте на основе семи ее романов. Они смогли сравнить ее стиль письма с стилем 39 других писателей, используя, например, stylo. В 2018 году Марк Гликман, старший преподаватель статистики в Гарвардском университете, работал с Райаном Сонгом, бывшим студентом статистики в Гарварде, и Джейсоном Брауном, профессором Университета Далхаузи (Новая Шотландия), применяя стилометрию, чтобы установить, что, скорее всего, песня The Beatles «In My Life» была написана Джоном Ленноном, но с 50% вероятностью, что среднюю восьмерку написал Пол Маккартни. В 2019 году проект ETSO: Стилометрия, примененная к испанскому театру Золотого века, под руководством Альваро Куэльяра и Германа Вега Гарсиа Луэнгоса (Университет Вальядолида), собрал 3000 пьес испанского Золотого века. После применения стилометрического анализа атрибуция пьесы «Женщины и слуги» Лопе де Веге была подтверждена, а в пьесе «La monja alférez», приписываемой Пересу де Монтальбану, была обнаружена проблема авторства, которая, благодаря этим анализам и историко-филологическим исследованиям, в конечном итоге была атрибутирована Хуану Руису де Аларону. В 2023 году тот же проект установил Лопе де Вегу автором пьесы «La francesa Laura» («Француженка Лаура»), несмотря на то, что рукопись была написана спустя годы после его смерти. Комедия была классифицирована как позднее произведение Лопе де Веги и датирована периодом с 1628 по 1630 год, поскольку ее льстивое отношение к Франции можно было объяснить кратковременными хорошими отношениями между Испанией и Францией во время Тридцатилетней войны, при наличии общей вражды к Англии. В этом анализе 500 наиболее часто встречающихся слов исследуемого текста сравниваются с 500 словами из остальных произведений. В случае «La francesa Laura» было обнаружено, что 100 произведений, к которым она наиболее близка, почти все принадлежат Лопе де Веге. Также были проведены методы машинного обучения, такие как анализ с помощью опорных векторов, с широким диапазоном параметров. Традиционный филологический анализ авторства произведений подтвердил результаты стилометрии и искусственного интеллекта. В 2020 году Рейчел Маккарти и Джеймс О’Салливан утверждали, что Эмили Бронте является истинным автором «Грозового перевала», положив конец спекуляциям некоторых критиков о том, что роман мог быть написан одним из ее братьев и сестер, в частности Бранвеллом или Шарлоттой. В 2020 году Хартмут Ильземанн использовал Rolling Delta и Rolling Classify из программного пакета R Stylo, чтобы показать, что корпус Марлоу стилистически неоднороден, и что автор двух «Тамбурлайнов» почти не представлен в остальном официальном корпусе Марлоу. В 2022 году итальянские ученые Симоне Ребора и Массимо Сальгаро показали, используя метод «Дельта-расстояния» Джона Ф. Берроуза, что Феликс Зальтен является наиболее вероятным автором анонимного романа «Жозефина Мутценбахер» 1906 года, за исключением последних страниц. В 2023 году шведский журналист Лапо Лаппин заявил, что два детективных романа шведской писательницы Камиллы Лекберг могут быть написаны литературным рабочим, предположительно ее редактором Паскалем Энгманом. Это заявление сначала было опровергнуто автором и ее представителем, но позже Лекберг признала, что она и Паскаль Энгман тесно сотрудничают, и он редактирует ее тексты.
Данные и методы
Поскольку стилометрия имеет как описательные области применения, используемые для характеристики содержания коллекции, так и идентификационные, например, для определения авторства или категоризации текстов, методы, применяемые для анализа данных и признаков, описанных выше, варьируются от тех, что предназначены для классификации элементов по группам или для распределения элементов в пространстве вариации признаков. Большинство методов носят статистический характер, такие как кластерный и дискриминантный анализ, как правило, основаны на филологических данных и признаках и представляют собой перспективные области применения для современных методов машинного обучения. Если в прошлом стилометрия акцентировала внимание на самых редких или заметных элементах текста, то современные методы способны выделять идентифицирующие закономерности даже в часто встречающихся частях речи. Большинство систем базируются на лексической статистике, то есть используют частоту слов и терминов в тексте для характеристики текста (или его автора). В этом контексте, в отличие от информационного поиска, наблюдаемые модели появления наиболее распространенных слов представляют больший интерес, чем тематические термины, встречающиеся реже. Основным стилометрическим методом является авторский инвариант – свойство, общее для всех текстов, или, по крайней мере, для всех текстов, достаточно длинных для проведения анализа, дающего статистически значимые результаты, написанных данным автором. Примером авторского инварианта является частота служебных слов, используемых автором. В одном из таких методов текст анализируется для определения 50 наиболее часто встречающихся слов. Затем текст разбивается на фрагменты по 5000 слов, и в каждом фрагменте анализируется частота этих 50 слов. Это создает уникальный 50-мерный идентификатор для каждого фрагмента. Эти идентификаторы помещают каждый фрагмент текста в точку в 50-мерном пространстве. Это 50-мерное пространство затем проецируется на плоскость с помощью метода главных компонент (PCA). В результате получается визуализация точек, соответствующих стилю автора. Если два литературных произведения отображаются на одной плоскости, полученная картина может показать, принадлежат ли оба произведения одному и тому же автору или разным авторам.
Статистика по Гаусу
Стилометрические данные распределяются в соответствии с законом Зипфа-Мандельброта. Распределение крайне неравномерное и имеет выраженный пик (лептокуртическое), что является причиной неудач исследователей в решении задач, таких как, например, установление авторства, с помощью статистических методов. Тем не менее, применение гауссовской статистики вполне возможно при использовании преобразования данных.
Нейронные сети
Нейронные сети, особый случай статистических методов машинного обучения, применялись для анализа авторства текстов. Тексты с установленным авторством используются для обучения нейронной сети посредством таких процессов, как обратное распространение ошибки, при котором вычисляется ошибка обучения и используется для корректировки процесса с целью повышения точности. Благодаря процессу, аналогичному нелинейной регрессии, сеть приобретает способность обобщать свои навыки распознавания на новые тексты, с которыми она ранее не сталкивалась, классифицируя их с определенной степенью достоверности. Эти методы были применены к давним спорам о сотрудничестве Шекспира с его современниками Джоном Флетчером и Кристофером Марлоу и подтвердили мнение, основанное на более традиционных исследованиях, о том, что такое сотрудничество действительно имело место. Исследование 1999 года показало, что программа на основе нейронной сети достигла 70% точности в определении авторства стихов, которые она еще не анализировала. В этом исследовании, проведенном в Vrije Universiteit, изучалась идентификация стихотворений трех голландских авторов, используя только последовательности букв, такие как "den". В одном исследовании использовались сети глубокого обучения (DBN) для создания модели проверки авторства, применимой для непрерывной аутентификации (CA). Одной из проблем этого метода анализа является то, что сеть может приобретать предвзятость на основе используемого набора данных для обучения, отдавая предпочтение авторам, тексты которых сеть анализировала чаще. Кроме того, для выявления сознательных стилистических решений были введены специфические и индивидуальные признаки (например, тематическое моделирование и инструменты проверки грамматики). Стандартные стилометрические характеристики использовались для классификации содержания чата посредством мгновенных сообщений или поведения участников, однако попытки идентификации участников чата пока немногочисленны и находятся на ранней стадии. Более того, сходство между устной речью и взаимодействием в чате оставалось без внимания, хотя это является существенным отличием данных чата от любого другого типа письменной информации.