Введение
Фраза, которая встречается чаще в одной работе, чем в большом выборе фразы, не соответствующей статистической вероятности (SIP) - фраза или набор слов, которые встречаются чаще в документе (или сборнике документов), чем в более крупном корпусе. Амазонка. Кристиан Рудер также использовал эту концепцию с данными из онлайн-профилей знакомств и сообщений в Твиттере, чтобы определить фразы, наиболее характерные для данной расы или пола в своей книге Dataclysm . СИП с лингвистической плотностью двух или трех слов, прилагательного, прилагательного, существительного или прилагательного, прилагательного, глагола, будут сигнализировать о отношении автора, предпосылке или выводах читателю или выражать важную идею. Еще одно применение SIP - это инструмент обнаружения плагиата. (Почти) уникальные комбинации слов можно найти в Интернете, и если они появились в опубликованном тексте, поиск определит, где. Этот метод проверяет только те тексты, которые были опубликованы и оцифрованы в Интернете. Например, заявка, написанная, скажем, студентом, содержащая фразу "стиль сада, восхваляющий нерегулярность в дизайне", может быть найдена при помощи Google. com и приведет оригинальную статью Википедии о сэре Уильяме Темпле, английском политическом деятеле и эссеисте.
A statistically improbable phrase (SIP) is a phrase or set of words that occurs more frequently in a document (or collection of documents) than in some larger corpus. Amazon. com uses this concept in determining keywords for a given book or chapter, since keywords of a book or chapter are likely to appear disproportionately within that section. Christian Rudder has also used this concept with data from online dating profiles and Twitter posts to determine the phrases most characteristic of a given race or gender in his book Dataclysm. SIPs with a linguistic density of two or three words, adjective, adjective, noun or adverb, adverb, verb, will signal the author's attitude, premise or conclusions to the reader or express an important idea. Another use of SIPs is as a detection tool for plagiarism. (Almost) unique combinations of words can be searched for online, and if they have appeared in a published text, the search will identify where. This method only checks those texts that have been published and that have been digitized online. For example, a submission by, say, a student that contained the phrase "garden style, praising irregularity in design", might be searched for using Google. com and will yield the original Wikipedia article about Sir William Temple, English political figure and essayist.
Пример
В документе о компьютерах наиболее распространенным словом, вероятно, будет слово "the", но поскольку "the" является наиболее часто используемым словом в английском языке, вполне вероятно, что любой документ будет использовать "the" очень часто. Однако фраза вроде "explicit Boolean algorithm" может встречаться в документе с гораздо более высокой частотой, чем ее средняя частота в английском языке. Следовательно, это фраза, которая вряд ли встречается в любом документе, но встречается в данном документе. "Очевидный булевой алгоритм" - это статистически маловероятная фраза. Статистически невероятными фразами из "О происхождении видов" Дарвина могут быть: умеренные продукты, роды, происходящие от потомков, переходные градации, неизвестный прародитель, окаменелости, наши домашние породы, модифицированное потомство, сомнительные формы, близкородственные формы, выгодные вариации, чрезвычайно отдаленные, переходные классы, очень отличные виды и потомство миндалей.