Введение
Онтология, применимая к различным областям знаний. В информационных науках верхняя онтология (также известная как онтология верхнего уровня, верхняя модель или фундаментальная онтология) – это онтология (в понимании, используемом в информационных науках), состоящая из очень общих терминов (таких как "объект", "свойство", "отношение"), которые являются общими для всех областей знаний. Важной функцией верхней онтологии является обеспечение широкой семантической интероперабельности между большим количеством доменно-специфичных онтологий, предоставляя общую отправную точку для формулирования определений. Термины в доменной онтологии располагаются иерархически под терминами в верхней онтологии, например, классы верхней онтологии являются суперклассами или супермножествами всех классов в доменных онтологиях. Было предложено несколько верхних онтологий, каждая из которых имеет своих сторонников. Библиотечные классификационные системы предшествовали системам верхних онтологий. Хотя библиотечные классификации организуют и категоризируют знания, используя общие понятия, которые одинаковы во всех областях знаний, ни одна система не является заменой другой.
In information science, an upper ontology (also known as a top level ontology, upper model, or foundation ontology) is an ontology (in the sense used in information science) that consists of very general terms (such as "object", "property", "relation") that are common across all domains. An important function of an upper ontology is to support broad semantic interoperability among a large number of domain specific ontologies by providing a common starting point for the formulation of definitions. Terms in the domain ontology are ranked under the terms in the upper ontology, e. g., the upper ontology classes are superclasses or supersets of all the classes in the domain ontologies. A number of upper ontologies have been proposed, each with its own proponents. Library classification systems predate upper ontology systems. Though library classifications organize and categorize knowledge using general concepts that are the same across all knowledge domains, neither system is a replacement for the other.
Разработка
Любая стандартная фундаментальная онтология, вероятно, будет подвергаться критике со стороны различных групп, каждая из которых имеет собственное представление о том, "что существует". Одним из факторов, усугубляющих невозможность достижения общего подхода, является отсутствие приложений с открытым исходным кодом, которые позволили бы тестировать различные онтологии в единой вычислительной среде. Таким образом, эти различия в основном обсуждались на теоретическом уровне или являются результатом личных предпочтений. Однако фундаментальные онтологии можно сравнивать на основе их применения для обеспечения интероперабельности между доменными онтологиями. Ни одна конкретная верхняя онтология пока не получила широкого признания в качестве фактического стандарта. Различные организации пытались определить стандарты для конкретных областей. Язык спецификации процессов (PSL), разработанный Национальным институтом стандартов и технологий (NIST), является одним из примеров. Другим важным фактором, препятствующим широкому принятию любой существующей верхней онтологии, является ее сложность. Некоторые верхние онтологии – Cyc часто приводится в качестве примера в этом отношении – очень велики, насчитывают до тысяч элементов (классов, отношений) со сложными взаимодействиями между ними и сложностью, сопоставимой со сложностью человеческого естественного языка, а процесс обучения может быть даже более длительным, чем для естественного языка, из-за незнакомого формата и логических правил. Мотивация к преодолению этого барьера в обучении в значительной степени отсутствует из-за недостатка общедоступных примеров использования. В результате, разработчики доменных онтологий для локальных приложений склонны создавать максимально простые доменно-специфичные онтологии, не связанные с какой-либо верхней онтологией. Такие доменные онтологии могут быть адекватны для решения локальных задач, но их точное сопоставление с другими доменными онтологиями требует значительных усилий. Для решения этой проблемы были разработаны некоторые действительно верхнеуровневые онтологии, которые намеренно проектируются с минимальным пересечением с какими-либо доменными онтологиями. Примерами являются Basic Formal Ontology и DOLCE (см. ниже).
Таблица формальных верхних онтологий
В следующей таблице содержатся данные, в основном из статьи "Сравнение верхних онтологий" В. Маскарди, В. Корди и П. Россо (2007). Имя Первоначальный выпуск Последний выпуск Разработчик Фокус Лицензия URL-адреса Метрики Отличительные особенности Версии Онтология Совы 1999 1999 Джон Ф. Сова Логические, философские и вычислительные основы свободная УО Совы, 30 классов, 5 отношений, 30 аксиом Логическая элегантность, компактность Cyc 1984 версия 6.1 на 2017.11.27 Компания Cycorp (с 1994) повседневные знания здравого смысла, с целью позволить приложениям ИИ выполнять человеческие рассуждения проприетарная, 300 000 концепций, 3 000 000 утверждений (фактов и правил), 15 000 отношений 12 000 синсетов WordNet, огромная OpenCyc, Исследовательский цикл YAMATO 1999 14.07.2012 Доктор Рихиро Мидзогучи Качество и количество, Представления (содержание вещей), Объекты, Процессы и События ? ЯМАТО ? Концепты ролей BFO 2002 BF0 2020 ISO/IEC 21838 2 Барри Смит и др. Онтология верхнего уровня для содействия интероперабельности доменных онтологий BSD License 34 категории, 8 отношений; формализации в OWL, CLIF, OBO и Isabel очень большая устоявшаяся пользовательская база; тщательная документация Version 2.0 gist 2007 Version 11.0.0 на 2022 Semantic Arts, Inc. Минималистичная верхняя онтология для корпоративных информационных систем свободная, Creative Commons Share Alike 143 класса, 132 свойства, 9 примитивных классов, 18 корневых классов, 1690 аксиом Основа для около дюжины крупных корпоративных онтологий BORO конец 1980-х и начало 1990-х годов Команда консультантов KPMG во главе с Крисом Партриджем Экстенсиональная (и, следовательно, четырехмерная) онтология, обеспечивающая простые критерии идентичности. Построена на серии четких метафизических выборов для обеспечения прочной (метафизической) основы. GFO1999 2008 (в разработке) Heinrich Herre Включает многие аспекты современной философии Открытая 2008 Ее описание персистентности и модель времени. gfo.owl и gfo basic.owl IDEAS IDEAS Group Более высокого порядка, экстенсиональная и 4D. Разработана с использованием метода BORO. Онтология IDEAS не предназначена для рассуждений и выводов; ее цель – быть точной моделью бизнеса. ISO 15926 2003 EPISTLE Европейская промышленность процессов STEP Техническая связь Исполнительный Достаточно общая, чтобы охватить любое предприятие, если доступна подходящая библиотека справочных данных. Свободна в использовании. Библиотека справочных данных охватывает 40 000 концепций, расширяемая пользователем. Для интеграции информации о жизненном цикле модель является 4D и исключает все информационные ограничения, применимые только к конкретным приложениям в области применения. ISO 15926 2:2003 SUMO 2004 SUMO v 1.75 на 2007 Рабочая группа IEEE P1600.1 Для исследований и приложений в поиске, лингвистике и рассуждениях. Открытый исходный код. Общее количество терминов: 13457, Общее количество аксиом: 193812, Общее количество правил: 6055 Самая большая формальная общедоступная онтология на сегодняшний день. Сопоставлена со всем словарным запасом WordNet. UMO 1.52 UMBEL 2008 версия 1.50 на 2016 Structured Dynamics Связывание информации из различных источников друг с другом. CC by 3.0 Около 35 000 референсных концепций Разработана для предоставления общих точек сопоставления для связи различных онтологий или схем друг с другом. UMBEL 1.50 WordNet середина 1980-х Версия 3.1 на 2011 год Принстонский университет Семантическая сеть, основанная на психолингвистических принципах. BSD-подобная 155 327 слов, организованных в 175 979 синсетов, что составляет в общей сложности 207 016 пар значений слов; Не аксиоматически точная. Используется в исследованиях обработки естественного языка. Версия 3.1
Основная формальная онтология (BFO)
Фреймворк Basic Formal Ontology (BFO), разработанный Барри Смитом и его коллегами, состоит из серии субонтологий различной степени детализации. Онтологии подразделяются на два типа: онтологии, относящиеся к континуативным сущностям, таким как трехмерные устойчивые объекты, и онтологии, относящиеся к оккуррентным сущностям (преимущественно) – процессам, понимаемым как разворачивающимся в последовательных фазах во времени. Таким образом, BFO объединяет как трехмерный, так и четырехмерный взгляд на реальность в рамках единой структуры. Взаимосвязи между этими двумя типами онтологий определены таким образом, что BFO позволяет учитывать как статические/пространственные, так и динамические/временные аспекты реальности. Онтология континуативной области, производная от BFO, может рассматриваться как перечень сущностей, существующих в определенный момент времени. Каждая оккуррентная онтология может рассматриваться как перечень процессов, разворачивающихся в течение заданного временного интервала. Как сам BFO, так и каждая из его субонтологий-расширений могут рассматриваться как окно в определенную часть реальности на заданном уровне детализации. Более 350 онтологических фреймворков, основанных на BFO, каталогизированы на веб-сайте BFO. Они применяют архитектуру BFO к различным областям посредством стратегии нисходящего уточнения. Например, Онтология клетки уточняется нисходящим образом от BFO, импортируя ветвь BFO, завершающуюся понятием «объект», и определяя клетку как подтип объекта. Другими примерами онтологий, расширяющих BFO, являются Ontology for Biomedical Investigations (OBI) и другие онтологии Open Biomedical Ontologies Foundry. Помимо этих примеров, BFO и его расширения все чаще используются в областях обороны и безопасности, например, в рамках Common Core Ontology. BFO также служит верхним уровнем Интерфейсной онтологии Целей устойчивого развития (ЦУР), разработанной Программой ООН по окружающей среде, и инициативы Industrial Ontologies Foundry (IOF) в обрабатывающей промышленности. BFO подробно описан в учебнике Building Ontologies with Basic Formal Ontology, опубликованном издательством MIT Press в 2015 году.
Боро
Business Objects Reference Ontology – это верхняя онтология, разработанная для создания онтологических или семантических моделей для крупных и сложных операционных приложений, включающая в себя базовую онтологию и методологию её построения. Она базируется на четких метафизических принципах, обеспечивающих надежный (метафизический) фундамент. Ключевым принципом был выбор экстенсиональной (и, следовательно, четырехмерной) онтологии, предоставляющей простой критерий идентичности. Отдельные элементы онтологии нашли отражение в ряде стандартов. Например, стандарт ISO 15926 – Системы автоматизации производства и интеграция – был существенно подвержен влиянию ранней версии BORO. Стандарт IDEAS (International Defence Enterprise Architecture Specification for exchange) основан на BORO, который, в свою очередь, послужил основой для разработки DODAF 2.0.
Космо
COSMO (COmmon Semantic MOdel) – это онтология, разработка которой началась как проект рабочей группы COSMO в Координационной рабочей группе по онтологиям и таксономиям с целью создания базовой онтологии, способной обеспечить широкую общую семантическую интероперабельность. Текущая версия представляет собой онтологию OWL, однако в будущем планируется создание версии, соответствующей Common Logic. Онтология и сопроводительная документация доступны на сайте COSMO. Целью рабочей группы COSMO было создание фундаментальной онтологии посредством совместной работы, позволяющей представить все основные онтологические элементы, необходимые, по мнению всех участников, для их приложений. Разработка COSMO полностью открыта, и любые комментарии и предложения приветствуются. После обсуждений и вклада участников в 2006 году, развитие COSMO в основном осуществлял Патрик Кэссиди, председатель рабочей группы COSMO. Вклад и предложения от всех заинтересованных сторон по-прежнему приветствуются и поощряются. Многие типы (классы OWL) в текущей версии COSMO были заимствованы из OpenCyc OWL версии 0.78 и SUMO. Другие элементы были взяты из других онтологий (таких как BFO и DOLCE) или разработаны специально для COSMO. Изначально разработка COSMO была сосредоточена на включении представлений всех слов из Контролируемого определяющего словаря Словаря современного английского языка Лонгмана (LDOCE) – всего 2148 слов. Этих слов достаточно для лингвистического определения всех статей в LDOCE. Предполагается, что онтологическое представление концепций, соответствующих этим терминам, будет достаточно для определения значений любого специализированного онтологического элемента, тем самым служа основой для общей семантической интероперабельности. Интероперабельность посредством COSMO обеспечивается использованием COSMO (или онтологии, производной от него) в качестве интерлингвы, позволяющей переводить доменные онтологии на термины друг друга и, таким образом, обеспечивать точную коммуникацию. По мере подключения новых доменов к COSMO, могут быть выявлены и добавлены в его структуру дополнительные семантические примитивы. Текущая (январь 2021) версия OWL COSMO содержит более 24000 типов (классов OWL), более 1350 отношений и более 21000 ограничений. Сама COSMO (COSMO.owl) и другие связанные файлы и документация доступны по ссылке на COSMO в разделе «Внешние ссылки» ниже.
Циклон
Хорошо известной и весьма всеобъемлющей онтологией, доступной в настоящее время, является Cyc – проприетарная система, разрабатываемая с 1986 года и состоящая из базовой онтологии и нескольких предметно-ориентированных онтологий (называемых микротеориями). Часть этой онтологии была выпущена в свободный доступ под названием OpenCyc, а более полная версия предоставляется для бесплатного некоммерческого использования под названием ResearchCyc.
Дольче
Описательная онтология для лингвистической и когнитивной инженерии (DOLCE) – это фундаментальная онтология, разработанная в 2002 году в рамках проекта WonderWeb ЕС, Николой Гуарино и его коллегами в Лаборатории прикладной онтологии (LOA). Как следует из её аббревиатуры, DOLCE ориентирована на представление онтологических категорий, лежащих в основе естественного языка и человеческого здравого смысла. Однако DOLCE не придерживается строго референциалистской метафизики, связанной с внутренней природой мира. Скорее, категории, которые она вводит, рассматриваются как когнитивные артефакты, в конечном счёте зависящие от человеческого восприятия, культурных особенностей и социальных условностей. В этом смысле они задумывались как описательные (в отличие от предписывающих) понятия, поддерживающие формальное описание концептуализации предметной области. DOLCE Ultralite, разработанный Альдо Гангеми и коллегами из Лаборатории семантических технологий Национального исследовательского совета (Италия), является версией DOLCE на языке веб-онтологий (OWL). Она упрощает некоторые модальные аксиомы DOLCE и расширяет её, включая фреймворк описаний и ситуаций, также разработанный в проекте WonderWeb. DOLCE Ultralite является источником некоторых основных шаблонов проектирования онтологий и широко используется в онтологических проектах по всему миру.
Общая формальная онтология (GFO)
Общая формальная онтология (GFO), разработанная Генрихом Херре и его коллегами из исследовательской группы Onto Med в Лейпциге, является реалистичной онтологией, интегрирующей процессы и объекты. Она стремится включить в себя многие аспекты современной философии, что отражается как в её таксономическом дереве, так и в её аксиоматизации. GFO допускает различные аксиоматизации своих категорий (например, существование атомарных временных интервалов в отличие от континуального времени). Основные принципы GFO опубликованы в отчёте Onto Med № 8 и в книге «Общая формальная онтология (GFO): фундаментальная онтология для концептуального моделирования». Две особенности GFO, среди прочих, – это её подход к персистенции и её модель времени. В отношении персистенции, различие между эндюрантами (объектами) и пердурантами (процессами) явно выражено в GFO посредством введения специальной категории – персистента. Персистент – это особая категория, экземпляры которой предназначены для того, чтобы «оставаться тождественными» (с течением времени). Что касается времени, то в GFO временные интервалы рассматриваются как первичные, а моменты времени (называемые «временными границами») – как производные. Более того, моменты времени могут совпадать, что удобно для моделирования мгновенных изменений.
суть
gist разработана и поддерживается компанией Semantic Arts. gist (не акроним – означает «уловить суть») – это «минималистичная верхняя онтология». gist ориентирована на корпоративные информационные системы, хотя также применялась в приложениях для здравоохранения. gist использовалась для создания корпоративных онтологий для ряда крупных коммерческих и государственных организаций, включая: Procter & Gamble, Sentara Healthcare, Департамент труда и промышленности штата Вашингтон, LexisNexis, Sallie Mae и две крупные финансовые компании. gist распространяется бесплатно под лицензией Creative Commons Attribution-ShareAlike. gist активно поддерживается и используется уже более 10 лет. По состоянию на октябрь 2020 года её версия – 9.4.
gist была предметом исследования, посвященного преодолению различий в моделях онтологий. В статье, описывающей методологию OQuaRE для оценки онтологий, онтология единиц измерения gist (на тот момент – отдельный модуль) показала наивысший результат в ручной оценке среди 10 других онтологий единиц измерения и превысила средний балл в автоматизированной оценке. Авторы отметили: «Эту онтологию можно легко протестировать и проверить, её знания можно эффективно повторно использовать и адаптировать для различных конкретных сред».
ISO 15926
ISO 15926 — это международный стандарт для представления информации о жизненном цикле промышленных предприятий. Это представление специфицируется обобщенной концептуальной моделью данных, которая может служить основой для реализации в единой базе данных или хранилище данных. Модель данных предназначена для использования совместно со справочными данными: стандартными экземплярами, представляющими информацию, общую для ряда пользователей, промышленных предприятий или и того, и другого. Поддержка конкретной фазы жизненного цикла зависит от использования соответствующих справочных данных в сочетании с моделью данных. Для обеспечения интеграции информации о жизненном цикле модель исключает все ограничения, применимые только к конкретным приложениям в рамках ее области применения. ISO 15926-2 определяет обобщенную модель, включающую 201 тип сущностей. Она была разработана Техническим комитетом ISO/TC 184 «Системы промышленной автоматизации и интеграции», Подкомитетом SC 4 «Промышленные данные».
SUMO (предлагаемая верхняя объединенная онтология)
Предложенная Верхняя Объединенная Онтология (SUMO) – ещё один всеобъемлющий онтологический проект. Она включает в себя верхнюю онтологию, разработанную рабочей группой IEEE P1600.1 (первоначально Иэном Найлсом и Адамом Писом). Она расширена множеством доменных онтологий и полным набором связей с WordNet. Она имеет открытый исходный код.
UMBEL
Верхний уровень сопоставления и привязки (UMBEL) — это онтология, содержащая 28 000 эталонных концепций, которая сопоставляется с упрощенным подмножеством онтологии OpenCyc и предназначена для обеспечения связи между точной онтологией OpenCyc и менее формализованными онтологиями. Также имеются формальные сопоставления с Wikipedia, DBpedia, PROTON и GeoNames. Разработка и поддержка UMBEL осуществляется компанией Structured Dynamics как проект с открытым исходным кодом.
WordNet (англ.)
WordNet, свободно доступная база данных, первоначально разработанная как семантическая сеть на основе психолингвистических принципов, была расширена за счет добавления определений и теперь также рассматривается как словарь. Она квалифицируется как верхняя онтология, поскольку включает в себя как наиболее общие понятия, так и более специализированные, связанные друг с другом не только отношениями подчинения, но и другими семантическими отношениями, такими как «часть от» и «причина». Однако, в отличие от Cyc, она не была формально аксиоматизирована для того, чтобы сделать логические связи между понятиями четкими. Она широко используется в исследованиях в области обработки естественного языка.