Введение
Идентифицируемый объект в World Wide Web
Веб-ресурс – это любой идентифицируемый ресурс (цифровой, физический или абстрактный), находящийся в World Wide Web или связанный с ним. Ресурсы идентифицируются с помощью универсальных идентификаторов ресурсов (URI). В Семантической сети веб-ресурсы и их семантические свойства описываются с использованием структуры описания ресурсов (RDF). Концепция веб-ресурса эволюционировала на протяжении истории сети: от раннего представления о статических адресуемых документах или файлах до более общего и абстрактного определения, которое теперь охватывает любой "объект" или сущность, которую можно идентифицировать, именовать, адресовать или обрабатывать любым способом в сети в целом или в любой сетевой информационной системе. Декларативные аспекты ресурса (идентификация и наименование) и его функциональные аспекты (адресация и техническая обработка) не были чётко разграничены в ранних спецификациях сети, и само определение этой концепции остаётся предметом длительных и продолжающихся дискуссий, затрагивающих сложные и зачастую эзотерические технические, социальные, лингвистические и философские вопросы.
От документов и файлов до веб-ресурсов
В ранних спецификациях сети (1990–1994) термин «ресурс» практически не используется. Веб был разработан как сеть более или менее статических объектов, адресуемых, по сути, файлов и документов, связанных с помощью универсальных указателей ресурсов (URL). Веб-ресурс подразумевается как нечто, что может быть идентифицировано. Идентификация выполняет две различные функции: именование и адресацию; последняя зависит только от протокола. Стоит отметить, что RFC 1630 вообще не пытается определить понятие «ресурс»; фактически, он редко использует этот термин, за исключением его упоминания в универсальном идентификаторе ресурса (URI), универсальном указателе ресурсов (URL) и универсальном имени ресурса (URN), и продолжает говорить об «объектах сети». RFC 1738 (декабрь 1994) уточняет URL, при этом термин «универсальный» заменяется на «унифицированный». В этом документе термин «ресурс» используется более систематически для обозначения объектов, которые «доступны» или «могут быть найдены и к ним можно получить доступ» через интернет. И снова сам термин «ресурс» не определяется явно.
Ресурсы в RDF и Семантической Сети
Впервые представленный в 1999 году, RDF изначально разрабатывался для описания ресурсов, то есть для стандартизированного определения метаданных ресурсов. Описание ресурса в RDF представляет собой набор троек (субъект, предикат, объект), где субъект обозначает описываемый ресурс, предикат – тип свойства, относящегося к этому ресурсу, а объект может быть данными или другим ресурсом. Сам предикат рассматривается как ресурс и идентифицируется URI. Таким образом, свойства, такие как "название" и "автор", в RDF представлены как ресурсы, которые могут рекурсивно использоваться в качестве субъекта других троек. Основываясь на этом рекурсивном принципе, RDF-словари, такие как RDF Schema (RDFS), Web Ontology Language (OWL) и Simple Knowledge Organization System, содержат определения абстрактных ресурсов, таких как классы, свойства и концепции, все из которых идентифицируются URI. RDF также определяет понятие анонимных ресурсов или пустых узлов, которые не имеют однозначной идентификации через URI.
Использование HTTP URI для идентификации абстрактных ресурсов
URL-адреса, особенно HTTP-URI, часто используются для идентификации абстрактных ресурсов, таких как классы, свойства или другие типы концепций. Примеры можно найти в RDFS или OWL онтологиях. Поскольку такие URI связаны с протоколом HTTP, возник вопрос о том, какое представление, если таковое имеется, следует получить для таких ресурсов через этот протокол, обычно с помощью веб-браузера, и может ли сам синтаксис URI помочь разграничить "абстрактные" ресурсы от "информационных" ресурсов. Спецификации URI, такие как RFC 3986, оставили задачу определения действий, выполняемых с ресурсами, спецификации протокола и не дают ответа на этот вопрос. Было предложено, чтобы HTTP-URI, идентифицирующий ресурс в исходном смысле, такой как файл, документ или любой вид так называемого информационного ресурса, должен быть "slash" URI, то есть не должен содержать идентификатор фрагмента, в то время как URI, используемый для идентификации концепции или абстрактного ресурса, должен быть "hash" URI, использующим идентификатор фрагмента. Например, http://www.example.org/catalogue/widgets.html будет идентифицировать и указывать местоположение веб-страницы (возможно, предоставляя удобочитаемое описание виджетов, продаваемых Silly Widgets, Inc.), в то время как http://www.example.org/ontology#Widget идентифицирует абстрактную концепцию или класс "Widget" в этой онтологии компании и не обязательно будет извлекать какой-либо физический ресурс через протокол HTTP. Однако было отмечено, что такое различие невозможно обеспечить на практике, и известные стандартные словари предоставляют широко используемые контрпримеры. Например, концепции Dublin Core, такие как "title", "publisher", "creator", идентифицируются с помощью "slash" URI, например http://purl.org/dc/elements/1.1/title. Общий вопрос о том, какие типы ресурсов HTTP URI должны или не должны идентифицировать, ранее был известен в W3C как проблема httpRange 14, по названию в списке, определенном (TAG). В 2005 году TAG предоставил окончательный ответ на этот вопрос, сделав различие между "информационным ресурсом" и "неинформационным" ресурсом зависимым от типа ответа, данного сервером на запрос "GET":
2xx Success указывает, что ресурс является информационным ресурсом. 303 See Other указывает, что ресурс может быть информационным или абстрактным; целевой объект перенаправления может дать ответ. 4xx Client Error не предоставляет никакой информации. Это позволяет словарям (таким как Dublin Core, FOAF и Wordnet) продолжать использовать слэш вместо хэша по прагматическим причинам. Хотя этот компромисс, по-видимому, достиг консенсуса в сообществе Semantic Web, некоторые его видные члены, такие как Пэт Хейс, выразили обеспокоенность как по поводу его технической осуществимости, так и концептуальной основы. По мнению Патрика Хейса, само различие между "информационным ресурсом" и "другим ресурсом" невозможно установить и лучше вообще не определять, а неоднозначность референтного ресурса присуща URI, как и любому механизму именования.
Собственность ресурсов, интеллектуальная собственность и доверительные отношения
В RDF действует принцип: "любой может заявить что угодно о чем угодно". Ресурсы определяются формальными описаниями, которые любой может публиковать, копировать, изменять и распространять в сети. Если содержание веб-ресурса в классическом понимании (веб-страница или онлайн-файл) однозначно принадлежит его издателю, который может заявлять права интеллектуальной собственности на него, то абстрактный ресурс может быть определен совокупностью RDF-описаний, не обязательно контролируемых одним издателем и не обязательно согласованных между собой. Открытым остается вопрос о том, должен ли ресурс иметь авторитетное определение с четкой и надежной принадлежностью, и в этом случае, как технически отличить такое описание от других. Параллельно возникает вопрос о применимости прав интеллектуальной собственности к подобным описаниям.