Введение

Ключевое слово, присвоенное информации

В информационных системах тег – это ключевое слово или термин, присваиваемый фрагменту информации (например, интернет-закладке, мультимедийному файлу, записи базы данных или компьютерному файлу). Этот вид метаданных помогает описать элемент и позволяет находить его снова путем просмотра или поиска. Теги обычно выбираются неформально и индивидуально создателем элемента или пользователем, в зависимости от системы, хотя они также могут быть выбраны из контролируемого словаря. Тегирование получило распространение благодаря веб-сайтам, связанным с Web 2.0, и является важной функцией многих сервисов Web 2.0. В настоящее время оно также используется в других системах баз данных, настольных приложениях и операционных системах.

Обзор

Люди используют теги для облегчения классификации, обозначения собственности, указания границ и идентификации в сети. Теги могут быть представлены словами, изображениями или другими идентификационными знаками. Аналогичным примером тегов в реальном мире является маркировка музейных экспонатов. Люди использовали текстовые ключевые слова для классификации информации и объектов задолго до появления компьютеров. Алгоритмы компьютерного поиска сделали использование таких ключевых слов быстрым способом поиска по записям. Тегирование получило распространение благодаря развитию социальных закладок, сервисов обмена изображениями и социальных сетей. TaggTool – это приложение для Windows, позволяющее добавлять теги к файлам и отображать облако тегов. На веб-сайтах, агрегирующих теги всех пользователей, теги отдельного пользователя могут быть полезны как ему самому, так и всему сообществу пользователей сайта. Системы тегирования иногда классифицируются на два типа: сверху вниз и снизу вверх. Другие объединяют подходы сверху вниз и снизу вверх, в том числе в некоторых крупных библиотечных каталогах (OPAC), таких как WorldCat. Когда теги или другие таксономии обладают дополнительными свойствами (или семантикой), такими как связи и атрибуты, они формируют онтологию, как, например, интеллектуальные теги в Microsoft Office.

История

Использование ключевых слов как части системы идентификации и классификации задолго предшествует компьютерам. Бумажные устройства хранения данных, особенно перфокарты с вырезами на краях, позволявшие классифицировать и сортировать по нескольким критериям, уже использовались до двадцатого века, а фасетная классификация применялась в библиотеках с 1930-х годов. В конце 1970-х и начале 1980-х годов текстовый редактор Emacs для Unix предлагал сопутствующую программу под названием Tags, которая могла автоматически создавать таблицу перекрестных ссылок, называемую таблицей тегов, которую Emacs мог использовать для перехода между вызовом функции и определением этой функции. Это использование слова "tag" не относилось к метаданным, а было ранним применением слова "tag" в программном обеспечении для обозначения словарного указателя. Онлайн-базы данных и ранние веб-сайты использовали ключевые теги как способ помочь пользователям находить контент. В первые дни Всемирной паутины веб-дизайнеры использовали мета-элемент keywords, чтобы сообщить поисковым системам, о чем веб-страница, но эти ключевые слова были видны только в исходном коде страницы и не подлежали изменению пользователями. В 1997 году коллаборативный портал "Описание экватора и некоторых других земель" (A Description of the Equator and Some ØtherLands), созданный documenta X в Германии, использовал термин "tag" (в духе народной таксономии) для обозначения соавторов и приглашенных авторов на странице загрузки. В проекте "Экватор" термин "tag" для пользовательского ввода был описан как абстрактный литерал или ключевое слово, призванное помочь пользователю. Однако пользователи определяли отдельные теги и на тот момент не делились ими. В 2003 году сайт социальных закладок Delicious предоставил пользователям возможность добавлять "теги" к своим закладкам (чтобы облегчить их последующий поиск). В течение нескольких лет сайт обмена фотографиями Flickr позволил своим пользователям добавлять собственные текстовые теги к каждой фотографии, создавая гибкие и удобные метаданные, делавшие фотографии легко находимыми. Успех Flickr и влияние Delicious популяризировали эту концепцию, и другие социальные веб-сервисы, такие как YouTube, Technorati и Last.fm, также внедрили систему тегирования. В 2005 году стандарт веб-синдикации Atom предоставил элемент "category" для вставки тематических категорий в веб-каналы, а в 2007 году Тим Брей предложил URN для "tag".

В блоге

Многие системы (и другие системы управления веб-контентом) позволяют авторам добавлять теги произвольной формы к записи, наряду с (или вместо) отнесения записи к заранее определенной категории. Например, запись может отображать информацию о том, что она помечена тегами "бейсбол" и "билеты". Каждый из этих тегов обычно представляет собой веб-ссылку, ведущую на индексную страницу со списком всех записей, связанных с этим тегом. В блоге может быть боковая панель, отображающая все используемые теги, при этом каждый тег ведет на индексную страницу. Чтобы изменить классификацию записи, автор редактирует список её тегов. Все связи между записями автоматически отслеживаются и обновляются программным обеспечением блога; нет необходимости перемещать запись в сложной иерархии категорий.

В приложении

Некоторые настольные и веб-приложения имеют собственные системы тегирования, например, тегирование электронной почты в Gmail и Mozilla Thunderbird, аудиофайлов в iTunes или Winamp, и фотографий в различных приложениях. Некоторые из этих приложений отображают коллекции тегов в виде облаков тегов.

Присвоено компьютерным файлам

Существуют различные системы для присвоения тегов файлам в файловой системе компьютера. В Mac System 7 от Apple, выпущенном в 1991 году, пользователи могли назначить один из семи редактируемых цветных меток (с редактируемыми именами, такими как "Essential", "Hot" и "In Progress") каждому файлу и папке. В более поздних версиях операционной системы Mac, начиная с выпуска OS X 10.9 в 2013 году, пользователи могли назначать несколько произвольных тегов как расширенные атрибуты файла любому файлу или папке, а до этого времени стандарт OpenMeta с открытым исходным кодом предоставлял аналогичные возможности маркировки для Mac OS X. Для ядра Linux доступно несколько семантических файловых систем, реализующих теги, включая Tagsistant. Microsoft Windows позволяет пользователям устанавливать теги только для документов Microsoft Office и некоторых типов файлов изображений. К кроссплатформенным стандартам файловой маркировки относится Extensible Metadata Platform (XMP) – стандарт ISO для встраивания метаданных в популярные форматы файлов изображений, видео и документов, такие как JPEG и PDF, без нарушения их читаемости приложениями, не поддерживающими XMP. XMP во многом заменил более раннюю модель обмена информацией IPTC. Exif – это стандарт, определяющий форматы файлов изображений и аудио, используемые цифровыми камерами, включая некоторые метатеги. TagSpaces – это кроссплатформенное приложение с открытым исходным кодом для маркировки файлов; оно вставляет теги непосредственно в имя файла.

Для мероприятия

Официальный тег — это ключевое слово, используемое мероприятиями и конференциями для того, чтобы участники могли добавлять его к своим веб-публикациям, таким как записи в блогах, фотографии с мероприятия и слайды презентаций. Это позволяет поисковым системам индексировать эти публикации и находить релевантные материалы о мероприятии единообразным способом. В данном случае тег является частью контролируемого словаря.

В исследованиях

Исследователь может работать с большой коллекцией элементов (например, цитаты из прессы, библиография, изображения) в цифровом формате. Если он или она хочет связать каждый элемент с небольшим числом тем (например, с главами книги или с подтемами общей темы), то к каждому элементу в коллекции можно прикрепить набор тегов, соответствующих этим темам. Таким образом, свободная классификация позволяет автору эффективно управлять большим объемом информации, который в противном случае был бы неудобен в обработке.

Тройные метки

Тройной тег или машинный тег использует специальный синтаксис для определения дополнительной семантической информации о теге, что облегчает или делает более осмысленной его интерпретацию компьютерной программой. Тройные теги состоят из трех частей: пространства имен, предиката и значения. Например, geo:long=50.123456 – это тег для географической долготы, значение которой равно 50.123456. Эта тройная структура аналогична модели Resource Description Framework для информации. Формат тройных тегов был впервые разработан для Geolicious в ноябре 2004 года для отображения закладок Delicious и получил более широкое распространение после его внедрения Mappr и GeoBloggers для отображения фотографий Flickr. В январе 2007 года Аарон Строп Коуп из Flickr предложил термин «машинный тег» как альтернативное название для тройного тега, сопроводив его вопросами и ответами о назначении, синтаксисе и использовании. Специализированные метаданные для географической идентификации известны как геотеги; машинные теги также используются и для других целей, например, для идентификации фотографий, сделанных на определенном мероприятии, или для обозначения видов с использованием биномиальной номенклатуры.

Хештаги

Хэштег – это вид метаданных, помечаемый префиксом #, иногда называемый символом «решётки». Эта форма тегирования используется в микроблогах и социальных сетях, таких как Twitter, Facebook, Google+, VK и Instagram. Решётка используется для выделения текста тега, отличая его от остального текста в публикации.

Знаковые теги

Знаниевой тег – это тип метаинформации, который описывает или определяет определенный аспект информации (например, документ, цифровое изображение, таблицу базы данных или веб-страницу). Знаниевые теги – это нечто большее, чем традиционные неиерархические ключевые слова или термины; они представляют собой тип метаданных, который фиксирует знания в форме описаний, категорий, классификаций, семантики, комментариев, заметок, аннотаций, гиперданных, гиперссылок или ссылок, объединенных в профили тегов (разновидность онтологии). В знаниевых тегах могут быть зафиксированы различные виды знаний, включая фактические знания (содержащиеся в книгах и данных), концептуальные знания (основанные на взглядах и концепциях), знания об ожиданиях (необходимые для принятия решений и выдвижения гипотез) и методологические знания (полученные в результате рассуждений и стратегий).

Преимущества и недостатки

В типичной системе тегирования отсутствует явная информация о значении или семантике каждого тега, и пользователь может присваивать новые теги элементу так же легко, как и старые. Например, тег "orange" может относиться как к фрукту, так и к цвету, а элементы, связанные с версией ядра Linux, могут быть помечены как "Linux", "ядро", "Пингвин", "программное обеспечение" или множеством других терминов. Пользователи также могут выбирать теги, представляющие собой различные формы одного и того же слова (например, единственное и множественное число), что может затруднить навигацию, если система не выполняет стемминг тегов при поиске или просмотре. Более крупные фольксономии решают некоторые проблемы тегирования, поскольку пользователи таких систем обычно замечают текущее использование "терминов тегирования" внутри этих систем и, следовательно, используют существующие теги для установления связей с другими элементами. Таким образом, фольксономии могут коллективно вырабатывать частичный набор правил тегирования.

Динамика сложной системы

Несмотря на кажущееся отсутствие контроля, исследования показали, что в системах социальных закладок возникает простая форма общего словаря. Коллективное присваивание меток демонстрирует динамику сложных систем (или самоорганизующуюся динамику). Таким образом, даже если никакой централизованный контролируемый словарь не ограничивает действия отдельных пользователей, распределение тегов со временем сходится к устойчивым степенным распределениям.

Спам

Системы тегирования, открытые для публичного доступа, также подвержены спаму тегами, когда люди добавляют к элементу (например, видео на YouTube) избыточное количество тегов или теги, не имеющие к нему отношения, с целью привлечения внимания зрителей. Это злоупотребление можно уменьшить, используя ручную или статистическую идентификацию спама. Также можно ограничить количество допустимых тегов для снижения количества спама.

Синтаксис

Некоторые системы тегирования предоставляют одно текстовое поле для ввода тегов, поэтому для возможности токенизации строки необходимо использовать разделитель. Наиболее распространенными разделителями являются пробел и запятая. Чтобы разрешить использование разделителей в тегах, система может допускать разделители более высокого уровня (например, кавычки) или управляющие символы. Системы могут избежать использования разделителей, разрешая добавление только одного тега в каждый элемент ввода за раз, хотя это делает добавление нескольких тегов более длительным по времени. Для использования в HTML можно использовать микроформат rel tag, который использует атрибут rel со значением "tag" (то есть rel="tag") для обозначения того, что связанная страница действует как тег для текущего контекста.