Введение

Визуальное представление частоты слов

Облако тегов (также известное как облако слов или взвешенный список в визуальном дизайне) — это визуальное представление текстовых данных, которое часто используется для отображения метаданных ключевых слов на веб-сайтах или для визуализации неструктурированного текста. Теги обычно состоят из отдельных слов, а значимость каждого тега отображается размером шрифта или цветом. При использовании в качестве элементов навигации по сайту, термины являются гиперссылками на соответствующие элементы, связанные с тегом.

История

В языке визуального дизайна, облако тегов (или облако слов) — это один из видов «взвешенного списка», как это обычно используется на географических картах для представления относительного размера городов в соответствии с относительным размером шрифта. Ранним печатным примером взвешенного списка английских ключевых слов были «подсознательные файлы» в романе Дугласа Купленда «Microserfs» (1995). Немецкий аналог появился в 1992 году. Конкретная визуальная форма и широкое использование термина «облако тегов» получили распространение в первом десятилетии XXI века как распространенная функция ранних веб-сайтов и блогов Web 2.0, используемых главным образом для визуализации частотного распределения метаданных ключевых слов, описывающих содержание веб-сайта, а также в качестве средства навигации. Первые облака тегов на популярном веб-сайте появились на сайте обмена фотографиями Flickr, созданном соучредителем Flickr и дизайнером взаимодействия Стюартом Баттерфильдом в 2004 году. Эта реализация была основана на «Search Referral Zeitgeist» Джима Фланагана — визуализации рефералов веб-сайтов. Облака тегов также были популяризированы примерно в то же время сервисами Del.icio.us и Technorati, среди прочих. Перенасыщенность методом облаков тегов и неоднозначное отношение к его полезности как инструмента веб-навигации привели к снижению использования среди этих первых пользователей. Flickr произнес пятисловную благодарственную речь на церемонии вручения Webby Award 2006 года в номинации «Лучшие практики», просто заявив: «извините за облака тегов». Второе поколение разработчиков программного обеспечения открыло более широкий спектр применения облаков тегов как базового метода визуализации текстовых данных. В этом контексте было предложено несколько расширений облаков тегов.

Типы

Существует три основных типа облаков тегов в социальном программном обеспечении, различающихся по своему значению, а не по внешнему виду. В первом типе для каждого элемента представлен тег, отражающий частоту его использования, в то время как во втором типе используются глобальные облака тегов, в которых частоты агрегируются по всем элементам и пользователям. В третьем типе облако содержит категории, размер которых указывает на количество подкатегорий.

Частота

В первом типе размер отражает количество применений тега к одному элементу. Это полезно для отображения метаданных об элементе, по которому проводилось демократическое "голосование", и когда не требуется высокая точность результатов. Во втором, более распространенном типе, размер отражает количество элементов, к которым был применен тег, что показывает популярность каждого тега.

Значение

Вместо частоты размер может использоваться для представления важности слов и совместной встречаемости слов по отношению к фоновому корпусу (например, ко всему тексту в Википедии). Этот подход нельзя использовать самостоятельно, он требует сопоставления частоты встречаемости в документах с ожидаемыми распределениями.

Категоризация

В третьем типе теги используются как метод категоризации элементов контента. Теги отображаются в виде облака, где размер тега отражает количество элементов контента в данной категории. Существуют подходы к построению кластеров тегов вместо облаков тегов, например, на основе совместного появления тегов в документах. В более общем смысле, та же визуальная техника может применяться для отображения данных, не связанных с тегами, как, например, в облаке слов или облаке данных. Термин "облако ключевых слов" иногда используется в контексте поискового маркетинга (SEM) для обозначения группы ключевых слов, релевантных конкретному веб-сайту. В последние годы облака тегов стали популярны благодаря их роли в поисковой оптимизации веб-страниц, а также в помощи пользователям эффективно перемещаться по контенту информационной системы. Облака тегов, как инструмент навигации, делают ресурсы веб-сайта более взаимосвязанными, что при сканировании поисковым роботом может улучшить позиции сайта в результатах поиска. С точки зрения пользовательского интерфейса они часто используются для обобщения результатов поиска, помогая пользователям быстрее находить нужный контент в информационной системе.

Визуальный вид

Облака тегов обычно представляются с использованием встроенных HTML-элементов. Теги могут отображаться в алфавитном порядке, в случайном порядке, сортироваться по весу и так далее. Иногда, помимо размера шрифта, изменяются и другие визуальные свойства, такие как цвет шрифта, насыщенность или жирность. Наиболее распространено прямоугольное расположение тегов с алфавитной сортировкой в последовательном строчном формате. Выбор оптимального макета должен определяться предполагаемыми задачами пользователей или использоваться методы внедрения, такие как tSNE, для позиционирования слов.

Облака данных

Облако данных — это визуализация данных, использующая размер шрифта и/или цвет для отображения числовых значений. Оно похоже на облако тегов, но вместо частоты слов отображает данные, такие как численность населения или котировки акций.

Текстовые облака

Текстовое облако или облако слов — это визуализация частоты употребления слов в заданном тексте, представленная в виде списка с учетом веса каждого слова. В последнее время эта техника получила широкое распространение для визуализации тематического содержания политических выступлений.

Расположение облаков

Расширяя принципы текстового облака, коллокатное облако предоставляет более сфокусированный взгляд на документ или корпус. Вместо обобщения всего документа, коллокатное облако анализирует употребление конкретного слова. Результирующее облако содержит слова, которые часто используются совместно с искомым словом. Эти коллокаты форматируются для отображения частоты (размером) и силы коллокации (яркостью). Это обеспечивает интерактивные способы изучения и исследования языка.