Введение

Веб-поисковая система для видеоконтента. Видеопоисковая система – это веб-поисковая система, которая сканирует интернет в поисках видеоконтента. Некоторые видеопоисковые системы анализируют контент, размещенный на внешних ресурсах, в то время как другие позволяют загружать и хранить контент на собственных серверах. Некоторые системы также позволяют пользователям искать видео по типу формата и длительности ролика. Результаты видеопоиска обычно сопровождаются эскизом видео. Видеопоисковые системы – это компьютерные программы, предназначенные для поиска видеофайлов, хранящихся на цифровых устройствах, как на интернет-серверах, так и на накопителях того же компьютера. Поиск может осуществляться посредством аудиовизуальной индексации, которая извлекает информацию из аудиовизуальных материалов и сохраняет ее в виде метаданных, отслеживаемых поисковыми системами.

Утилита

Основным назначением этих поисковых систем является растущий объем создаваемого аудиовизуального контента и необходимость его эффективного управления. Оцифровка аудиовизуальных архивов и развитие Интернета привели к накоплению огромного количества видеофайлов в больших базах данных, поиск по которым может быть затруднен из-за больших объемов данных и наличия семантического разрыва.

Критерий поиска

Критерий поиска, используемый каждой поисковой системой, зависит от её специфики и назначения поисковых запросов.

Метаданные

Метаданные – это информация о данных. Это может быть информация об авторе видео, дате создания, продолжительности и любые другие сведения, которые можно извлечь и включить в те же файлы. В интернете для кодирования метаданных часто используется язык XML, который отлично работает в сети и легко читается человеком. Таким образом, эта информация, содержащаяся в файлах, является самым простым способом найти интересующие нас данные. В видео существует два типа метаданных: встроенные в видеокод и внешние, полученные со страницы, где размещено видео. В обоих случаях мы оптимизируем их для наилучшей индексации.

Внутренние метаданные

Все видеоформаты содержат собственные метаданные. Это может быть название, описание, качество кодирования или расшифровка содержимого. Для просмотра этих данных существуют программы, такие как FLV MetaData Injector, Sorenson Squeeze или Castfire. Каждая из них обладает своими инструментами и специфическими возможностями. При конвертации из одного формата в другой можно потерять значительную часть этих данных, поэтому необходимо проверять корректность информации в новом формате. Поэтому целесообразно хранить видео в нескольких форматах, чтобы все поисковые роботы могли его находить и индексировать.

Внешние метаданные

В большинстве случаев необходимо использовать те же механизмы, что и при позиционировании изображения или текстового содержимого.

Название и описание

Они — важнейшие факторы при продвижении видео, поскольку содержат основную часть необходимой информации. Заголовки должны быть чёткими и информативными, и из них следует исключить все ненужные слова и фразы.

Имя файла

Он должен быть описательным, включать ключевые слова, описывающие видео, даже без просмотра его названия или описания. В идеале – разделяйте слова дефисами " ".

Названия

На странице с видео должен быть список ключевых слов, связанных с микроформатом "rel tag". Эти слова поисковые системы будут использовать как основу для организации информации.

Перевод и субтитры

Хотя и не являясь полностью стандартными, существуют два формата для хранения информации с указанным временным компонентом: один для субтитров, а другой – для расшифровок, которые также могут использоваться в качестве субтитров. Эти форматы – SRT или SUB для субтитров и TTXT для расшифровок.

Распознавание речи

Распознавание речи заключается в создании текстовой расшифровки аудиодорожки видео, результатом чего является текстовый файл. Таким образом, а также с помощью извлекателя фраз, можно легко определить, представляет ли видеоконтент интерес. Некоторые поисковые системы, помимо использования распознавания речи для поиска видео, применяют его и для определения конкретного момента в мультимедийном файле, где встречается определенное слово или фраза, и позволяют перейти непосредственно к этому моменту. Gaudi (Google Audio Indexing) – проект, разработанный Google Labs, – использует технологию распознавания голоса для поиска точного момента произнесения одного или нескольких слов в аудиозаписи, позволяя пользователю сразу перейти к этому моменту. Если поисковый запрос соответствует видео на YouTube, соответствующие моменты обозначаются желтыми маркерами, и для чтения расшифрованного текста необходимо навести на них курсор мыши.

Распознавание динамиков

В дополнение к транскрипции, анализ может определять разных говорящих и иногда соотносить речь с установленным именем говорящего.

Распознавание текста

Распознавание текста может быть очень полезным для распознавания символов в видеороликах, отображаемых в виде "хиронов". Как и в случае с системами распознавания речи, существуют поисковые системы, позволяющие (с помощью распознавания символов) воспроизводить видео с определенного момента. TalkMiner, пример поиска конкретных фрагментов в видео по распознанному тексту, анализирует каждое видео один раз в секунду, выявляя признаки, идентифицирующие слайды, такие как их форма и статичность, захватывает изображение слайда и использует оптическое распознавание символов (OCR) для обнаружения слов на слайдах. Затем эти слова индексируются в поисковой системе TalkMiner, которая в настоящее время предоставляет пользователям доступ к более чем 20 000 видеоматериалам из таких учреждений, как Стэнфордский университет, Калифорнийский университет в Беркли и TED.

Анализ рамы

С помощью визуальных дескрипторов мы можем анализировать кадры видео и извлекать информацию, которую можно оценить в качестве метаданных. Описания генерируются автоматически и могут описывать различные аспекты кадров, такие как цвет, текстура, форма, движение и контекст.

Разделение

Анализ видео может привести к автоматическому разделению на главы, используя такие методы, как смена угла съемки и идентификация аудио-джинглов. Зная типичную структуру видеодокумента, можно определить начальные и конечные титры, основные части контента, а также начало и конец рекламных пауз.

Критерий ранжирования

Полезность поисковой системы определяется релевантностью выдаваемых результатов. Хотя может существовать миллионы видеороликов, содержащих определенное слово или фразу, некоторые из них могут быть более уместными, популярными или авторитетными, чем другие. Это напрямую связано с поисковой оптимизацией. Большинство поисковых систем используют различные методы для ранжирования результатов и отображения наиболее подходящих видео в начале выдачи. Однако большинство сервисов позволяют сортировать результаты по нескольким критериям.

Порядок по значимости

Этот критерий более неоднозначен и менее объективен, но иногда он наиболее точно соответствует нашим ожиданиям; всё зависит от пользователя и алгоритма, выбранного владельцем сайта. Именно поэтому он всегда был предметом обсуждений, а теперь, когда результаты поиска настолько прочно вошли в нашу жизнь, обсуждается еще активнее. Управление на основе этого критерия часто зависит от частоты появления искомого слова, количества просмотров, числа страниц, ссылающихся на контент, и оценок пользователей, которые его просмотрели.

Порядок по дате загрузки

Это критерий, основанный исключительно на времени. Результаты можно сортировать по дате их добавления в репозиторий.

Порядок по количеству просмотров

Это позволяет нам оценить популярность каждого видео.

Порядок по длине

Это продолжительность видео и может дать представление о том, что это за видео.

Порядок по оценке пользователей

В репозиториях часто предоставляют пользователям возможность оценивать видео, чтобы качественный и релевантный контент занимал более высокие позиции в списке результатов и был более заметным. Эта практика тесно связана с виртуальными сообществами.

Интерфейсы

Мы можем выделить два основных типа интерфейсов: одни – это веб-страницы, размещенные на серверах и доступные через Интернет для поиска в сети, а другие – компьютерные программы, осуществляющие поиск в пределах частной сети.

Интернет

В интернет-интерфейсах можно найти хранилища видеофайлов, оснащенные поисковой системой, индексирующей только собственные базы данных, а также видеопоисковики, не имеющие собственного хранилища, осуществляющие поиск по внешним источникам.

Хранилища с видео поисковиком

Обеспечивает размещение видеофайлов, хранящихся на его серверах, и обычно имеет встроенную поисковую систему, которая ищет видео, загруженные пользователями. Одними из первых веб-хранилищ, или, по крайней мере, наиболее известными, являются порталы Vimeo, Dailymotion и YouTube. Поиск на этих платформах часто основан на анализе метаданных, заголовков и описаний, которые пользователи добавляют к своим видео. Результаты поиска обычно можно упорядочить по дате загрузки, количеству просмотров или релевантности. Однако критерии сортировки сейчас являются основным инструментом этих сайтов, поскольку позиция видео важна для его продвижения.

Хранилища видеопоисковиков

Это веб-сайты, специализирующиеся на поиске видео в сети или в определенных, заранее отобранных хранилищах. Они работают посредством веб-пауков, которые автоматически сканируют сеть для создания копий посещенных веб-сайтов, которые затем индексируются поисковыми системами, обеспечивая более быстрый поиск.

Частная сеть

Иногда поисковая система осуществляет поиск только в аудиовизуальных файлах, хранящихся на компьютере или, как это бывает в телевизорах, на частном сервере, к которому пользователи получают доступ через локальную сеть. Такие поисковые системы обычно представляют собой программное обеспечение или насыщенные интернет-приложения с очень специфическими параметрами поиска, обеспечивающими максимальную скорость и эффективность при представлении результатов. Они обычно используются для больших баз данных и поэтому ориентированы на удовлетворение потребностей телевизионных компаний. Примером такого программного обеспечения является Digition Suite, который, являясь эталоном в этом типе интерфейсов, тесно связан с нами в плане системы хранения и извлечения файлов Corporació Catalana de Mitjans Audiovisuals. Особенностью этого пакета, и, возможно, его главным преимуществом, является интеграция всего процесса: создания, индексации, хранения, поиска, редактирования и восстановления. После оцифровки аудиовизуального контента он индексируется различными методами разного уровня детализации, в зависимости от важности контента, и сохраняется. Когда пользователю необходимо найти определенный файл, он заполняет поля поиска, такие как название программы, дата выпуска, имена актеров или имя продюсера, после чего запускается поиск. После появления результатов, отсортированных в соответствии с предпочтениями, пользователь может просмотреть видео в низком качестве для ускорения работы. Найдя нужный контент, он загружает его в высоком разрешении, редактирует и воспроизводит.

Конструкция и алгоритмы

Видеопоиск развивался постепенно, пройдя несколько основных этапов, которые существуют и сегодня и все они основаны на использовании ключевых слов. Ключевые слова для каждого поиска можно найти в названии медиафайла, в любом текстовом описании к нему, а также на веб-страницах, связанных с контентом, определенных авторами и пользователями видеохостингов. Некоторые видеопоисковые системы используют ручной поиск, другие – технологические системы, которые автоматически определяют содержание видео и соответствуют запросам пользователя. Многие попытки улучшить видеопоиск, включая как ручной поиск, так и разработку алгоритмов распознавания содержимого видео, потребовали полной переработки поисковых механизмов. В целом признается, что преобразование речи в текст возможно, однако недавно Томас Уайльд, новый генеральный директор Everyzing, отметил, что Everyzing работает с 70% точностью при наличии музыки, фонового шума или нескольких говорящих. Если речь четкая, принадлежит одному человеку и не содержит посторонних шумов (как в новостных выпусках), точность может достигать 93%. (Web Video Summit, Сан-Хосе, Калифорния, 27 июня 2007 г.). В каждом языке существует около 40 фонем, а во всех языках мира – около 400. Вместо применения алгоритма текстового поиска после преобразования речи в текст, некоторые поисковые системы используют фонетический алгоритм для поиска результатов непосредственно в аудиопотоке. Другие системы прослушивают весь подкаст и создают текстовую транскрипцию с помощью сложного алгоритма преобразования речи в текст. После создания текстового файла в нем можно искать любое количество слов и фраз. Общепризнано, что визуальный поиск по видео пока неэффективен и ни одна компания не использует его в публичном доступе. Исследователи из Калифорнийского университета в Сан-Диего и Университета Карнеги — Меллона работают над проблемой визуального поиска более 15 лет и признали на конференции "Будущее поиска" в Калифорнийском университете в Беркли весной 2007 года, что до практической реализации даже в простых случаях еще предстоит пройти долгий путь.