Суреттерді мазмұны бойынша іздеу әдісі: CBIR технологиясы туралы біліңіз. Суреттерді түстері, формалары арқылы табу, метадеректерге тәуелділікті азайту.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Суретті іздеу әдісі
Method of image retrieval
Мазмұнға негізделген суретті іздеу, сонымен қатар сурет мазмұны бойынша сұрау (QBIC) және мазмұнға негізделген визуалды ақпаратты іздеу (CBVIR) деп те аталады, бұл компьютерлік көру техникаларын суретті іздеу мәселесіне – яғни, үлкен дерекқорлардағы цифрлық суреттерді іздеу мәселесіне қолдану болып табылады (CBIR саласының ғылыми шолуы үшін осы зерттеуге жүгініңіз). Мазмұнға негізделген суретті іздеу, дәстүрлі түсініктерге негізделген тәсілдерге қарама-қарсы келеді (Түсініктерге негізделген суретті индекстеуді қараңыз). "Мазмұнға негізделген" дегеніміз, іздеу кілт сөздер, тегтер немесе суретпен байланысты сипаттамалар сияқты метадеректерді емес, суреттің мазмұнын талдайды. Осы контексте "мазмұн" термині суреттің түстеріне, пішіндеріне, текстураларына немесе суреттен алынған кез келген басқа да ақпаратқа сілтеуі мүмкін. CBIR қажет, себебі тек метадеректерге сүйенген іздеулер, аннотацияның сапасы мен толықтығына байланысты болады.
Content based image retrieval, also known as query by image content (QBIC) and content based visual information retrieval (CBVIR), is the application of computer vision techniques to the image retrieval problem, that is, the problem of searching for digital images in large databases (see this survey for a scientific overview of the CBIR field). Content based image retrieval is opposed to traditional concept based approaches (see Concept based image indexing). "Content based" means that the search analyzes the contents of the image rather than the metadata such as keywords, tags, or descriptions associated with the image. The term "content" in this context might refer to colors, shapes, textures, or any other information that can be derived from the image itself. CBIR is desirable because searches that rely purely on metadata are dependent on annotation quality and completeness.
Метадеректерді іздеумен салыстыру
Суреттерді мета-іздеу үшін адамдар үлкен деректер қорына кілт сөздерді немесе метадеректерді қолмен енгізу арқылы суреттерді түсіндіруі керек, бұл көп уақытты алады және суретті сипаттау үшін қажетті кілт сөздерді қамтымай қалуы мүмкін. Кілті сөздермен суреттерді іздеудің тиімділігін бағалау субъективті және толық анықталмаған. Осыған орай, CBIR жүйелері табысты анықтауда ұқсас қиындықтарға кезеседі. "Кілті сөздер сұраныстардың ауқымын алдын ала белгіленген өлшемдер жиынтығымен шектейді" және "құрылғаннан кейін" деген сөздер мазмұнның өзіне қарағанда сенімсіз. Содан бері бұл термин синтаксистік суреттік ерекшеліктерге негізделіп, үлкен жиыннан қажетті суреттерді іздеу процесін сипаттау үшін қолданылады. Қолданылатын техникалар, құралдар мен алгоритмдер статистика, үлгілерді тану, сигналдарды өңдеу және компьютерлік көру салаларынан шыққан. Жақындағы желілік және граф негізгі тәсілдер қазіргі әдістерге қарапайым және тартымды балама ұсынды. Бірнеше суретті бірлік ретінде сақтау BLOB (Binary Large Object) терминінен бұрын болғанмен, мазмұны бойынша толық іздеу мүмкіндігі IBM-нің QBIC жүйесіне дейін күтілуге тиіс болды.
An image meta search requires humans to have manually annotated images by entering keywords or metadata in a large database, which can be time consuming and may not capture the keywords desired to describe the image. The evaluation of the effectiveness of keyword image search is subjective and has not been well defined. In the same regard, CBIR systems have similar challenges in defining success. "Keywords also limit the scope of queries to the set of predetermined criteria." and, "having been set up" are less reliable than using the content itself. Since then, the term has been used to describe the process of retrieving desired images from a large collection on the basis of syntactical image features. The techniques, tools, and algorithms that are used originate from fields such as statistics, pattern recognition, signal processing, and computer vision. Recent network and graph based approaches have presented a simple and attractive alternative to existing methods. While the storing of multiple images as part of a single entity preceded the term BLOB (Binary Large OBject), the ability to fully search by content, rather than by description, had to await IBM's QBIC.
Техникалық прогресс
CBIR-ге деген қызығушылық, метадеректерге негізделген жүйелерге тән кемшіліктердің болуынан, сондай-ақ тиімді кескіндерді іздеуге болатын кең мүмкіндіктердің арқасында артты. Кескіндер туралы мәтіндік ақпаратты қолданыстағы технологиялар арқылы іздеу оңай, бірақ бұл дерекқорындағы әрбір кескінді қолмен сипаттауды қажет етеді. Бұл өте үлкен дерекқоры үшін немесе қадағалау камераларынан алынған кескіндер сияқты автоматты түрде жасалатын кескіндер үшін қиындық тудыруы мүмкін. Сонымен қатар, сипаттамаларында әртүрлі синонимдер қолданылған кескіндерді жіберіп алу мүмкіндігі де бар. "Мысық" сияқты семантикалық санаттардағы кескіндерді "жануар" санатының кіші тобы ретінде жіктеуге негізделген жүйелер қате жіктеу мәселесін болдырмайды, бірақ пайдаланушы "мысықтар" болуы мүмкін, бірақ "жануар" ретінде ғана жіктелген кескіндерді табу үшін көп күш жұмсауы керек. Кескіндерді жіктеу үшін көптеген стандарттар жасалған, бірақ олардың барлығы масштабтау және дұрыс емес жіктеу мәселелерімен күреседі. Бұл CBIR жүйесіне іздеу негізі ретінде қызмет ететін мысал кескінді ұсынуды білдіреді. Іздеу алгоритмдері қолданысқа байланысты өзгеруі мүмкін, бірақ нәтижелердегі кескіндер ұсынылған мысалмен ортақ элементтерге ие болуы керек. Бұл сұраныс әдісі кескіндерді сөздермен сипаттауға тырысқанда туындайтын қиындықтарды жояды.
The interest in CBIR has grown because of the limitations inherent in metadata based systems, as well as the large range of possible uses for efficient image retrieval. Textual information about images can be easily searched using existing technology, but this requires humans to manually describe each image in the database. This can be impractical for very large databases or for images that are generated automatically, e. g. those from surveillance cameras. It is also possible to miss images that use different synonyms in their descriptions. Systems based on categorizing images in semantic classes like "cat" as a subclass of "animal" can avoid the miscategorization problem, but will require more effort by a user to find images that might be "cats", but are only classified as an "animal". Many standards have been developed to categorize images, but all still face scaling and miscategorization issues. that involves providing the CBIR system with an example image that it will then base its search upon. The underlying search algorithms may vary depending on the application, but result images should all share common elements with the provided example. This query technique removes the difficulties that can arise when trying to describe images with words.
Семантикалық іздеу
Семантикалық іздеу пайдаланушының "Абрахам Линкольннің суретін табыңыз" сияқты сұранысымен басталады. Компьютерлер үшін мұндай ашық міндетті орындау өте қиын. Линкольн әрқашан камераға қарап тұрмауы немесе бірдей позада болмауы мүмкін. Сондықтан көптеген CBIR жүйелері көбінесе текстура, түс және пішін сияқты төменгі деңгейдегі ерекшеліктерді пайдаланады. Бұл ерекшеліктер критерийлерді оңай енгізуге мүмкіндік беретін интерфейстермен немесе ерекшеліктерге сәйкес келу үшін жаттықтырылған дерекқорлармен (мысалы, беттер, саусақ іздері немесе пішінге сәйкестік) бірге қолданылады. Дегенмен, әдетте, кескінді іздеу үшін жоғары деңгейдегі түсініктерді анықтау үшін адамның пікірі қажет. CBIR жүйелері маңыздылық туралы кері байланысты пайдалана алады, онда пайдаланушы іздеу нәтижелерін "маңызды", "маңызсыз" немесе "бейтарап" деп белгілеу арқылы іздеу нәтижелерін жақсартады, содан кейін жаңа ақпаратпен іздеуді қайталайды. Мұндай интерфейстің мысалдары жасалған.
Semantic retrieval starts with a user making a request like "find pictures of Abraham Lincoln". This type of open ended task is very difficult for computers to perform Lincoln may not always be facing the camera or in the same pose. Many CBIR systems therefore generally make use of lower level features like texture, color, and shape. These features are either used in combination with interfaces that allow easier input of the criteria or with databases that have already been trained to match features (such as faces, fingerprints, or shape matching). However, in general, image retrieval requires human feedback in order to identify higher level concepts. CBIR systems can make use of relevance feedback, where the user progressively refines the search results by marking images in the results as "relevant", "not relevant", or "neutral" to the search query, then repeating the search with the new information. Examples of this type of interface have been developed.
Басқа сұрау әдістері
Басқа сұрау әдістеріне мысал ретінде суреттерді қарау, жекелендірілген/иерархиялық санаттар бойынша іздеу, суреттің бөлігі (толық сурет емес) бойынша сұрау салу, бірнеше мысал суреттер арқылы сұрау салу, визуальды эскиз бойынша сұрау салу, сурет ерекшеліктерін тікелей көрсету арқылы сұрау салу және көп түрлі сұраулар (мысалы, жанасу, дауыс сияқты) кіреді.
Other query methods include browsing for example images, navigating customized/hierarchical categories, querying by image region (rather than the entire image), querying by multiple example images, querying by visual sketch, querying by direct specification of image features, and multimodal queries (e. g. combining touch, voice, etc.)
Сурет қашықтығын өлшеу арқылы мазмұнды салыстыру
Мазмұнға негізделген кескінді іздеуде (әдетте, үлгі кескіні мен дерекқорынан алынған кескіні) екі кескіні салыстырудың ең көп қолданылатын әдісі – кескіндік қашықтықты өлшеу. Кескіндік қашықтықты өлшеу, екі кескіні түс, текстура, пішін және басқа да әртүрлі өлшемдер бойынша ұқсастығын салыстырады. Мысалы, 0 қашықтығы сұранысқа қатысты қарастырылған өлшемдер бойынша толық сәйкестікті көрсетеді. Дәл болжауынша, 0-ден жоғары мән кескіндер арасындағы ұқсастықтың түрлі деңгейлерін білдіреді. Іздеу нәтижелері сұраныс кескініне дейінгі қашықтығына сәйкес реттелген болады.
The most common method for comparing two images in content based image retrieval (typically an example image and an image from the database) is using an image distance measure. An image distance measure compares the similarity of two images in various dimensions such as color, texture, shape, and others. For example, a distance of 0 signifies an exact match with the query, with respect to the dimensions that were considered. As one may intuitively gather, a value greater than 0 indicates various degrees of similarities between the images. Search results then can be sorted based on their distance to the queried image.
Пішіні
Пішін сурет пішініне емес, ізделіп отырған нақты бір аймақтың пішініне қатысты. Пішіндер көбінесе суретте сегментация немесе жиектерді анықтау қолданылып, одан кейін анықталады. Басқа әдістер суреттегі белгілі пішіндерді анықтау үшін пішін сүзгілерін пайдаланады. Пішін сипаттамалары аударма, бұрылу және масштабқа қатысты өзгермейтін болуы керек. Адам көзі байқамайтын шағын өзгерістер ғана іздеу нәтижелерін күрт өзгерте алатыны көрсетілді. Сонымен қатар, модельге тәуелсіз, ауыстырылатын қарсыластық мысалдар да мүмкін, бұл терең іздеу жүйелеріне қара қорап тәсілімен қарсыластық шабуылдар жасауға, олардың ішкі жұмысын білмей тұрып мүмкіндік береді. Керісінше, Мадри қорғанысы сияқты қарсыластық қорғаныстар арқылы мұндай шабуылдарға қарсы тұру қабілетін жақсартуға болады.
Shape does not refer to the shape of an image but to the shape of a particular region that is being sought out. Shapes will often be determined first applying segmentation or edge detection to an image. Other methods use shape filters to identify given shapes of an image. Shape descriptors may also need to be invariant to translation, rotation, and scale. It is shown that retrieved ranking could be dramatically altered with only small perturbations imperceptible to human beings. In addition, model agnostic transferable adversarial examples are also possible, which enables black box adversarial attacks on deep ranking systems without requiring access to their underlying implementations. Conversely, the resistance to such attacks can be improved via adversarial defenses such as the Madry defense.
Суретті алуды бағалау
Суреттерді іздеу өлшемдерін дәлдік және толықтық арқылы анықтауға болады. Дегенмен, басқа да әдістер қарастырылып жатыр.
Measures of image retrieval can be defined in terms of precision and recall. However, there are other methods being considered.
КБИЖ жүйесінде әр түрлі әдістермен бір мезгілде сурет алу
CBIR жүйесінде сурет бірнеше техниканы бірдей қолдану арқылы ізделіп алынады, мысалы, пиксел кластерлерін индекстеу, гистограмма қиылысы және дискретті толқындық түрлендіру әдістері.
An image is retrieved in CBIR system by adopting several techniques simultaneously such as Integrating Pixel Cluster Indexing, histogram intersection and discrete wavelet transform methods.