Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
CMU Sphinx, қысқаша Sphinx деп те аталады, бұл Карнеги Меллон университетінде әзірленген сөйлеуді тану жүйелерінің тобы. Бұларға сөйлеуді тану құрылғылары (Sphinx 2 4) мен акустикалық модельді жаттықтырушы (SphinxTrain) кіреді. 2000 жылы Карнеги-Меллонның Sphinx тобы сөйлеуді тану құрауыштарының бірнеше компоненттерін, соның ішінде Sphinx 2 және кейін Sphinx 3 (2001 жылы) ашуға бел буды. Сөйлеу декодерлері акустикалық модельдер мен үлгілік қосымшалармен бірге келеді. Қол жетімді ресурстарға, сонымен қатар, акустикалық модельдерді оқыту, тіл модельдерін құрастыру және cmudict - жалпыға ортақ айтуға арналған сөздік кіреді. Sphinx бағдарламалық қамтамасыз ету жүйелерінің бірқатарын қамтиды, олар төменде сипатталған.
CMU Sphinx, also called Sphinx for short, is the general term to describe a group of speech recognition systems developed at Carnegie Mellon University. These include a series of speech recognizers (Sphinx 2 4) and an acoustic model trainer (SphinxTrain). In 2000, the Sphinx group at Carnegie Mellon committed to open source several speech recognizer components, including Sphinx 2 and later Sphinx 3 (in 2001). The speech decoders come with acoustic models and sample applications. The available resources include in addition software for acoustic model training, language model compilation and a public domain pronunciation dictionary, cmudict. Sphinx encompasses a number of software systems, described below.
Сфинкс
Sphinx - бұл үздіксіз сөйлеу, сөйлеушіге тәуелсіз тану жүйесі, жасырын Марков акустикалық модельдерін (HMM) және n грам статистикалық тіл моделін пайдаланады. Оны Кай Фу Ли әзірледі. Сфинксте үздіксіз сөйлеудің мүмкіндігі, сөйлеушіге тәуелсіз үлкен сөздіктің танылуы болды, бұл мүмкіндік сол кезде таласқа ұшырады (1986). Сфинкс тек тарихи мәнге ие; ол кейінгі нұсқалардың орындаушылығымен алмастырылды. Архив мақаласында жүйе егжей-тегжейлі сипатталған.
Sphinx is a continuous speech, speaker independent recognition system making use of hidden Markov acoustic models (HMMs) and an n gram statistical language model. It was developed by Kai Fu Lee. Sphinx featured feasibility of continuous speech, speaker independent large vocabulary recognition, the possibility of which was in dispute at the time (1986). Sphinx is of historical interest only; it has been superseded in performance by subsequent versions. An archival article describes the system in detail.
Сфинкс 2
Түпнұсқада Карнеги Мелон университетінің студенті Сюэдун Хуан әзірлеген және 2000 жылы LinuxWorld-те Кевин Лензо SourceForge-де BSD стилі лицензиясымен ашық бастапқы коды ретінде шығарған жылдам орындауды танушы. Sphinx 2 сөйлеу тілінің қолдануы үшін қолайлы нақты уақыт тануға бағытталған. Осылайша, ол соңғы нүктелеу, ішінара гипотеза жасау, динамикалық тіл моделінің ауысуы және т.б. сияқты функционалдылықты қамтиды. Ол диалогтық жүйелерде және тілдерді үйрену жүйелерінде қолданылады. Оны Asterisk сияқты компьютерлік PBX жүйелерінде қолдануға болады. Sphinx 2 коды көптеген коммерциялық өнімдерге енгізілген. Ол енді белсенді түрде әзірленбейді (жұмыспен қамтамасыз етуден басқа). Қазіргі уақытта нақты уақыт рекордын шешуші Pocket Sphinx жобасында жүргізілуде. Архив мақаласында жүйе сипатталған.
A fast performance oriented recognizer, originally developed by Xuedong Huang at Carnegie Mellon and released as open source with a BSD style license on SourceForge by Kevin Lenzo at LinuxWorld in 2000. Sphinx 2 focuses on real time recognition suitable for spoken language applications. As such it incorporates functionality such as end pointing, partial hypothesis generation, dynamic language model switching and so on. It is used in dialog systems and language learning systems. It can be used in computer based PBX systems such as Asterisk. Sphinx 2 code has also been incorporated into a number of commercial products. It is no longer under active development (other than for routine maintenance). Current real time decoder development is taking place in the Pocket Sphinx project. An archival article describes the system.
Сфинкс 3
Sphinx 2 акустикалық модельдеу үшін жартылай үздіксіз бейнелеуді қолданды (яғни, барлық модельдер үшін Гауссиандардың бір жиынтығы қолданылады, жеке модельдер осы Гауссиандардың үстіндегі салмақ векторы ретінде бейнеленеді). Sphinx 3 кең таралған үздіксіз HMM бейнелеуді қабылдады және негізінен жоғары дәлдікті, нақты емес уақыт тану үшін пайдаланылды. Соңғы кездері (алгоритмдер мен аппараттық құралдар) Sphinx 3 "нақты уақытқа жақын" болды, бірақ әлі де маңызды интерактивті қосымшаларға жарамды емес. Sphinx 3 белсенді даму үстінде және SphinxTrain-пен бірлесіп танып-білу дәлдігін жақсартатын LDA / MLLT, MLLR және VTLN сияқты бірқатар заманауи модельдеу әдістеріне қол жеткізуді қамтамасыз етеді (осы әдістердің сипаттамалары үшін Сфинкс 3 мақаласын қараңыз).
Sphinx 2 used a semi continuous representation for acoustic modeling (i. e., a single set of Gaussians is used for all models, with individual models represented as a weight vector over these Gaussians). Sphinx 3 adopted the prevalent continuous HMM representation and has been used primarily for high accuracy, non real time recognition. Recent developments (in algorithms and in hardware) have made Sphinx 3 "near" real time, although not yet suitable for critical interactive applications. Sphinx 3 is under active development and in conjunction with SphinxTrain provides access to a number of modern modeling techniques, such as LDA/MLLT, MLLR and VTLN, that improve recognition accuracy (see the article on Speech Recognition for descriptions of these techniques).
PocketSphinx (кішігірім)
Sphinx-тің кіріктірілген жүйелерде (мысалы, ARM процессорына негізделген) пайдаланылатын нұсқасы. PocketSphinx белсенді даму үстінде және GMM есептеу үшін тұрақты нүктелік арифметика және тиімді алгоритмдер сияқты мүмкіндіктерді қамтиды.
A version of Sphinx that can be used in embedded systems (e. g., based on an ARM processor). PocketSphinx is under active development and incorporates features such as fixed point arithmetic and efficient algorithms for GMM computation.