Введение
Спектр технологий синтеза и распознавания речи от Apple Inc.
PlainTalk — это общее название для ряда технологий синтеза речи (MacinTalk) и распознавания речи, разработанных компанией Apple Inc.
PlainTalk стал результатом значительных инвестиций Apple в разработку технологии распознавания речи в 1990 году. Компания привлекла множество исследователей в этой области. PlainTalk был выпущен вместе с AV-моделями в линейке Macintosh Quadra начиная с 1993 года. Он стал стандартным системным компонентом в System 7.1.2 и с тех пор поставлялся со всеми компьютерами PowerPC и некоторыми Macintosh на базе 68k.
Технология
В Apple для синтеза речи используются дифоны. По сравнению с другими методами синтеза речи, этот метод не требует больших ресурсов, но ограничивает степень естественности звучания. Ранее были доступны версии для американского английского и испанского языков, но с появлением Mac OS X компания Apple стала поставлять только голоса на американском английском, полагаясь на сторонних поставщиков, таких как Acapela Group, для обеспечения голосами на других языках (в OS X 10.7 Apple лицензировала множество сторонних голосов и сделала их доступными для загрузки через панель управления «Речь»). Интерфейс программирования приложений, известный как Speech Manager, позволяет сторонним разработчикам использовать синтез речи в своих приложениях. Для точной настройки интонации и ритма можно использовать различные управляющие последовательности. Также можно настраивать громкость, высоту тона и скорость речи, что позволяет даже имитировать пение. Ввод данных в синтезатор можно контролировать явно, используя специальный фонетический алфавит.
Оригинальный MacinTalk
Первоначальный механизм преобразования текста в речь для Macintosh, MacinTalk (названный Дениз Чандлер), был использован Apple в 1984 году при представлении Macintosh, где компьютер представился миру (и высмеял вес компьютера IBM). Несмотря на то, что он был интегрирован в операционную систему Macintosh, Apple официально его не поддерживала (хотя информация о программировании была доступна в технической записке Apple). MacinTalk был разработан Джозефом Кацем и Марком Бартоном, которые впоследствии основали SoftVoice, Inc., которая в настоящее время поставляет TTS-движки для Windows, Linux и встраиваемых систем. MacinTalk использовал прямой доступ к оригинальному звуковому оборудованию Macintosh, и все попытки Apple лицензировать исходный код для его обновления для новых моделей Mac оказались безуспешными.
MacinTalk 2 (продолжение)
В конечном итоге, Apple выпустила поддерживаемую систему синтеза речи под названием MacinTalk 2. Она поддерживается на любом Macintosh, работающем под управлением System Software версии 6.0.7 или более поздней. Даже после выхода MacinTalk 3 и Pro она оставалась рекомендуемой версией для менее мощных компьютеров.
MacinTalk 3, Профессиональный
MacinTalk 3 представил большое разнообразие голосов. Помимо стандартных взрослых голосов "Ральф", "Фред" и "Кэти", а также детских голосов, таких как "Принцесса" (переименованная в "Суперзвезда" в macOS Ventura) и "Юниор", были включены различные необычные голоса, такие как "Шепот", "Зарвокс" (роботизированный голос с мелодичными фоновыми звуками, с аналогичным голосом "Триноиды" также включенным), "Челло" (голос, который пропевал свой текст на мелодию Эдварда Грига, известную как "В зале горного короля", с похожими по звучанию голосами, такими как "Хорошие новости", "Плохие новости", "Орган"), "Альберт" (охриплый голос), "Колокольчики", "Боинг", "Пузыри" и другие. Каждый из этих голосов сопровождался своим примером текста, который произносился при нажатии кнопки "Тест" в панели управления речью. Некоторые просто называли свое имя, язык и версию MacinTalk, в которой они были представлены. Другие произносили забавные фразы, например: "Мне очень нравится находиться внутри этого шикарного компьютера", "У меня в горле лягушка. Нет, я имею в виду настоящую лягушку!", "Мы должны радоваться этому мрачному голосу" (пародия на западные церковные гимны с органной музыкой) или "Свет, который вы видите в конце туннеля, – это фары быстро приближающегося поезда". Эти голоса до сих пор доступны в macOS. (Некоторые имена голосов и их тестовые тексты были изменены в macOS Ventura, а затем все тестовые тексты были изменены в macOS Sonoma на "Здравствуйте, меня зовут [имя голоса]"). С увеличением вычислительной мощности, предоставляемой компьютерами AV Macs и PowerPC-Macintosh, Apple смогла повысить качество синтеза. MacinTalk 3 требовал процессор 68030 с частотой 33 МГц, а MacinTalk Pro – 68040 или лучше и не менее 1 МБ оперативной памяти. Каждый синтезатор поддерживал свой набор голосов.
Перевод текста в речь в Mac OS X
Текстовое преобразование речи в текст было частью каждой версии Mac OS X (позже macOS). Голос Виктории был значительно улучшен в Mac OS X v10.3 и добавлен как Vicki (Виктория не была удалена). Его размер увеличился почти в 20 раз из-за использования дифонов более высокого качества. С выпуском Mac OS X 10.5 Leopard к списку голосов для преобразования текста в речь Mac был добавлен новый, звучащий гораздо более естественно голос под названием "Алекс". В Mac OS X 10.7 Lion голоса стали доступны с дополнительными американскими и другими английскими акцентами, а также на 21 другом языке. Функция "Озвучить выделенный текст при нажатии клавиши" позволяет читать выделенный текст из любого приложения с помощью комбинации клавиш. С Mac OS X 10.1 по Mac OS X 10.6 эта функция копировала выделенный текст в буфер обмена и читала его оттуда. С Mac OS X 10.7 по Mac OS X 10.10 новая реализация функции требовала от разработчиков программного обеспечения внедрения API синтеза речи в свои приложения. Это предотвращало перезапись буфера обмена, но также означало, что для приложений, не использующих API, функция работала бы некорректно, читая заголовок окна вместо выделенного текста. В macOS Sierra 10.12 для Mac была представлена Siri, однако её голос не был доступен как системный, что означало, что голоса Siri можно было использовать только в Siri. В macOS Catalina 10.15 Siri стала доступна как системный голос, чтобы она работала с любым текстом. Голоса Siri работают совершенно по-другому, и команда по-прежнему не может использовать Siri. В обновлении macOS Big Sur 11.3 были удалены указания на пол для всех голосов, что совпало с изменениями в голосах Siri в iOS 14.5 и macOS 11.3 и более поздних версиях в рамках усилий Apple по продвижению гендерной инклюзивности.
Распознавание речи
Apple наняла множество исследователей в области распознавания речи в 1990 году. Примерно через год они продемонстрировали технологию под кодовым названием Casper. Она была выпущена в составе пакета PlainTalk в 1993 году. Хотя она была доступна для всех PowerPC Macintosh и AV 68k (это было одно из немногих приложений, использовавших DSP в Centris 660AV и Quadra 840AV), она не входила в стандартную установку системы до Mac OS X, требуя от пользователя выполнения пользовательской установки операционной системы для получения функций распознавания речи. В Mac OS X 10.7 Lion и более ранних версиях система распознавания речи Apple была ориентирована исключительно на голосовые команды, то есть не предназначалась для диктовки. Её можно было настроить на прослушивание команд при нажатии горячей клавиши, после обращения к ней с помощью фразы активации, такой как "Компьютер", "Macintosh" или без какой-либо команды. Графический индикатор состояния, часто в виде анимированного персонажа, предоставлял визуальную и текстовую обратную связь о статусе прослушивания, доступных командах и действиях. Система также могла взаимодействовать с пользователем посредством синтеза речи. Ранние версии распознавания речи обеспечивали полный доступ к меню. Эта функция была позже удалена, поскольку требовала слишком больших ресурсов и снижала надёжность распознавания, но затем была восстановлена в Mac OS X 10.3 в качестве "технологии универсального доступа" под названием "говорящий пользовательский интерфейс". Пользователь мог запускать элементы, находящиеся в специальной папке под названием "Speakable Items", просто произнося их имена (когда система находилась в режиме прослушивания). Apple поставляла несколько AppleScript в этой папке, но псевдонимы, документы и папки также можно было открывать таким же образом. Дополнительные функции предоставлялись отдельными приложениями. Интерфейс программирования приложений (API) позволял программам определять и изменять доступный словарный запас. Например, Finder предоставлял словарь для управления файлами и окнами. В OS X 10.8 Mountain Lion Apple представила функцию "Диктовка", предназначенную для общего текста. Изначально для обработки требовалось отправлять аудиоданные на серверы Apple. В OS X 10.9 Mavericks Apple добавила возможность загрузки поддержки диктовки для её использования без подключения к Интернету. По состоянию на OS X 10.9.3 поддерживается восемь языков (19 диалектов).
Оборудование
Apple производила микрофоны под названием "Apple PlainTalk Microphone". Первая модель поставлялась в комплекте с Macintosh LC и ранними моделями Performa и имела круглую форму. Она была разработана для установки в держатель, крепившийся к боковой стороне ЭЛТ-монитора, и вынималась, чтобы держать её у рта во время разговора. Вторая модель была представлена вместе с AV-моделями линейки Macintosh Quadra в 1993 году, но также продавалась отдельно. Она была предназначена для размещения на верхней части экрана и для улавливания звука спереди. Обе модели имели удлинённый разъём, наконечник которого использовался для подачи на микрофон напряжения питания.