Введение
Платформа машинного перевода, основанная на правилах и имеющая открытый исходный код.
Apertium — это платформа машинного перевода с открытым исходным кодом, основанная на правилах. Это свободное программное обеспечение, распространяемое по лицензии GNU General Public License.
Обзор
Apertium — это система машинного перевода, основанная на переносе, которая использует конечные автоматы для всех своих лексических преобразований, а также теггеры с ограничениями по грамматике, а также скрытые марковские модели или перцептроны для определения части речи / устранения неоднозначности категорий слов. Структурный компонент переноса отвечает за перемещение слов и согласование; до настоящего времени в большинстве языковых пар Apertium использовались правила "разбиения на фрагменты" или правила поверхностного переноса, хотя в новых парах используются (возможно, рекурсивные) правила, определенные в контекстно-свободной грамматике. Многие существующие системы машинного перевода, доступные в настоящее время, являются коммерческими или используют проприетарные технологии, что значительно затрудняет их адаптацию к новым задачам. Код и данные Apertium распространяются как свободное программное обеспечение и используют языково-независимую спецификацию, чтобы упростить участие в разработке Apertium, повысить эффективность разработки и способствовать общему росту проекта. На данный момент (декабрь 2020 года) Apertium выпустил 51 стабильную языковую пару, обеспечивающую быстрый перевод с достаточно понятными результатами (ошибки легко исправить). Являясь проектом с открытым исходным кодом, Apertium предоставляет инструменты потенциальным разработчикам для создания собственных языковых пар и внесения вклада в проект.
История
Apertium возник как один из механизмов машинного перевода в проекте OpenTrad, финансируемом правительством Испании и разработанном исследовательской группой Transducens в Universitat d'Alacant. Изначально он был предназначен для перевода между близкородственными языками, однако в последнее время его возможности были расширены для работы с более далёкими языковыми парами. Для создания новой системы машинного перевода достаточно разработать лингвистические данные (словари, правила) в чётко определённых форматах XML. Языковые данные, разработанные для него (в сотрудничестве с Университетом Виго, Университетом Политехники Каталонии и Университетом Помпеу Фабра), в настоящее время поддерживают (в стабильной версии) арабский, арагонский, астурийский, баскский, белорусский, бретонский, болгарский, каталанский, крымскотатарский, датский, английский, эсперанто, французский, галисийский, хинди, исландский, индонезийский, итальянский, казахский, македонский, малайский, мальтийский, северный саамский, норвежский (бокмол и нинорск), окситанский, польский, португальский, румынский, русский, сардинский, сербохорватский, силезский, словенский, испанский, шведский, татарский, украинский, урду и валлийский языки. Полный список доступен ниже. В разработке Apertium также участвуют несколько компаний, включая Prompsit Language Engineering, Imaxin Software и Eleka Ingeniaritza Linguistikoa. Проект принимал участие в Google Summer of Code в 2009, 2010, 2011, 2012, 2013 и 2014 годах и в Google Code In в 2010, 2011, 2012, 2013, 2014, 2015, 2016 и 2017 годах.