Введение
1954 демонстрация машинного перевода
Эксперимент Джорджтаун-IBM стал важной демонстрацией машинного перевода, проведенной 7 января 1954 года. Разработанный совместно Джорджтаунским университетом и IBM, эксперимент включал полностью автоматический перевод более чем шестидесяти русских предложений на английский язык.
The Georgetown–IBM experiment was an influential demonstration of machine translation, which was performed on January 7, 1954. Developed jointly by the Georgetown University and IBM, the experiment involved completely automatic translation of more than sixty Russian sentences into English.
Предыстория
Разработанная и выполненная прежде всего для привлечения государственного и общественного интереса и финансирования, демонстрируя возможности машинного перевода, она ни в коем случае не была полноценной системой: она оперировала всего шестью грамматическими правилами и 250 лексическими единицами (корнями и окончаниями). Слова в словаре относились к областям политики, права, математики, химии, металлургии, связи и военного дела. Словарь был закодирован на перфокартах. Этот полный словарь так и не был представлен целиком (только расширенный вариант из статьи Гарвина). Помимо общих тем, система была специализирована в области органической химии. Перевод осуществлялся с использованием IBM 701. Джером Вайснер поддержал идею и выделил финансирование из Исследовательской лаборатории электроники при MIT. Леон Достерт был приглашен в проект благодаря его предыдущему опыту в автоматической коррекции переводов (тогда называемой «механическим переводом»); его система перевода оказала значительное влияние на Нюрнбергский трибунал по военным преступлениям. Лингвистическую часть демонстрации в основном осуществлял лингвист Пол Гарвин, который также хорошо владел русским языком. Более 60 романизированных русских высказываний по широкому спектру политических, юридических, математических и научных тем были введены в машину оператором, не знавшим русского языка, а результирующие английские переводы выводились на принтер. Предложения для перевода тщательно отбирались. Многие операции для демонстрации были настроены под конкретные слова и предложения. Кроме того, отсутствовал реляционный или синтаксический анализ, способный распознавать структуру предложения. Подход был преимущественно «лексикографическим», основанным на словаре, где каждое слово было связано с определенными правилами и шагами.
Алгоритм
Алгоритм сначала преобразует русские слова в числовые коды, а затем проводит анализ каждого числового кода для выбора между возможными вариантами перевода на английский язык, изменения порядка английских слов или пропуска некоторых английских слов. Блок-схема алгоритма воспроизведена далее. См. таблицу 1, где представлены 6 правил.