Кіріспе
Тіл білімін зерттеу үшін есептеу құралдарын қолдану – ғылыми сала. Компьютерлік лингвистика – табиғи тілдің есептеулік модельдеуімен, сондай-ақ тілдік мәселелерді шешуге арналған тиісті есептеу тәсілдерін зерттеумен айналысатын пәнаралық сала. Жалпы алғанда, компьютерлік лингвистика лингвистика, компьютерлік ғылым, жасанды интеллект, математика, логика, философия, когнитивтік ғылым, когнитивтік психология, психолингвистика, антропология және нейроғылым сияқты салаларға сүйенеді.
the scientific field
Computational linguistics is an interdisciplinary field concerned with the computational modelling of natural language, as well as the study of appropriate computational approaches to linguistic questions. In general, computational linguistics draws upon linguistics, computer science, artificial intelligence, mathematics, logic, philosophy, cognitive science, cognitive psychology, psycholinguistics, anthropology and neuroscience, among others.
Шығу тегі
Бұл сала жасанды интеллектпен 1950 жылдары АҚШ-та компьютерлерді шетел тілдеріндегі мәтіндерді, әсіресе орыс ғылыми журналдарын ағылшын тіліне автоматты түрде аудару үшін қолдануға жасалған тыраштан бері байланысты. Ережеге негізделген тәсілдер адамдардан гөрі жылдам және дәл арифметикалық (жүйелі) есептеулерді жасай алатындықтан, лексика, морфология, синтаксис және семантика да нақты ережелер арқылы үйренілуі мүмкін деп күтілді. Ережеге негізделген тәсілдердің сәтсіз аяқталуынан кейін Дэвид Хейс осы терминді жасанды интеллекттен (AI) ажырату үшін енгізіп, 1970 және 1980 жылдары Компьютерлік лингвистика қауымдастығын (ACL) және Халықаралық компьютерлік лингвистика комитетін (ICCL) бірлесіп құрды. Бастапқыда тілдер арасында аударуға бағытталған бұл жұмыс, табиғи тілді өңдеудің көп салалы пәніне айналды.
Жазбаша корпустар
Ағылшын тілін жан-жақты зерттеу үшін, түсіндірмелі мәтіндік корпус қажет болды. Пенн ағаштар банкі – ең көп қолданылған корпус болды. Ол IBM компьютерлік нұсқаулықтарынан, жазылған телефон әңгімелерінен және басқа да мәтіндерден тұрады, барлығында 4,5 миллионнан астам америкалық ағылшын тіліндегі сөздер кездеседі, олар сөз түрлерін анықтау және синтаксистік жақшалау арқылы түсіндірілген. Жапон тіліндегі сөйлемдер корпусы талданды және сөйлем ұзындығына байланысты логарифмдік қалыптылық үлгісі анықталды.
Модельдеу тілін меңгеру
Тіл үйрену кезінде балалардың көбінесе тек оң пішінді деректерге ғана тап болуы, яғни дұрыс форманың қандай екенін көрсететін деректер ғана ұсынылып, дұрыс емес формалар туралы ешқандай дерек берілмеуі, сол кездегі модельдер үшін шектеу болды, себебі қазір қолжетімді терең оқыту модельдері 1980 жылдардың соңында болған жоқ. Баланың жадысы жақсарып, назары ұзарған сайын бірте-бірте ұсынылатын қарапайым деректердің үйлесімі арқылы тілдерді үйренуге болатыны көрсетілді, бұл нәрестелер мен балаларда тіл үйренудің ұзаққа созылуын түсіндірді. Балалар сияқты үйренуге мүмкіндік беру үшін, іс-әрекет, сезіну және нәтижелер арасындағы байланыстар жасалып, олар сөйлеу тілімен байланыстырылған қолжетімділік моделіне негізделген модельдер құрылды. Ең маңыздысы, бұл роботтар грамматикалық құрылымды қажет етпей, сөздерді мағынамен байланыстыра алды. Прайс теңдеуі мен Поля ыдысы динамикасын пайдалана отырып, зерттеушілер болашақ тілдік эволюцияны болжауға ғана емес, сонымен қатар қазіргі тілдердің эволюциялық тарихына түсінік беретін жүйені жасады.
Чомскийдің теориясы
Нәресте Чомскийдің нормальді формасымен теорияланған "қалыптан тыс грамматиканы" қалай үйренетінін анықтауға әрекеттер жасалды.