Кіріспе

Табиғи тілдерде мәтін жасау

Табиғи тілді жасау (NLG) – табиғи тілдегі мәтінді құрайтын бағдарламалық процесс. NLG әдістеріне қатысты кең таралған зерттеу NLG-ні «жасанды интеллект және есептеу лингвистикасының саласы» ретінде сипаттайды. Ол ағылшын немесе басқа да адам тілдерінде түсінікті мәтіндерді ақпараттың тілдік емес ұсынылымынан құра алатын компьютерлік жүйелерді құрумен айналысады. Кез келген NLG процесінің нәтижесі мәтін екендігіне барлық тарап келіседі, бірақ NLG жүйесіне кіріс деректер тілдік емес болуы керек пе, деген мәселеде пікір таласы бар. NLG әдістерінің кең таралған қолданыстарына түрлі есептерді жасау, мысалы, ауа райы туралы ақпарат және чат-боттар жатады. Автоматтандырылған NLG-ні адамдар идеяларды жазуға немесе айтуға айналдырған кезде қолданатын процесспен салыстыруға болады. Психолингвистер осы процеске «тілді өндіру» терминін қолданады, оны математикалық тұрғыдан сипаттауға немесе психологиялық зерттеулер үшін компьютерде модельдеуге болады. NLG жүйелерін жасанды компьютерлік тілдердің аудармашыларымен, мысалы, декомпиляторлар немесе транспиляторлармен де салыстыруға болады, олар аралық ұсынылымнан адам оқи алатын кодты да жасайды. Адам тілдері бағдарламалау тілдеріне қарағанда әлдеқайда күрделі, көп мағыналы және әртүрлі өрнектерге мүмкіндік береді, бұл NLG-ні күрделі етеді. NLG-ні табиғи тілді түсінуге (NLU) толықтырушы ретінде қарастыруға болады: NLU-де жүйе машиналық ұсынылымды жасау үшін кіріс сөйлемді түсіндіруі керек, ал NLG-де жүйе ұсынылымды сөздерге қалай аудару керектігі туралы шешім қабылдауы керек. NLU және NLG жүйелерін құрудың практикалық аспектілері симметриялық емес. NLU қолданушының дұрыс емес немесе қателігі бар кіріс деректерін өңдеуі керек, ал NLG арқылы жеткізілгісі келетін идеялар әдетте нақты белгілі. NLG көптеген мүмкін ұсынылымдардың ішінде өзіне сәйкес келетін нақты мәтіндік ұсынылымды таңдауы керек, ал NLU әдетте айтылған идеяның бір нормативтік ұсынылымын жасауға тырысады. NLG әдістері қарапайым үлгіге негізделген жүйелерден, мысалы, формалық хаттарды жасайтын поштаны біріктіруден, адам грамматикасын күрделі түсінетін жүйелерге дейін өзгереді. NLG сонымен қатар машиналық оқытуды қолдана отырып, статистикалық модельді оқыту арқылы жүзеге асырылуы мүмкін, әдетте адам жазған мәтіндердің үлкен корпусында.

Суреттің астында

Соңғы бірнеше жылда көру және тіл арасындағы байланысты зерттеудің кең ауқымды шараларының бір бөлігі ретінде суреттерге автоматты түрде мәтіндік сипаттамалар жасауға қызығушылық артты. Деректерден мәтін жасаудың бір түрі болып табылатын суретті сипаттау алгоритмі (немесе автоматты сурет сипаттамасы) суретті қабылдап, оның визуалды мазмұнын талдайды және суреттің ең маңызды аспектілерін сөзбен жеткізетін мәтіндік сипаттаманы (әдетте сөйлем) құрайды. Суретті сипаттау жүйесі екі негізгі тапсырмадан тұрады. Суретті талдау кезінде суреттің ерекшеліктері мен атрибуттары анықталып, белгіленеді, содан кейін осы нәтижелер лингвистикалық құрылымдарға бейімделеді. Жақындағы зерттеулер терең оқыту әдістерін пайдаланады, олар алдын ала оқытылған конволюциялық нейрондық желілерден (мысалы, AlexNet, VGG немесе Caffe) алынған ерекшеліктерді қолданады, онда сипаттама жасаушылар алдын ала оқытылған желіден алынған белсендіру қабатын кіріс деректері ретінде пайдаланады. Екінші тапсырма – мәтін жасау, ол әртүрлі техникалар арқылы жүзеге асырылады. Мысалы, Midge жүйесінде кіріс суреттері объектілер/заттардың, әрекеттер/позалардың және кеңістіктік қатынастардың анықталуынан тұратын үштіктер түрінде ұсынылады. Бұл үштіктер кейіннен <зат есім, етіс, сөз тіркесі> түріндегі үштіктерге сәйкестендіріліп, ағаш алмастыру грамматикасы арқылы жүзеге асырылады. Сондай-ақ, суреттерді сипаттау үшін көптілді жинақтарды құру және бағалау жүргізіледі.

Шығармашылық жазу және есептеу юморы

NLG-ның шығармашылық тілді жасауы туралы гипотеза осы саланың бастауынан бері қалыптасқан. Бұл саладағы алғашқы дамушылардың бірі – Филип Паркер, ол оқулықтарды, кроссвордтарды, өлеңдерді және кітаптарды автоматты түрде жасауға қабілетті алгоритмдерді әзірледі. GPT 3 сияқты ірі, алдын ала оқытылған трансформерлік тілдік модельдердің пайда болуы да жаңа табыстарға мүмкіндік берді, мұндай модельдер жазу тапсырмаларын орындауға қабілетті екенін көрсетті. NLG қолданылымының осымен байланысты саласы – есептеулік юмор жасау. JAPE (Joke Analysis and Production Engine) – балаларға арналған әзіл-қалжыңдарды жасау үшін қолмен кодталған үлгілерге негізделген тәсілді пайдаланатын ең алғашқы, ірі автоматтандырылған юмор жасау жүйелерінің бірі. HAHAcronym кез келген аббревиатураны күлкілі түрде түсіндіреді, сондай-ақ берілген кілт сөздерге сәйкес келетін жаңа аббревиатураларды ұсынады. Прогресске қарамастан, адам жасаған шығармашылық және юморлы контентпен бәсекелесе алатын автоматты контент жасауда көптеген қиындықтар сақталып қалды. Сатирикалық тақырыптарды жасау бойынша жүргізілген тәжірибеде, олардың ең жақсы BERT негізіндегі моделінің нәтижелерінің 9,4% күлкілі деп танылды (ал The Onion-нан алынған нақты тақырыптардың 38,4% құрады), ал сатирикалық тақырыптарға реттелген GPT 2 моделі 6,9% нәтиже көрсетті. Юмор жасау жүйелеріндегі екі негізгі мәселе – түсіндірілген деректер жиынтығының жетіспеуі және формалды бағалау әдістерінің, бірлескен тапсырмалардың болмауы. Алғашқы нәтижелер көрсеткендей, адам бағалары осы мәселеде метрикалардан әлдеқайда жақсы. Басқаша айтқанда, адам бағалары, әдетте, тапсырманың тиімділігін, кем дегенде, белгілі бір деңгейде болжайды (бірақ ерекшеліктер де бар), ал метрикалар арқылы алынған бағалар тапсырманың тиімділігін жақсы болжамайды. Бұл нәтижелер алдын ала. Дегенмен, адам бағасы NLG-де ең танымал бағалау әдісі болып табылады, бұл машиналық аудармадан өзгеше, онда метрикалар кеңінен қолданылады. ЖА-ны оқыту деректеріне сәйкестігі немесе, балама ретінде, фактілігі бойынша бағалауға болады. Оқу деректерін көрсеткен бірақ шындыққа сай келмейтін жауап – сәйкес, бірақ нақты емес. Өзіне сенімді, бірақ сәйкес келмейтін жауап – галлюцинация. Табиғи тілді өңдеуде галлюцинация көбінесе "мағынасыз немесе берілген бастапқы контентке сәйкес келмейтін жасалған контент" деп анықталады.