Universell dependensanalys

Tidsperiod:
1 januari 2017 – 31 december 2020
Projektledare:
Joakim Nivre
Finansiär:
Vetenskapsrådet
Bidragstyp:
Projektbidrag
Budget:
3 448 000 SEK

Språkteknologi spelar en allt större roll i våra liv, fastän vi inte alltid är medvetna om det. Närhelst vi gör en vanlig webbsökning, använder röststyrning i mobilen eller utnyttjar översättningstjänster som Google Translate, förlitar vi oss på datorers förmåga att analysera och tolka mänskligt språk. Men även om forskningen gjort stora framsteg på senare år, är det fortfarande så att språkanalys av hög kvalitet är mycket ojämnt fördelad mellan världens språk. Medan de bästa systemen för grammatisk analys klarar av mer än 90% av alla konstruktioner som förekommer i engelsk text, är resultaten mycket blygsammare för språk med andra strukturella egenskaper. Detta inbegriper några av världens största språk, såsom kinesiska, arabiska, hindi och ryska, men också en mycket lång rad mindre språk (inklusive svenska). För att komma till rätta med detta problem krävs mer grundforskning om hur datorprogram för språkanalys kan anpassas för språk med olika egenskaper. Detta projekt försöker utveckla bättre datormodeller för språkanalys som kan anpassas till olika typer av språk på ett sätt som bygger på vår kunskap om språktypologi och språkliga universalier. Projektet utgår från ett nytt system för grammatisk beskrivning som kallas Universal Dependencies (UD) och vars syfte är att åstadkomma en enhetlig beskrivning av världens språk för att möjliggöra systematiska undersökningar av likheter och skillnader i språkstruktur. Systemet bygger på en uppsättning universella ordklasser (verb, substantiv, adjektiv osv.), en uppsättning grammatiska underkategorier där olika språk gör olika urval (numerus, kasus, tempus osv.) samt en uppsättning universella satsdelsfunktioner (subjekt, objekt, adverbial osv.). Med hjälp av detta ramverk kan vi studera och utnyttja strukturella likheter och skillnader mellan språk på ett systematiskt sätt. För att detta ska leda till bättre språkanalys för alla språk måste vi dock även utveckla nya datormodeller för satsanalys. Framför allt måste vi representera grammatiska konstruktioner på ett sätt som abstraherar över konkreta uttrycksmedel, så att en och samma konstruktion kan identifieras i olika spåk oavsett om den realiseras genom ordföljdsmönster, funktionsord, ordböjning eller en kombination av alla dessa. Till exempel använder engelska i första hand ordföljd för att indikera vad som är subjekt respektive objekt, så att ”The dog chased the cat” betyder något annat än ”The cat chased the dog”, medan ett språk som finska i stället använder kasusböjning på substantiven och kan ha samma ordföljd oavsett vem som jagade vem. Ett annat exempel är bestämdhet som i svenska signaleras med ordböjning (”hunden” i stället för ”hund”) men i engelska med ett funktionsord (”the dog” i stället för ”a dog”). Många andra språk (till exempel finska) uttrycker inte denna kategori över huvud taget.De nya modellerna kommer att testas på alla språk som finns representerade i UD. Detta är för närvarande drygt 40 stycken, men nya språk kommer ständigt till och vår ambition är att dynamiskt anpassa modellerna till nya språk för att på så sätt testa våra hypoteser på bredast möjliga dataunderlag. Ett konkret mål för projektet är också att ta fram en prototyp för en universell grammatikanalysator, alltså ett datorsystem som kan analysera alla världens språk. Projektets verkliga betydelse går dock mycket längre än detta prototypsystem. Genom att utnyttja vår kunskap om språktypologi och språkliga universalier kommer projektet att skapa ett nytt paradigm för datoriserad språkanalys, och genom att utveckla en universell metod för grammatisk analys kommer det också att ge ett bidrag till språktypologisk forskning. Sist men inte minst kommer projektet, genom att utveckla ett system som kan närma sig verklig språkförståelse för alla typer av språk, möjliggöra mer intelligenta, pålitliga och effektiva tillämpningar av språkteknologi och utjämna klyftorna mellan olika språk i dagens mångspråkiga samhälle.

FÖLJ UPPSALA UNIVERSITET PÅ

Uppsala universitet på facebook
Uppsala universitet på Instagram
Uppsala universitet på Youtube
Uppsala universitet på Linkedin