Svårighetsgrad
Din bästa poäng
Ej tillgänglig
I en globaliserad värld kommer meddelanden från alla hörn av världen och kan vara skrivna på olika språk. För att automatiskt bearbeta dessa texter (till exempel i automatiska översättningsapplikationer) är det viktigt att vi kan identifiera språket för varje text.
Din roll är att utveckla ett automatiskt system som kan bestämma språket för en text, med utgångspunkt från träning av en modell baserad på en uppsättning märkta exempel.
Det automatiska systemet måste fungera för följande språk:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Du har tillgång till två CSV-filer:
Varje rad i train.csv har följande kolumner:
SampleID - textens unika identifierareText - den ursprungliga textenlanguage - textens språkExempel:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchVarje rad i test.csv har följande kolumner:
SampleID - textens unika identifierareText - texten för vilken språket ska förutsägasExempel:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Bygg ett system som kan identifiera textens språk för texterna i test.csv.
Förutsägelserna ska sparas i en fil submission.csv med formatet:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishdär:
SampleID - textens unika identifierare från test.csvlanguage - språket som förutsägs av ditt system, som måste vara ett av de möjliga språken från följande lista:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Förutsägelserna kommer att jämföras med de verkliga språken och noggrannheten kommer att beräknas:
accuracy = (antal_korrekta_förutsägelser / totalt_antal_förutsägelser)Det slutliga poängtalet beräknas baserat på den uppnådda noggrannheten med följande regler: