Sværhedsgrad
Din bedste score
N/A
I en globaliseret verden kommer beskeder fra alle verdenshjørner og kan være skrevet på forskellige sprog. For automatisk at behandle disse tekster (f.eks. i automatiske oversættelsesapplikationer) er det essentielt, at vi kan identificere sproget for hver tekst.
Din rolle er at udvikle et automatisk system, der kan bestemme sproget i en tekst, baseret på træning af en model ud fra et sæt mærkede eksempler.
Det automatiske system skal fungere for følgende sprog:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Du har to CSV-filer til rådighed:
Hver række i train.csv har følgende kolonner:
SampleID - tekstens unikke identifikatorText - den originale tekstlanguage - tekstens sprogEksempel:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchHver række i test.csv har følgende kolonner:
SampleID - tekstens unikke identifikatorText - teksten, som sproget skal forudsiges forEksempel:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Byg et system, der kan identificere tekstens sprog for teksterne i test.csv.
Forudsigelserne skal gemmes i en fil submission.csv med formatet:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishhvor:
SampleID - tekstens unikke identifikator fra test.csvlanguage - sproget forudsagt af dit system, som skal være et af de mulige sprog fra følgende liste:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Forudsigelserne vil blive sammenlignet med de faktiske sprog, og nøjagtigheden vil blive beregnet:
accuracy = (antal_korrekte_forudsigelser / samlet_antal_forudsigelser)Den endelige score beregnes baseret på den opnåede nøjagtighed ved hjælp af følgende regler: