Vanskelighetsgrad
Din beste poengsum
N/A
I en globalisert verden kommer meldinger fra alle verdenshjørner og kan være skrevet på forskjellige språk. For å automatisk behandle disse tekstene (for eksempel i automatiske oversettelsesapplikasjoner) er det essensielt at vi kan identifisere språket til hver tekst.
Din rolle er å utvikle et automatisk system som kan bestemme språket til en tekst, basert på trening av en modell ved hjelp av et sett med merkede eksempler.
Det automatiske systemet må fungere for følgende språk:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Du har tilgang til to CSV-filer:
Hver rad i train.csv har følgende kolonner:
SampleID - unik identifikator for tekstenText - den originale tekstenlanguage - tekstens språkEksempel:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchHver rad i test.csv har følgende kolonner:
SampleID - unik identifikator for tekstenText - teksten som språket må forutsies forEksempel:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Bygg et system som kan identifisere tekstens språk for tekstene i test.csv.
Forutsigelsene må lagres i en fil submission.csv med formatet:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishhvor:
SampleID - unik identifikator for teksten fra test.csvlanguage - språket forutsagt av systemet ditt, som må være ett av de mulige språkene fra følgende liste:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Forutsigelsene vil bli sammenlignet med de faktiske språkene og nøyaktigheten vil bli beregnet:
accuracy = (antall_korrekte_forutsigelser / totalt_antall_forutsigelser)Den endelige poengsummen beregnes basert på oppnådd nøyaktighet ved hjelp av følgende regler: