Тежина
Твој најбољи резултат
Н/Д
U globalizovanom svetu, poruke dolaze iz svih krajeva sveta i mogu biti napisane na različitim jezicima. Da bi se automatski obradili ovi tekstovi (na primer, u automatskim aplikacijama za prevođenje) neophodno je da možemo identifikovati jezik svakog teksta.
Tvoja uloga je da razviješ automatski sistem sposoban da odredi jezik teksta, polazeći od treniranja modela na osnovu skupa označenih primera.
Automatski sistem treba da funkcioniše za sledeće jezike:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Na raspolaganju imaš dva CSV fajla:
Svaki red iz train.csv ima sledeće kolone:
SampleID - jedinstveni identifikator tekstaText - originalni tekstlanguage - jezik tekstaPrimer:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchSvaki red iz test.csv ima sledeće kolone:
SampleID - jedinstveni identifikator tekstaText - tekst za koji treba predvideti jezikPrimer:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Konstruiši sistem koji može identifikovati jezik teksta za tekstove iz test.csv.
Predviđanja treba sačuvati u fajl submission.csv sa formatom:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishgde:
SampleID - jedinstveni identifikator teksta iz test.csvlanguage - jezik predviđen od strane tvog sistema, koji mora biti jedan od mogućih jezika iz sledeće liste:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Predviđanja će biti poređena sa stvarnim jezicima i izračunaće se tačnost:
accuracy = (broj_tačnih_predviđanja / ukupan_broj_predviđanja)Finalni rezultat se računa na osnovu postignute tačnosti koristeći sledeća pravila: