Težina
Vaš najbolji rezultat
N/D
U globaliziranom svijetu, poruke dolaze iz svih krajeva svijeta i mogu biti napisane na različitim jezicima. Za automatsku obradu ovih tekstova (na primjer, u automatskim aplikacijama za prevođenje) ključno je da možemo identificirati jezik svakog teksta.
Tvoja uloga je da razviješ automatski sistem sposoban da odredi jezik teksta, počevši od treniranja modela na osnovu skupa označenih primjera.
Automatski sistem mora da funkcioniše za sljedeće jezike:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Na raspolaganju imaš dvije CSV datoteke:
Svaki red iz train.csv ima sljedeće kolone:
SampleID - jedinstveni identifikator tekstaText - originalni tekstlanguage - jezik tekstaPrimjer:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchSvaki red iz test.csv ima sljedeće kolone:
SampleID - jedinstveni identifikator tekstaText - tekst za koji treba predvidjeti jezikPrimjer:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Konstruiraj sistem koji može identificirati jezik teksta za tekstove iz test.csv.
Predviđanja treba sačuvati u datoteku submission.csv sa formatom:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishgdje:
SampleID - jedinstveni identifikator teksta iz test.csvlanguage - jezik predviđen od strane tvog sistema, koji mora biti jedan od mogućih jezika iz sljedeće liste:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Predviđanja će biti poređena sa stvarnim jezicima i izračunat će se točnost:
accuracy = (broj_točnih_predviđanja / ukupan_broj_predviđanja)Konačni rezultat se računa na osnovu postignute točnosti koristeći sljedeća pravila: