Obtížnost
Vaše nejlepší skóre
N/A
V globalizovaném světě přicházejí zprávy ze všech koutů světa a mohou být napsány v různých jazycích. Pro automatické zpracování těchto textů (například v aplikacích pro automatický překlad) je nezbytné, abychom dokázali identifikovat jazyk každého textu.
Vaším úkolem je vyvinout automatický systém schopný určit jazyk textu na základě trénování modelu pomocí sady označených příkladů.
Automatický systém musí fungovat pro následující jazyky:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Máte k dispozici dva CSV soubory:
Každý řádek v train.csv má následující sloupce:
SampleID - jedinečný identifikátor textuText - původní textlanguage - jazyk textuPříklad:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchKaždý řádek v test.csv má následující sloupce:
SampleID - jedinečný identifikátor textuText - text, pro který je třeba předpovědět jazykPříklad:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Sestavte systém, který dokáže identifikovat jazyk textu pro texty z test.csv.
Předpovědi musí být uloženy v souboru submission.csv s formátem:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishkde:
SampleID - jedinečný identifikátor textu z test.csvlanguage - jazyk předpovězený vaším systémem, který musí být jedním z možných jazyků ze seznamu:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Předpovědi budou porovnány se skutečnými jazyky a bude vypočítána přesnost:
accuracy = (počet_správných_předpovědí / celkový_počet_předpovědí)Konečné skóre je vypočítáno na základě dosažené přesnosti pomocí následujících pravidel: