Trudność
Twój najlepszy wynik
Nie dotyczy
W zglobalizowanym świecie wiadomości pochodzą ze wszystkich zakątków świata i mogą być napisane w różnych językach. Aby automatycznie przetwarzać te teksty (na przykład w automatycznych aplikacjach tłumaczących) konieczne jest, abyśmy mogli zidentyfikować język każdego tekstu.
Twoim zadaniem jest opracowanie automatycznego systemu zdolnego do określenia języka tekstu, zaczynając od wytrenowania modelu na podstawie zestawu oznaczonych przykładów.
System automatyczny musi działać dla następujących języków:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Masz do dyspozycji dwa pliki CSV:
Każdy wiersz w train.csv ma następujące kolumny:
SampleID - unikalny identyfikator tekstuText - oryginalny tekstlanguage - język tekstuPrzykład:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchKażdy wiersz w test.csv ma następujące kolumny:
SampleID - unikalny identyfikator tekstuText - tekst, dla którego należy przewidzieć językPrzykład:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Zbuduj system, który może zidentyfikować język tekstu dla tekstów z test.csv.
Przewidywania muszą być zapisane w pliku submission.csv w formacie:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishgdzie:
SampleID - unikalny identyfikator tekstu z test.csvlanguage - język przewidziany przez twój system, który musi być jednym z możliwych języków z następującej listy:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Przewidywania będą porównane z rzeczywistymi językami i zostanie obliczona dokładność:
accuracy = (liczba_poprawnych_przewidywań / całkowita_liczba_przewidywań)Końcowy wynik jest obliczany na podstawie uzyskanej dokładności przy użyciu następujących zasad: