Dificuldade
A tua melhor pontuação
N/D
Num mundo globalizado, as mensagens vêm de todos os cantos do mundo e podem ser escritas em diversas línguas. Para processar automaticamente estes textos (por exemplo, em aplicações automáticas de tradução) é essencial que possamos identificar a língua de cada texto.
O teu papel é desenvolver um sistema automático capaz de determinar a língua de um texto, partindo do treino de um modelo com base num conjunto de exemplos etiquetados.
O sistema automático deve funcionar para as seguintes línguas:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Tens à disposição dois ficheiros CSV:
Cada linha de train.csv tem as seguintes colunas:
SampleID - o identificador único do textoText - o texto originallanguage - a língua do textoExemplo:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchCada linha de test.csv tem as seguintes colunas:
SampleID - o identificador único do textoText - o texto para o qual deve ser prevista a línguaExemplo:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Constrói um sistema que pode identificar a língua do texto para os textos de test.csv.
As previsões devem ser guardadas num ficheiro submission.csv com o formato:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishonde:
SampleID - o identificador único do texto de test.csvlanguage - a língua prevista pelo teu sistema, que deve ser uma das línguas possíveis da seguinte lista:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
As previsões serão comparadas com as línguas reais e será calculada a precisão:
accuracy = (numero_previsões_corretas / numero_total_previsões)A pontuação final é calculada com base na precisão obtida usando as seguintes regras: