Dificuldade
A tua melhor pontuação
N/D
A redação de uma agência internacional de imprensa gerencia diariamente milhares de artigos provenientes de domínios variados: economia, política, ciência, tecnologia e meio ambiente. Para poder arquivar e distribuir rapidamente as informações, cada artigo deve ser enquadrado numa categoria temática.
Devido a uma falha técnica, as etiquetas de alguns artigos recentes foram perdidas. A redação recorre a ti para construir um sistema inteligente que possa classificar automaticamente os artigos de notícias com base no seu conteúdo.
São dados dois ficheiros de entrada:
train.csv – contém artigos de notícias para os quais a categoria é conhecidatest.csv – contém artigos de notícias sem categoriaCada artigo é identificado por um id único e tem associado um texto.
Usando os dados de train.csv, deves construir um modelo de classificação que preveja a etiqueta (label) de cada artigo de test.csv.
O resultado será guardado num ficheiro submission.csv.
train.csvContém as seguintes colunas:
id – identificador único do artigo (string, ex. 000001)text – conteúdo do artigolabel – categoria do artigo (número inteiro)Exemplo:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvContém as seguintes colunas:
id – identificador únicotext – conteúdo do artigoExemplo:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvO ficheiro gerado para submissão deve estar em formato csv e conter o seguinte:
id – identificador do artigolabel – categoria previstaExemplo:
id,label120001,2120002,3120003,3train.csv.As previsões serão comparadas com as etiquetas reais e será calculada a precisão:
accuracy = (numero_previsões_corretas / numero_total_previsões)A pontuação final é calculada com base na precisão obtida usando as seguintes regras: