Dificuldade
A tua melhor pontuação
N/D
O objetivo deste problema é a identificação e classificação de textos de acordo com a especificidade regional ou a forma padrão da língua romena. O conjunto de dados contém fragmentos de texto coletados de diversas regiões.
| Coluna | Descrição |
|---|---|
| ID | Identificador único para cada fragmento de texto |
| text | O conteúdo propriamente dito da frase em língua romena |
| label | A classificação do dialeto do texto (coluna alvo) |
Nota: A coluna label (Dialeto) está disponível apenas nos dados de treino (train.csv). As três classes possíveis são: româna standard (romeno padrão), graiul moldovenesc (dialeto moldavo) e graiul bănățean (dialeto de Banat).
Parte dos textos foi extraída da obra "Cinci pâini" de Ion Creangă. Calcule o número total de ocorrências da palavra "pâni" (forma arcaica da palavra "pâini") em train.csv e em test.csv.
Em train.csv, calcule a média do número de sinais de pontuação para os textos do graiul moldovenesc e graiul bănățean. Retorne o valor absoluto (módulo) da diferença entre os 2 valores, arredondado para 2 casas decimais.
Para cada linha em test.csv, calcule o número de diacríticos no texto. São considerados diacríticos os caracteres: ă, â, î, ș, ț (e suas variantes maiúsculas Ă, Â, Î, Ș, Ț).
Construa um modelo capaz de classificar corretamente os textos do arquivo de teste em uma das 3 classes.
A avaliação é feita por verificação exata da resposta. Resposta correta = pontuação máxima, resposta errada = 0 pontos.
A avaliação é feita por accuracy — a proporção de respostas corretas em relação ao total. A pontuação é proporcional: accuracy 1.0 = 10 pontos, accuracy 0.0 = 0 pontos.
A avaliação é feita utilizando a métrica F1-Macro.
O arquivo de submissão deve estar no formato CSV, contendo as seguintes colunas:
1.ID em test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Nota: A resolução deste problema não requer a utilização de arquiteturas do tipo Transformer (ex: RoBERTa).