Problema #39
Autor:Mihai Nan
Dificuldade
A tua melhor pontuação
N/D
Na Biblioteca do Grande Reino, os arquivistas enfrentam uma tarefa cada vez mais difícil:
milhares de manuscritos, pergaminhos e crônicas antigas precisam ser organizados, comparados e indexados.
Para ajudá-los, os ancestrais criaram um mecanismo lendário: O Oráculo da similaridade. Este é
um dispositivo capaz de estabelecer, com uma precisão notável, quão semelhantes
são dois fragmentos de texto, retornando um score entre 0 e 5.
Mas o mecanismo se degradou com o tempo, e o Grande Conselho dos Arquivistas decidiu que é necessária
uma versão moderna, construída usando aprendizado de máquina.
Para isso, foram disponibilizados dois arquivos:
train.csv - pergaminhos anotados manualmente por escribastest.csv - pares novos que precisam ser analisados pela sua soluçãoSua tarefa é reconstruir o Oráculo através de uma série de análises e um modelo preditivo final.
Cada linha dos arquivos train.csv e test.csv representa um par de sentenças:
O objetivo final é predizer score para cada linha em test.csv.
Para as primeiras subtarefas, você deve analisar os dados fornecidos em train.csv e test.csv
e extrair diferentes informações relevantes sobre as sentenças do teste.
Calcule o comprimento de cada sentença (sentence1 e sentence2) para cada linha do conjunto de teste
e rotule o par com base no comprimento médio:
Short se a média < 50Medium se 50 ≤ média < 100Long se a média ≥ 100Para cada linha do teste, calcule o número de palavras de cada sentença (sentence1 e sentence2) e determine o número total pela fórmula:
número_total = nr_palavras(sentence1) + nr_palavras(sentence2)Estabeleça a diferença absoluta entre o comprimento de sentence1 e o comprimento de sentence2
para cada linha do teste.
Em outras palavras, para cada linha devemos calcular:
|nr_caracteres(sentence1) - nr_caracteres(sentence2)|Construa um modelo de aprendizado de máquina capaz de predizer o valor numérico score
para cada linha em test.csv.
A avaliação final será feita usando MAE (Mean Absolute Error), calculado assim:
A métrica para a Subtarefa 4 é:
Para as subtarefas 1-3, as respostas são avaliadas exatamente.
O arquivo submission.csv deve conter 4 linhas para cada linha do teste,
correspondentes às 4 subtarefas.
Estrutura:
subtaskID datapointID answerSignificado das colunas:
subtaskID – um número entre 1 e 4
datapointID – sampleID do teste
answer – o resultado:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Sucesso! O Grande Conselho dos Arquivistas deposita suas esperanças em vocês para reviver o Oráculo da similaridade! 🧙♂️