Problema #39
Autor:Mihai Nan
Dificultad
Tu mejor puntuación
N/D
En la Biblioteca del Gran Reino, los archivistas se enfrentan a una tarea cada vez más difícil:
miles de manuscritos, pergaminos y crónicas antiguas deben organizarse, compararse e indexarse.
Para ayudarlos, los ancestros crearon un mecanismo legendario: El Oráculo de la similitud. Este es
un dispositivo capaz de establecer, con una precisión notable, qué tan similares
son dos fragmentos de texto, devolviendo una puntuación entre 0 y 5.
Pero el mecanismo se ha degradado con el tiempo, y el Gran Consejo de Archivistas ha decidido que se necesita
una versión moderna, construida usando aprendizaje automático.
Para esto, se han puesto a tu disposición dos archivos:
train.csv - pergaminos anotados manualmente por escribastest.csv - pares nuevos que deben ser analizados por tu soluciónTu tarea es reconstruir El Oráculo a través de una serie de análisis y un modelo predictivo final.
Cada fila en los archivos train.csv y test.csv representa un par de oraciones:
El objetivo final es predecir score para cada fila en test.csv.
Para las primeras subtareas, debes analizar los datos proporcionados en train.csv y test.csv
y extraer diferentes informaciones relevantes sobre las oraciones del test.
Calcula la longitud de cada oración (sentence1 y sentence2) para cada fila en el conjunto de test
y etiqueta el par según la longitud promedio:
Short si el promedio < 50Medium si 50 ≤ promedio < 100Long si el promedio ≥ 100Para cada fila en test, calcula el número de palabras en cada oración (sentence1 y sentence2) y determina el número total según la fórmula:
número_total = nr_palabras(sentence1) + nr_palabras(sentence2)Establece la diferencia absoluta entre la longitud de sentence1 y la longitud de sentence2
para cada fila en test.
En otras palabras, para cada fila debemos calcular:
|nr_caracteres(sentence1) - nr_caracteres(sentence2)|Construye un modelo de aprendizaje automático capaz de predecir el valor numérico score
para cada fila en test.csv.
La evaluación final se realizará usando MAE (Mean Absolute Error), calculado así:
La métrica para la Subtarea 4 es:
Para las subtareas 1-3, las respuestas se evalúan exactamente.
El archivo submission.csv debe contener 4 líneas para cada fila en test,
correspondientes a las 4 subtareas.
Estructura:
subtaskID datapointID answerSignificado de las columnas:
subtaskID – un número entre 1 y 4
datapointID – sampleID del test
answer – el resultado:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74¡Éxito! ¡El Gran Consejo de Archivistas pone sus esperanzas en ustedes para revivir el Oráculo de la similitud! 🧙♂️