Dificultad
Tu mejor puntuación
N/D
Se pueden utilizar explícitamente modelos de lenguaje preentrenados (ej: BERT, RoBERTa, sentence-transformers) con pesos cargados. La aceleración por GPU para el entrenamiento y la inferencia está completamente permitida. Los pipelines clásicos de NLP basados en TF-IDF también están permitidos y se fomentan.
En algún lugar de las llanuras secas de Nuevo México, 1883.
El viejo Sheriff Clem Dudley tenía una costumbre que ningún ayudante llegó a comprender: cada noche, sin importar cuán largo hubiera sido el día, ponía su sombrero sobre la silla del caballo, se tumbaba en la manta y miraba directamente hacia arriba, al cielo.
"Las estrellas no mienten", solía decir. "Cualquier fugitivo, cualquier vagabundo, cualquier hombre honrado — todos miran el mismo cielo".
Una noche de agosto, agotado tras tres días persiguiendo a la banda Vega por el desierto, Clem se tumbó bajo un cielo negro como la tinta, salpicado de más estrellas de las que jamás había contado. Intentaba conciliar el sueño cuando las estrellas empezaron a moverse — lentamente al principio, como brasas llevadas por el viento de un fuego agonizante. Luego, cada vez más rápido. Trazaban líneas entre ellas. Triángulos. Espirales. Animales. Cifras. Formas de las que no conocía el nombre.
"Debe de ser el calor", murmuró. Pero siguió mirando.
Las formas se convirtieron en palabras. No pronunciadas — sentidas. Cada constelación parecía portar un significado, un peso, una historia colgada de ella como un cartel de búsqueda en el tablón de un sheriff. Alargó la mano hacia el lápiz para anotarlas, y entonces — nada.
Se despertó en otro lugar.
El Reino entre las Estrellas. Así lo llamaban ellos.
Era un territorio vasto y silencioso donde el cielo era el suelo y las constelaciones eran aldeas — cada una un grupo de estrellas dispuestas en una forma, y cada forma portando un nombre que esperaba ser emparejado con su historia. Los habitantes de este reino, los Escribas de las Estrellas, habían llevado registros meticulosos durante siglos: diarios, poemas, bitácoras de viaje, leyendas — todos escritos por personas que habían mirado esas mismas formas estelares desde abajo, en la tierra.
Pero algo había salido mal. Una gran tormenta celeste — los lugareños la llamaban La Dispersión — había arrancado cada etiqueta de cada constelación y las había lanzado al viento. Ahora, miles de textos flotaban desatados sobre las formas estelares que una vez describieron, y los Escribas de las Estrellas ya no podían decir qué historia pertenecía a qué cielo.
A Clem se le entregó una insignia hecha de luz estelar y una instrucción sencilla:
"Devuelve las palabras a las estrellas, Sheriff. Antes de que llegue la próxima tormenta".
Se te proporciona un conjunto de constelaciones de estrellas, cada una descrita por una secuencia de puntos 2D que forman una figura geométrica (ej: una cruz, una espiral, una figura de cinco puntas, cifras como 6, 7, 8, combinaciones de cifras, etc.). También se te proporciona un gran conjunto de fragmentos de texto candidatos — entradas de diario, leyendas, descripciones — cada uno escrito originalmente sobre una única constelación específica.
Tu objetivo es construir un modelo capaz de asignar correctamente a cada texto del conjunto la constelación correspondiente, basándose exclusivamente en la relación semántica y estructural entre la geometría de las coordenadas y el contenido del texto.
train.csv contiene 300 pares constelación-texto con etiquetas:
| Columna | Descripción |
|---|---|
id | ID de la constelación (0-299) |
coords | Vector de coordenadas de 728 dimensiones, separado por barras: \|x1\|x2\|...\|x728\| |
text | El fragmento literario correspondiente |
test.csv contiene 50 secuencias de constelaciones sin etiquetas (datapointID 1-50):
| Columna | Descripción |
|---|---|
datapointID | Entero del 1 al 50 |
coords | Mismo formato con tuberías (pipes) que en el entrenamiento |
Cada datapointID aparece de 40 a 65 veces. No se proporcionan etiquetas de texto.
candidates.csv contiene 500 fragmentos de texto:
| Columna | Descripción |
|---|---|
text_id | Entero 0-499 |
text | Un fragmento literario (diario, poema, leyenda) |
El archivo de envío debe estar en formato CSV con las siguientes columnas:
| Campo | Descripción |
|---|---|
subtaskID | Debe ser 1 para todas las filas |
datapointID | Entero 1-50, el identificador de la constelación de prueba |
answer | El text_id predicho (entero 0-499) |
Cada uno de los 50 datapointID de prueba debe aparecer exactamente una vez.
Ejemplo:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Cada predicción se evalúa como una clasificación de etiqueta única sobre los 500 IDs de texto candidatos. La predicción es correcta (1) o incorrecta (0).
La métrica final es el número de predicciones correctas / 50.
Las puntuaciones brutas se convierten en puntos de concurso utilizando una función lineal con un umbral mínimo:
| Accuracy | Puntuación |
|---|---|
| < 0.30 | 0 puntos |
| >= 0.85 | 100 puntos |
| Intermedio (0.30 - 0.85) | Escala lineal entre 0 y 100 |
En resumen: debes emparejar correctamente al menos 15 de 50 constelaciones (accuracy = 0.30) para obtener puntos, y el emparejamiento correcto de 43 o más (accuracy >= 0.85) otorga la puntuación máxima.
"Las estrellas no mienten. Puedes confiar más en una estrella que en un hombre..." — Sheriff Clem Dudley, 1883