Problema #39
Autore:Mihai Nan
Difficoltà
Il tuo miglior punteggio
N/D
Nella Biblioteca del Grande Regno, gli archivisti si confrontano con un compito sempre più difficile:
migliaia di manoscritti, pergamene e cronache antiche devono essere organizzate, confrontate e indicizzate.
Per aiutarli, gli antenati hanno creato un meccanismo leggendario: l'Oracolo della similarità. Questo è
un dispositivo capace di stabilire, con una precisione notevole, quanto sono simili
due frammenti di testo, restituendo un punteggio tra 0 e 5.
Ma il meccanismo si è degradato nel tempo, e il Grande Consiglio degli Archivisti ha deciso che è necessaria
una versione moderna, costruita utilizzando l'apprendimento automatico.
Per questo, ti sono stati messi a disposizione due file:
train.csv - le pergamene annotate manualmente dagli scribitest.csv - nuove coppie che devono essere analizzate dalla tua soluzioneIl tuo compito è ricostruire l'Oracolo attraverso una serie di analisi e un modello predittivo finale.
Ogni riga nei file train.csv e test.csv rappresenta una coppia di frasi:
L'obiettivo finale è predire score per ogni riga in test.csv.
Per i primi subtask, devi analizzare i dati forniti in train.csv e test.csv
ed estrarre diverse informazioni rilevanti sulle frasi del test.
Calcola la lunghezza di ogni frase (sentence1 e sentence2) per ogni riga nel set di test
ed etichetta la coppia in base alla lunghezza media:
Short se la media < 50Medium se 50 ≤ media < 100Long se la media ≥ 100Per ogni riga nel test, calcola il numero di parole in ogni frase (sentence1 e sentence2) e determina il numero totale secondo la formula:
numero_totale = nr_parole(sentence1) + nr_parole(sentence2)Stabilisci la differenza assoluta tra la lunghezza di sentence1 e la lunghezza di sentence2
per ogni riga nel test.
In altre parole, per ogni riga dobbiamo calcolare:
|nr_caratteri(sentence1) - nr_caratteri(sentence2)|Costruisci un modello di apprendimento automatico capace di predire il valore numerico score
per ogni riga in test.csv.
La valutazione finale sarà fatta utilizzando MAE (Mean Absolute Error), calcolato così:
La metrica per il Subtask 4 è:
Per i subtask 1-3, le risposte sono valutate esattamente.
Il file submission.csv deve contenere 4 righe per ogni riga del test,
corrispondenti ai 4 subtask.
Struttura:
subtaskID datapointID answerSignificato delle colonne:
subtaskID – un numero tra 1 e 4
datapointID – sampleID dal test
answer – il risultato:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Successo! Il Grande Consiglio degli Archivisti ripone le sue speranze in voi per far rivivere l'Oracolo della similarità! 🧙♂️