Probleem #39
Auteur:Mihai Nan
Moeilijkheid
Jouw beste score
N.v.t.
In de Bibliotheek van het Grote Koninkrijk worden de archivisten geconfronteerd met een steeds moeilijkere taak:
duizenden manuscripten, perkamenten en oude kronieken moeten georganiseerd, vergeleken en geïndexeerd worden.
Om hen te helpen hebben de voorouders een legendarisch mechanisme gecreëerd: Het Orakel van Gelijkenis. Dit is
een apparaat dat in staat is om met opmerkelijke precisie vast te stellen hoe vergelijkbaar
twee tekstfragmenten zijn, door een score tussen 0 en 5 terug te geven.
Maar het mechanisme is in de loop der tijd verslechterd, en de Grote Raad van Archivisten heeft besloten dat er behoefte is
aan een moderne versie, gebouwd met behulp van machine learning.
Hiervoor zijn twee bestanden tot je beschikking gesteld:
train.csv - handmatig geannoteerde perkamenten door schriftgeleerdentest.csv - nieuwe paren die geanalyseerd moeten worden door jouw oplossingJouw taak is om het Orakel te reconstrueren door middel van een reeks analyses en een finaal predictief model.
Elke rij in de bestanden train.csv en test.csv vertegenwoordigt een paar zinnen:
Het uiteindelijke doel is om score te voorspellen voor elke rij in test.csv.
Voor de eerste subtaken moet je de gegevens in train.csv en test.csv analyseren
en verschillende relevante informatie extraheren over de zinnen in de test.
Bereken de lengte van elke zin (sentence1 en sentence2) voor elke rij in de testset
en label het paar op basis van de gemiddelde lengte:
Short als het gemiddelde < 50Medium als 50 ≤ gemiddelde < 100Long als gemiddelde ≥ 100Voor elke rij in test, bereken het aantal woorden in elke zin (sentence1 en sentence2) en bepaal het totale aantal volgens de formule:
totaal_aantal = nr_woorden(sentence1) + nr_woorden(sentence2)Bepaal het absolute verschil tussen de lengte van sentence1 en de lengte van sentence2
voor elke rij in test.
Met andere woorden, voor elke rij moeten we berekenen:
|nr_karakters(sentence1) - nr_karakters(sentence2)|Bouw een machine learning model dat in staat is om de numerieke waarde score
te voorspellen voor elke rij in test.csv.
De finale evaluatie wordt gedaan met MAE (Mean Absolute Error), berekend als volgt:
De metriek voor Subtaak 4 is:
Voor subtaken 1-3 worden de antwoorden exact geëvalueerd.
Het bestand submission.csv moet 4 regels bevatten voor elke rij in test,
corresponderend met de 4 subtaken.
Structuur:
subtaskID datapointID answerBetekenis van de kolommen:
subtaskID – een nummer tussen 1 en 4
datapointID – sampleID uit test
answer – het resultaat:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Succes! De Grote Raad van Archivisten stelt hun hoop in jullie om het Orakel van Gelijkenis nieuw leven in te blazen! 🧙♂️