Aufgabe #39
Autor:Mihai Nan
Schwierigkeit
Dein bestes Ergebnis
N/V
In der Bibliothek des Großen Königreichs stehen die Archivare vor einer immer schwierigeren Aufgabe:
Tausende von Manuskripten, Pergamenten und alten Chroniken müssen organisiert, verglichen und indexiert werden.
Um ihnen zu helfen, haben die Vorfahren einen legendären Mechanismus geschaffen: Das Orakel der Ähnlichkeit. Dies ist
ein Gerät, das mit bemerkenswerter Präzision bestimmen kann, wie ähnlich sich
zwei Textfragmente sind, indem es einen Score zwischen 0 und 5 zurückgibt.
Aber der Mechanismus hat sich mit der Zeit verschlechtert, und der Große Rat der Archivare hat entschieden, dass eine
moderne Version benötigt wird, die mit maschinellem Lernen erstellt wird.
Dafür wurden dir zwei Dateien zur Verfügung gestellt:
train.csv - von Schreibern manuell annotierte Pergamentetest.csv - neue Paare, die von deiner Lösung analysiert werden müssenDeine Aufgabe ist es, das Orakel durch eine Reihe von Analysen und ein finales Vorhersagemodell zu rekonstruieren.
Jede Zeile in den Dateien train.csv und test.csv repräsentiert ein Satzpaar:
Das finale Ziel ist es, score für jede Zeile in test.csv vorherzusagen.
Für die ersten Subtasks müssen Sie die in train.csv und test.csv bereitgestellten Daten analysieren
und verschiedene relevante Informationen über die Sätze im Test extrahieren.
Berechnen Sie die Länge jedes Satzes (sentence1 und sentence2) für jede Zeile im Testset
und kennzeichnen Sie das Paar basierend auf der durchschnittlichen Länge:
Short wenn Durchschnitt < 50Medium wenn 50 ≤ Durchschnitt < 100Long wenn Durchschnitt ≥ 100Für jede Zeile im Test berechnen Sie die Anzahl der Wörter in jedem Satz (sentence1 und sentence2) und bestimmen Sie die Gesamtzahl nach der Formel:
gesamtzahl = anzahl_wörter(sentence1) + anzahl_wörter(sentence2)Bestimmen Sie den absoluten Unterschied zwischen der Länge von sentence1 und der Länge von sentence2
für jede Zeile im Test.
Mit anderen Worten, für jede Zeile müssen wir berechnen:
|anzahl_zeichen(sentence1) - anzahl_zeichen(sentence2)|Erstellen Sie ein maschinelles Lernmodell, das den numerischen Wert score
für jede Zeile in test.csv vorhersagen kann.
Die finale Bewertung erfolgt mit MAE (Mean Absolute Error), berechnet wie folgt:
Die Metrik für Subtask 4 ist:
Für Subtasks 1-3 werden die Antworten exakt bewertet.
Die Datei submission.csv muss 4 Zeilen für jede Zeile im Test enthalten,
entsprechend den 4 Subtasks.
Struktur:
subtaskID datapointID answerBedeutung der Spalten:
subtaskID – eine Zahl zwischen 1 und 4
datapointID – sampleID aus dem Test
answer – das Ergebnis:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Viel Erfolg! Der Große Rat der Archivare setzt seine Hoffnungen auf euch, um das Orakel der Ähnlichkeit wiederzubeleben! 🧙♂️