Opgave #39
Forfatter:Mihai Nan
Sværhedsgrad
Din bedste score
N/A
I Det Store Kongeriges Bibliotek står arkivarer over for en stadig vanskeligere opgave:
tusindvis af manuskripter, pergamenter og gamle krøniker skal organiseres, sammenlignes og indekseres.
For at hjælpe dem har forfædrene skabt en legendarisk mekanisme: Lighedens Orakel. Dette er
en enhed, der er i stand til at fastslå med bemærkelsesværdig præcision, hvor ens
to tekstfragmenter er, og returnerer en score mellem 0 og 5.
Men mekanismen er blevet forringet over tid, og Det Store Arkivråd har besluttet, at der er brug
for en moderne version, bygget ved hjælp af maskinlæring.
Til dette er der stillet to filer til rådighed:
train.csv - pergamenter annoteret manuelt af skriveretest.csv - nye par, der skal analyseres af din løsningDin opgave er at rekonstruere Oraklet gennem en række analyser og en endelig prædiktiv model.
Hver række i filerne train.csv og test.csv repræsenterer et par sætninger:
Det endelige mål er at forudsige score for hver række i test.csv.
For de første subtasks skal du analysere dataene leveret i train.csv og test.csv
og udtrække forskellige relevante informationer om sætningerne fra test.
Beregn længden af hver sætning (sentence1 og sentence2) for hver række i testsættet
og etiket parret baseret på den gennemsnitlige længde:
Short hvis gennemsnit < 50Medium hvis 50 ≤ gennemsnit < 100Long hvis gennemsnit ≥ 100For hver række i test skal du beregne antallet af ord i hver sætning (sentence1 og sentence2) og bestemme det samlede antal efter formlen:
samlet_antal = antal_ord(sentence1) + antal_ord(sentence2)Fastslå den absolutte forskel mellem længden af sentence1 og længden af sentence2
for hver række i test.
Med andre ord skal vi for hver række beregne:
|antal_tegn(sentence1) - antal_tegn(sentence2)|Byg en maskinlæringsmodel, der er i stand til at forudsige den numeriske værdi score
for hver række i test.csv.
Den endelige evaluering vil blive udført ved hjælp af MAE (Mean Absolute Error), beregnet således:
Metrikken for Subtask 4 er:
For subtasks 1-3 evalueres svarene nøjagtigt.
Filen submission.csv skal indeholde 4 linjer for hver række i test,
svarende til de 4 subtasks.
Struktur:
subtaskID datapointID answerBetydningen af kolonnerne:
subtaskID – et tal mellem 1 og 4
datapointID – sampleID fra test
answer – resultatet:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Held og lykke! Det Store Arkivråd sætter deres håb til jer for at genoplive Lighedens Orakel! 🧙♂️