Oppgave #39
Forfatter:Mihai Nan
Vanskelighetsgrad
Din beste poengsum
N/A
I Det Store Rikets Bibliotek står arkivarene overfor en stadig vanskeligere oppgave:
tusenvis av manuskripter, pergamenter og gamle krøniker må organiseres, sammenlignes og indekseres.
For å hjelpe dem har forfedrene skapt en legendarisk mekanisme: Likhetsorakelet. Dette er
en innretning som kan fastslå, med bemerkelsesverdig presisjon, hvor like
to tekstfragmenter er, og returnerer en skår mellom 0 og 5.
Men mekanismen har blitt forringet over tid, og Det Store Arkivarrådet har bestemt at det trengs
en moderne versjon, bygget ved hjelp av maskinlæring.
For dette har du fått tilgang til to filer:
train.csv - pergamenter manuelt annotert av skriveretest.csv - nye par som må analyseres av din løsningDin oppgave er å rekonstruere Orakelet gjennom en serie analyser og en endelig prediktiv modell.
Hver rad i filene train.csv og test.csv representerer et par setninger:
Det endelige målet er å predikere score for hver rad i test.csv.
For de første deloppgavene må du analysere dataene gitt i train.csv og test.csv
og trekke ut ulik relevant informasjon om setningene fra test.
Beregn lengden på hver setning (sentence1 og sentence2) for hver rad i testsettet
og merk paret basert på gjennomsnittslengden:
Short hvis gjennomsnittet < 50Medium hvis 50 ≤ gjennomsnittet < 100Long hvis gjennomsnittet ≥ 100For hver rad i test, beregn antall ord i hver setning (sentence1 og sentence2) og bestem totalt antall etter formelen:
totalt_antall = antall_ord(sentence1) + antall_ord(sentence2)Fastslå den absolutte forskjellen mellom lengden på sentence1 og lengden på sentence2
for hver rad i test.
Med andre ord, for hver rad må vi beregne:
|antall_tegn(sentence1) - antall_tegn(sentence2)|Bygg en maskinlæringsmodell som kan predikere den numeriske verdien score
for hver rad i test.csv.
Den endelige evalueringen vil bli gjort ved hjelp av MAE (Mean Absolute Error), beregnet som følger:
Metrikken for Deloppgave 4 er:
For deloppgave 1-3 evalueres svarene eksakt.
Filen submission.csv må inneholde 4 linjer for hver rad i test,
tilsvarende de 4 deloppgavene.
Struktur:
subtaskID datapointID answerBetydningen av kolonnene:
subtaskID – et tall mellom 1 og 4
datapointID – sampleID fra test
answer – resultatet:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Lykke til! Det Store Arkivarrådet setter sitt håp til dere for å gjenopplive Likhetsorakelet! 🧙♂️