Tehtävä #39
Tekijä:Mihai Nan
Vaikeustaso
Paras tuloksesi
Ei saatavilla
Suuren Kuningaskunnan Kirjastossa arkistonhoitajat kohtaavat yhä vaikeamman tehtävän:
tuhansia käsikirjoituksia, pergamentteja ja vanhoja kronikoita täytyy järjestää, vertailla ja indeksoida.
Auttaakseen heitä, esi-isät loivat legendaarisen mekanismin: Samankaltaisuuden oraakkelin. Tämä on
laite, joka kykenee määrittämään huomattavalla tarkkuudella, kuinka samankaltaisia
kaksi tekstifragmenttia ovat, palauttaen pistemäärän väliltä 0-5.
Mutta mekanismi on rappeutunut ajan myötä, ja Arkistonhoitajien Suuri Neuvosto on päättänyt, että tarvitaan
moderni versio, joka rakennetaan koneoppimista käyttäen.
Tätä varten sinun käyttöösi on annettu kaksi tiedostoa:
train.csv - kirjurien manuaalisesti merkitsemät pergamentittest.csv - uudet parit, jotka ratkaisusi täytyy analysoidaTehtäväsi on rekonstruoida Oraakkeli sarjan analyysien ja lopullisen ennustemallin avulla.
Jokainen rivi tiedostoissa train.csv ja test.csv edustaa lauseparia:
Lopullinen tavoite on ennustaa score jokaiselle riville tiedostossa test.csv.
Ensimmäisissä alitehtävissä sinun täytyy analysoida tiedostoissa train.csv ja test.csv annettuja tietoja
ja poimia erilaisia relevantteja tietoja testin lauseista.
Laske jokaisen lauseen (sentence1 ja sentence2) pituus jokaiselle riville testitietojoukkossa
ja merkitse pari keskimääräisen pituuden mukaan:
Short jos keskiarvo < 50Medium jos 50 ≤ keskiarvo < 100Long jos keskiarvo ≥ 100Laske jokaiselle testin riville sanojen määrä jokaisessa lauseessa (sentence1 ja sentence2) ja määritä kokonaismäärä kaavan mukaan:
kokonaismäärä = sanojen_määrä(sentence1) + sanojen_määrä(sentence2)Määritä itseisarvoero sentence1:n ja sentence2:n pituuden välillä
jokaiselle testin riville.
Toisin sanoen, jokaiselle riville täytyy laskea:
|merkkien_määrä(sentence1) - merkkien_määrä(sentence2)|Rakenna koneoppimismalli, joka kykenee ennustamaan numeerisen arvon score
jokaiselle riville tiedostossa test.csv.
Lopullinen arviointi tehdään käyttäen MAE (Mean Absolute Error) -metriikkaa, joka lasketaan seuraavasti:
Alitehtävän 4 metriikka on:
Alitehtävissä 1-3 vastaukset arvioidaan tarkasti.
Tiedoston submission.csv täytyy sisältää 4 riviä jokaista testin riviä kohden,
vastaten 4 alitehtävää.
Rakenne:
subtaskID datapointID answerSarakkeiden merkitys:
subtaskID – numero väliltä 1-4
datapointID – sampleID testistä
answer – tulos:
Short / Medium / LongsampleID = 1714:lle:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Onnea! Arkistonhoitajien Suuri Neuvosto asettaa toivonsa teihin Samankaltaisuuden oraakkelin herättämiseksi henkiin! 🧙♂️