Ülesanne #39
Autor:Mihai Nan
Raskusaste
Sinu parim tulemus
Puudub
Suure Kuningriigi Raamatukogus seisavad arhivaarid üha keerulisema ülesande ees:
tuhanded käsikirjad, pergamendid ja vanad kroonikad tuleb organiseerida, võrrelda ja indekseerida.
Nende abistamiseks on esivanemad loonud legendaarse mehhanismi: Sarnasuse oraakli. See on
seade, mis suudab märkimisväärse täpsusega määrata, kui sarnased
on kaks tekstifragmenti, tagastades skoori vahemikus 0 kuni 5.
Kuid mehhanism on aja jooksul degradeerunud ja Arhivaaride Suur Nõukogu on otsustanud, et vaja on
kaasaegset versiooni, mis on ehitatud masinõppe abil.
Selleks on sulle antud kaks faili:
train.csv - kirjutajate poolt käsitsi annoteeritud pergamendidtest.csv - uued paarid, mida sinu lahendus peab analüüsimaSinu ülesanne on rekonstrueerida Oraakel läbi analüüside seeria ja lõpliku ennustava mudeli.
Iga rida failides train.csv ja test.csv esindab lausete paari:
Lõplik eesmärk on ennustada score iga rea jaoks failis test.csv.
Esimeste alamülesannete jaoks peate analüüsima failides train.csv ja test.csv antud andmeid
ja eraldama erinevat olulist teavet testilausete kohta.
Arvutage iga lause pikkus (sentence1 ja sentence2) iga rea jaoks testikomplektis
ja märgistage paar keskmise pikkuse alusel:
Short kui keskmine < 50Medium kui 50 ≤ keskmine < 100Long kui keskmine ≥ 100Iga rea jaoks testis arvutage sõnade arv igas lauses (sentence1 ja sentence2) ja määrake kogusumma valemiga:
kogusumma = sõnade_arv(sentence1) + sõnade_arv(sentence2)Määrake absoluutne erinevus sentence1 ja sentence2 pikkuse vahel
iga rea jaoks testis.
Teisisõnu, iga rea jaoks peame arvutama:
|märkide_arv(sentence1) - märkide_arv(sentence2)|Ehitage masinõppe mudel, mis suudab ennustada numbrilist väärtust score
iga rea jaoks failis test.csv.
Lõplik hindamine toimub kasutades MAE (Mean Absolute Error), mis arvutatakse järgmiselt:
Alamülesande 4 mõõdik on:
Alamülesannete 1-3 puhul hinnatakse vastuseid täpselt.
Fail submission.csv peab sisaldama 4 rida iga testi rea kohta,
mis vastavad 4 alamülesandele.
Struktuur:
subtaskID datapointID answerVeergude tähendus:
subtaskID – number vahemikus 1 kuni 4
datapointID – sampleID testist
answer – tulemus:
Short / Medium / LongsampleID = 1714 jaoks:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Edu! Arhivaaride Suur Nõukogu paneb oma lootused teie peale sarnasuse oraakli taaselustamiseks! 🧙♂️