Feladat #39
Szerző:Mihai Nan
Nehézség
Az Ön legjobb eredménye
N/A
A Nagy Királyság Könyvtárában az archiváriusok egyre nehezebb feladattal szembesülnek:
kéziratok, pergamenek és régi krónikák ezreit kell rendszerezni, összehasonlítani és indexelni.
Segítségükre az ősök egy legendás mechanizmust hoztak létre: A hasonlóság orákulumát. Ez egy
olyan eszköz, amely figyelemre méltó pontossággal képes megállapítani, mennyire hasonlóak
két szövegrészlet, 0 és 5 közötti pontszámot visszaadva.
De a mechanizmus idővel leromlott, és az Archiváriusok Nagy Tanácsa úgy döntött, hogy szükség van
egy modern verzióra, amely gépi tanulást használ.
Ehhez két fájl áll rendelkezésedre:
train.csv - az írnokok által manuálisan annotált pergamenektest.csv - új párok, amelyeket a megoldásodnak kell elemeznieA feladatod az Orákulum újjáépítése egy sor elemzés és egy végső prediktív modell segítségével.
A train.csv és test.csv fájlok minden sora egy mondatpárt reprezentál:
A végső cél a score előrejelzése a test.csv minden sorára.
Az első részfeladatokhoz elemezned kell a train.csv és test.csv fájlokban megadott adatokat
és különböző releváns információkat kell kinyerned a teszt mondatairól.
Számítsd ki minden mondat (sentence1 és sentence2) hosszát a teszthalmaz minden sorára
és címkézd fel a párt az átlagos hossz alapján:
Short ha az átlag < 50Medium ha 50 ≤ átlag < 100Long ha az átlag ≥ 100A teszt minden sorára számítsd ki a szavak számát minden mondatban (sentence1 és sentence2) és határozd meg a teljes számot a következő képlet szerint:
teljes_szám = szavak_száma(sentence1) + szavak_száma(sentence2)Állapítsd meg a sentence1 és sentence2 hossza közötti abszolút különbséget
a teszt minden sorára.
Más szóval, minden sorra ki kell számítanunk:
|karakterek_száma(sentence1) - karakterek_száma(sentence2)|Építs egy gépi tanulási modellt, amely képes előrejelezni a numerikus score értéket
a test.csv minden sorára.
A végső értékelés MAE (Mean Absolute Error) használatával történik, amely így számítható:
A 4. részfeladat metrikája:
Az 1-3. részfeladatok esetében a válaszokat pontosan értékelik.
A submission.csv fájlnak 4 sort kell tartalmaznia minden tesztsorra,
a 4 részfeladatnak megfelelően.
Struktúra:
subtaskID datapointID answerA oszlopok jelentése:
subtaskID – 1 és 4 közötti szám
datapointID – sampleID a tesztből
answer – az eredmény:
Short / Medium / LongsampleID = 1714 esetére:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Sok szerencsét! Az Archiváriusok Nagy Tanácsa reményeit belétek veti a hasonlóság orákulumának újjáélesztéséhez! 🧙♂️