Zadanie #39
Autor:Mihai Nan
Trudność
Twój najlepszy wynik
Nie dotyczy
W Bibliotece Wielkiego Królestwa archiwariusze stają przed coraz trudniejszym zadaniem:
tysiące manuskryptów, pergaminów i starych kronik musi zostać uporządkowanych, porównanych i zindeksowanych.
Aby im pomóc, przodkowie stworzyli legendarny mechanizm: Wyrocznię podobieństwa. Jest to
urządzenie zdolne do ustalenia, z niezwykłą precyzją, jak podobne
są dwa fragmenty tekstu, zwracając wynik między 0 a 5.
Ale mechanizm uległ degradacji z czasem, a Wielka Rada Archiwariuszy zdecydowała, że potrzebna jest
nowoczesna wersja, zbudowana przy użyciu uczenia maszynowego.
W tym celu udostępniono ci dwa pliki:
train.csv - pergaminy ręcznie opisane przez skrybówtest.csv - nowe pary, które muszą zostać przeanalizowane przez twoje rozwiązanieTwoim zadaniem jest zrekonstruowanie Wyroczni poprzez serię analiz i końcowy model predykcyjny.
Każdy wiersz w plikach train.csv i test.csv reprezentuje parę zdań:
Końcowym celem jest przewidzenie score dla każdego wiersza z test.csv.
Dla pierwszych podzadań musisz przeanalizować dane dostarczone w train.csv i test.csv
i wyodrębnić różne istotne informacje o zdaniach z testu.
Oblicz długość każdego zdania (sentence1 i sentence2) dla każdego wiersza ze zbioru testowego
i oznacz parę w zależności od średniej długości:
Short jeśli średnia < 50Medium jeśli 50 ≤ średnia < 100Long jeśli średnia ≥ 100Dla każdego wiersza z testu oblicz liczbę słów w każdym zdaniu (sentence1 i sentence2) i określ liczbę całkowitą według wzoru:
liczba_całkowita = liczba_słów(sentence1) + liczba_słów(sentence2)Ustal różnicę bezwzględną między długością sentence1 a długością sentence2
dla każdego wiersza z testu.
Innymi słowy, dla każdego wiersza musimy obliczyć:
|liczba_znaków(sentence1) - liczba_znaków(sentence2)|Zbuduj model uczenia maszynowego zdolny do przewidywania wartości numerycznej score
dla każdego wiersza z test.csv.
Końcowa ocena zostanie przeprowadzona przy użyciu MAE (Mean Absolute Error), obliczanego w następujący sposób:
Metryka dla Podzadania 4 to:
Dla podzadań 1-3 odpowiedzi są oceniane dokładnie.
Plik submission.csv musi zawierać 4 linie dla każdego wiersza z testu,
odpowiadające 4 podzadaniom.
Struktura:
subtaskID datapointID answerZnaczenie kolumn:
subtaskID – liczba między 1 a 4
datapointID – sampleID z testu
answer – wynik:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Powodzenia! Wielka Rada Archiwariuszy pokłada w was nadzieje na ożywienie Wyroczni podobieństwa! 🧙♂️