Moeilijkheid
Jouw beste score
N.v.t.
Er wordt een dataset aangeboden met gedichten in het Roemeens, elk geschreven door een van de 7 auteurs. De gedichten zijn vervolgens verdeeld in groepen van 4 verzen.
De 7 auteurs zijn:
Een groep van 4 verzen kan het volgende vertegenwoordigen:
Het doel van het probleem is om een model te bouwen dat de auteur van een groep van 4 verzen kan voorspellen.
De dataset voor training, met de volgende kolommen:
Id – unieke identificator voor de groep verzenVersuri – inhoud van 4 verzenAutor – auteur van de verzenVoorbeeld:
| Id | Versuri | Autor |
|---|---|---|
| 0001 | Sus, pe dealuri, Toamna pune... | Mihai Eminescu |
| 0002 | Te sărut și eu și Luna... | George Toparceanu |
De dataset voor testen, die de kolom Autor niet bevat:
Id – unieke identificatorVersuri – inhoud van 4 verzenVoorbeeld:
| Id | Versuri |
|---|---|
| 120001 | Freamătul pădurii se așterne ușor... |
| 120002 | În zori de zi, zorii răsar peste sat... |
Het inzendingsbestand moet een CSV zijn met de volgende kolommen:
Id – identificator van de groep verzenAutor – voorspelde auteurVoorbeeld:
| Id | Autor |
|---|---|
| 120001 | Mihai Eminescu |
| 120002 | George Toparceanu |
De voorspellingen worden vergeleken met de werkelijke talen en de nauwkeurigheid wordt berekend:
accuracy = (aantal_juiste_voorspellingen / totaal_aantal_voorspellingen)De eindscore wordt berekend op basis van de behaalde nauwkeurigheid met de volgende regels: