Moeilijkheid
Jouw beste score
N.v.t.
In een geglobaliseerde wereld komen berichten uit alle hoeken van de wereld en kunnen ze in verschillende talen geschreven zijn. Om deze teksten automatisch te verwerken (bijvoorbeeld in automatische vertaalapplicaties) is het essentieel dat we de taal van elke tekst kunnen identificeren.
Jouw rol is om een automatisch systeem te ontwikkelen dat de taal van een tekst kan bepalen, uitgaande van het trainen van een model op basis van een set gelabelde voorbeelden.
Het automatische systeem moet werken voor de volgende talen:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Je hebt twee CSV-bestanden tot je beschikking:
Elke rij in train.csv heeft de volgende kolommen:
SampleID - de unieke identificator van de tekstText - de originele tekstlanguage - de taal van de tekstVoorbeeld:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchElke rij in test.csv heeft de volgende kolommen:
SampleID - de unieke identificator van de tekstText - de tekst waarvoor de taal voorspeld moet wordenVoorbeeld:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Bouw een systeem dat de taal van de tekst kan identificeren voor de teksten in test.csv.
De voorspellingen moeten opgeslagen worden in een bestand submission.csv met het formaat:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishwaarbij:
SampleID - de unieke identificator van de tekst uit test.csvlanguage - de door jouw systeem voorspelde taal, die een van de mogelijke talen uit de volgende lijst moet zijn:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
De voorspellingen worden vergeleken met de werkelijke talen en de nauwkeurigheid wordt berekend:
accuracy = (aantal_juiste_voorspellingen / totaal_aantal_voorspellingen)De eindscore wordt berekend op basis van de behaalde nauwkeurigheid met behulp van de volgende regels: