Probleem #43
Auteur:Mihai Nan
Moeilijkheid
Jouw beste score
N.v.t.
Elk jaar bereiden duizenden afgestudeerde geneeskundestudenten zich voor op het moeilijkste moment van hun carrière: het Toelatingsexamen voor de Specialisatie. Maandenlang memoriseren, herhalen en lossen toekomstige artsen honderden meerkeuzevragen op.
Maar dit jaar heeft de Centrale Commissie besloten om een grote innovatie te introduceren: een geautomatiseerd platform dat antwoorden controleert en evalueert met behulp van machine learning.
Helaas is het prototype van het systeem fouten gaan vertonen, en de commissie heeft jouw hulp nodig om het te repareren.
Er zijn twee bestanden tot je beschikking gesteld:
Jouw doel is om het automatische correctiemechanisme te reconstrueren.
Elke rij vertegenwoordigt een meerkeuzevraag uit het examen:
Bouw een machine learning model dat in staat is om voor elke vraag uit test.csv te voorspellen welke van de vier varianten (0–3) het juiste antwoord is.
Je model wordt geëvalueerd op basis van nauwkeurigheid:
Elke methode is toegestaan: klassieke ML-algoritmen, embeddings, taalmodellen, medische BERT etc.
Het bestand submission.csv moet één rij bevatten voor elke vraag uit test.
De eerste regel van het bestand bevat het volgende:
DatapointID, PredictedAnswerwaarbij:
SampleID uit test84f328d3-fca4-422d-8fb2-19d55eb31503):84f328d3-fca4-422d-8fb2-19d55eb31503, 2