Težavnost
Vaš najboljši rezultat
N/A
Petrică este editor de podcasturi la 6-7 Productions™. Deși e foarte priceput la meserie, fiind
surd trebuie să se bazeze pe Dorel, microfonistul firmei, ca să știe cine vorbește în fiecare clip.
Problema e că Dorel, uituc din fire, a uitat să noteze la ultimul podcast cine anume vorbește :Q.
Din fericire, Petrică mai are un arhivă de înregistrări de la podcasturile trecute, etichetate
corect cu identitatea vorbitorului — nu însă și cu cea a vorbitorilor din ultimul episod. Sarcina
voastră este să construiți un model care să îl ajute pe Petrică să regrupeze clipurile din ultimul
podcast după vorbitor, chiar și fără să știe cine e cine.
Două fișiere .npz, ambele conținând clipuri audio mono, eșantionate la 16000 Hz, de 3 secunde
(48000 de eșantioane) fiecare:
train_data.npz — setul cu podcasturile vechi, etichetate. Conține:
audio_id: id-ul fiecărui clip.audio: forma de undă a clipului (float32, lungime 48000).speaker_id: identitatea vorbitorului pentru clipul respectiv (20 de vorbitori distincți,30 de clipuri per vorbitor). Acești vorbitori nu apar în test_data.npz — setul se10 vorbitori din test.test_data.npz — clipurile din ultimul podcast, cel neetichetat. Conține:
audio_id: id-ul fiecărui clip.audio: forma de undă a clipului (float32, lungime 48000).Pentru fiecare din cele 300 de clipuri audio din test_data.npz trebuie să determinați o
etichetă de grup între 1 și 10, astfel încât două clipuri primesc aceeași etichetă dacă și
numai dacă (după părerea modelului) aparțin aceluiași vorbitor. Numerotarea grupelor — care id
corespunde cărui vorbitor real — nu contează, doar gruparea corectă a clipurilor în cele 10
grupe.
Metrică: Indicele Rand ajustat (ARI)
Fișierul de ieșire, answer.csv, trebuie să conțină două coloane:
| Coloană | Descriere |
|---|---|
id | audio_id-ul clipului din test_data.npz |
answer | eticheta grupei (număr întreg între 1 și 10) atribuită clipului respectiv |
Fișierul trebuie să conțină exact o linie pentru fiecare clip din test_data.npz (300 de
linii), în orice ordine.
Scorul se calculează pe baza indicelui Rand ajustat (ARI) dintre gruparea voastră și gruparea
reală. Cu cât mai mare, cu atât mai bine.
| Metrică | Scor |
|---|---|
| ARI < 0.41 | 5 puncte |
| 0.41 ≤ ARI < 0.90 | 100 * log(ARI / 0.41) / log(0.90 / 0.41) puncte |
| ARI ≥ 0.90 | 100 puncte (punctaj maxim) |
O submisie malformată (coloane lipsă, id-uri greșite sau lipsă, număr greșit de linii etc.)
primește 0 puncte.