Тежина
Твој најбољи резултат
Н/Д
Regrutovani ste kao data scientist u malu „laboratoriju za ekonomska predviđanja". Vaš zadatak je da otkrijete ko probija barijeru od 50.000 USD godišnje, a ko ne, koristeći stvarne podatke o obrazovanju, radu i svakodnevnom životu. Na raspolaganju imate dva fajla sa socio-ekonomskim podacima, opisanim u nastavku:
| Kolona | Opis |
|---|---|
| sampleid | Jedinstveni identifikator za svako zapažanje |
| age | Starost osobe |
| workclass | Tip poslodavca (npr: Private, Self-emp-not-inc itd.) |
| fnlwgt | Konačna težina iz popisa (final weight) |
| education | Nivo obrazovanja (npr: Bachelors, Masters itd.) |
| educational_num | Numerički prikaz nivoa obrazovanja |
| marital_status | Bračni status |
| occupation | Zanimanje |
| relationship | Odnos u domaćinstvu |
| race | Rasa |
| gender | Pol |
| capital_gain | Kapitalni dobici |
| capital_loss | Kapitalni gubici |
| hours_per_week | Broj radnih sati nedeljno |
| native_country | Zemlja porekla |
| profile_description | Tekstualni opis profesionalnog profila |
| income | Godišnji prihod (<=50K / >50K) – ciljna kolona |
Napomena:
Kolona income je dostupna samo u podacima za obuku (train.csv).
Analizirajte podatke za obuku (train.csv) i odredite:
Koja je zemlja porekla (native_country), osim United-States, sa najvećim brojem osoba koje imaju prihod >50K?
Rezultat mora biti string sa tačnim nazivom zemlje, onako kako se pojavljuje u podacima.
Analizirajte podatke za obuku (train.csv) i odredite:
Koje zanimanje (occupation) ima najveću stopu prihoda >50K?
Stopa prihoda >50K za određeno zanimanje izračunava se kao: broj osoba sa prihodom >50K u tom zanimanju, podeljen sa ukupnim brojem osoba u tom zanimanju.
Rezultat mora biti string sa tačnim nazivom zanimanja, onako kako se pojavljuje u podacima.
Izgradite model klasifikacije sposoban da predvidi vrednost kolone income za sva zapažanja u test.csv.
Model mora da proizvede jednu od dve klase:
<=50K>50KKolona profile_description sadrži tekstualne opise profesionalnih profila. Primenite metodu klasterovanja (clustering) na ovu kolonu kako biste grupisali zapažanja iz test.csv u klastere.
Za svako zapažanje iz test.csv vratite oznaku klastera (celobrojna numerička vrednost).
Podzadatak 1: Tačno podudaranje sa tačnim odgovorom.
Podzadatak 2: Tačno podudaranje sa tačnim odgovorom.
Podzadatak 3: Evaluacija se vrši pomoću F1 Macro:
f1_macro ≥ 0.80 → 55 poenaf1_macro < 0.60 → 0 poenaPodzadatak 4: Evaluacija se vrši pomoću Adjusted Rand Index (ARI):
ARI ≥ 0.90 → 20 poenaARI ≤ 0.00 → 0 poenaFajl za slanje mora biti u CSV formatu, sa sledećim kolonama:
subtaskID – indeks podzadatkadatapointID – jedinstveni identifikator iz seta podatakaanswer – odgovor ili predikcijaPrimer:
subtaskID,datapointID,answer1,1,India2,2,Sales3,10001,<=50K3,10002,>50K4,10001,04,10002,2Napomena:
datapointID mora biti 1, odnosno 2.datapointID mora biti vrednost sampleid iz test.csv.Adult / Census Income Dataset – UCI Machine Learning Repository