Obtiažnosť
Vaše najlepšie skóre
N/A
Boli ste prijatí ako dátoví vedci do malého „laboratória ekonomických predpovedí". Vašou úlohou je zistiť, kto prekonáva hranicu 50 000 USD ročne a kto nie, s použitím reálnych údajov o vzdelaní, práci a každodennom živote. Máte k dispozícii dva súbory so socioekonomickými údajmi, ktoré sú popísané nižšie:
| Stĺpec | Popis |
|---|---|
| sampleid | Jedinečný identifikátor pre každé pozorovanie |
| age | Vek osoby |
| workclass | Typ zamestnávateľa (napr.: Private, Self-emp-not-inc atď.) |
| fnlwgt | Konečná váha zo sčítania ľudu (final weight) |
| education | Úroveň vzdelania (napr.: Bachelors, Masters atď.) |
| educational_num | Číselné vyjadrenie úrovne vzdelania |
| marital_status | Rodinný stav |
| occupation | Povolanie |
| relationship | Vzťah v domácnosti |
| race | Rasa |
| gender | Pohlavie |
| capital_gain | Kapitálové zisky |
| capital_loss | Kapitálové straty |
| hours_per_week | Odpracované hodiny za týždeň |
| native_country | Krajina pôvodu |
| profile_description | Textový popis profesijného profilu |
| income | Ročný príjem (<=50K / >50K) – cieľový stĺpec |
Poznámka:
Stĺpec income je k dispozícii iba v trénovacích údajoch (train.csv).
Analyzujte trénovacie údaje (train.csv) a určte:
Ktorá krajina pôvodu (native_country), iná ako United-States, má najvyšší počet osôb s príjmom >50K?
Výsledkom musí byť reťazec s presným názvom krajiny tak, ako sa objavuje v údajoch.
Analyzujte trénovacie údaje (train.csv) a určte:
Ktoré povolanie (occupation) má najvyššiu mieru príjmu >50K?
Miera príjmu >50K pre povolanie sa vypočíta ako: počet osôb s príjmom >50K v danom povolaní vydelený celkovým počtom osôb v danom povolaní.
Výsledkom musí byť reťazec s presným názvom povolania tak, ako sa objavuje v údajoch.
Zostavte klasifikačný model schopný predpovedať hodnotu stĺpca income pre všetky pozorovania v test.csv.
Model musí produkovať jednu z dvoch tried:
<=50K>50KStĺpec profile_description obsahuje textové popisy profesijných profilov. Aplikujte metódu clusteringu na tento stĺpec, aby ste zoskupili pozorovania z test.csv do klastrov.
Vráťte pre každé pozorovanie z test.csv štítok klastra (celočíselná hodnota).
Subtask 1: Presná zhoda so správnou odpoveďou.
Subtask 2: Presná zhoda so správnou odpoveďou.
Subtask 3: Hodnotenie sa vykonáva pomocou F1 Macro:
f1_macro ≥ 0.80 → 55 bodovf1_macro < 0.60 → 0 bodovSubtask 4: Hodnotenie sa vykonáva pomocou Adjusted Rand Index (ARI):
ARI ≥ 0.90 → 20 bodovARI ≤ 0.00 → 0 bodovOdovzdávaný súbor musí byť vo formáte CSV s nasledujúcimi stĺpcami:
subtaskID – index podúlohydatapointID – jedinečný identifikátor z dátovej sadyanswer – odpoveď alebo predikciaPríklad:
subtaskID,datapointID,answer1,1,India2,2,Sales3,10001,<=50K3,10002,>50K4,10001,04,10002,2Poznámka:
datapointID postupne 1, respektíve 2.datapointID hodnota sampleid z test.csv.Adult / Census Income Dataset – UCI Machine Learning Repository