Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Jūs esat pieņemts darbā par datu zinātnieku nelielā "ekonomisko prognožu laboratorijā". Jūsu uzdevums ir noskaidrot, kurš pārsniedz 50 000 USD gadā slieksni un kurš nē, izmantojot reālus datus par izglītību, darbu un ikdienas dzīvi. Jūsu rīcībā ir divi faili ar sociālekonomiskajiem datiem, kas aprakstīti zemāk:
| Kolonna | Apraksts |
|---|---|
| sampleid | Unikāls identifikators katram novērojumam |
| age | Personas vecums |
| workclass | Darba devēja veids (piem.: Private, Self-emp-not-inc utt.) |
| fnlwgt | Galīgais tautas skaitīšanas svars (final weight) |
| education | Izglītības līmenis (piem.: Bachelors, Masters utt.) |
| educational_num | Izglītības līmeņa skaitliskais attēlojums |
| marital_status | Ģimenes stāvoklis |
| occupation | Nodarbošanās |
| relationship | Attiecības mājsaimniecībā |
| race | Rase |
| gender | Dzimums |
| capital_gain | Kapitāla pieaugums |
| capital_loss | Kapitāla zaudējumi |
| hours_per_week | Nostrādātās stundas nedēļā |
| native_country | Izcelsmes valsts |
| profile_description | Profesionālā profila teksta apraksts |
| income | Gada ienākumi (<=50K / >50K) – mērķa kolonna |
Piezīme:
Kolonna income ir pieejama tikai apmācības datos (train.csv).
Analizējiet apmācības datus (train.csv) un nosakiet:
Kura ir izcelsmes valsts (native_country), kas nav United-States, ar vislielāko personu skaitu, kuru ienākumi ir >50K?
Rezultātam jābūt virknei (string) ar precīzu valsts nosaukumu, kāds tas parādās datos.
Analizējiet apmācības datus (train.csv) un nosakiet:
Kura ir nodarbošanās (occupation) ar visaugstāko >50K ienākumu līmeni?
Ienākumu līmenis >50K nodarbošanai tiek aprēķināts kā: personu skaits ar ienākumiem >50K šajā nodarbošanā, dalīts ar kopējo personu skaitu šajā nodarbošanā.
Rezultātam jābūt virknei (string) ar precīzu nodarbošanās nosaukumu, kāds tas parādās datos.
Izveidojiet klasifikācijas modeli, kas spēj prognozēt kolonnas income vērtību visiem novērojumiem failā test.csv.
Modelim jāparedz viena no divām klasēm:
<=50K>50KKolonna profile_description satur profesionālo profilu teksta aprakstus. Lietojiet klasterizācijas (clustering) metodi šai kolonnai, lai grupētu test.csv novērojumus klasteros.
Atgrieziet katram test.csv novērojumam klastera etiķeti (vesela skaitļa vērtība).
1. apakšuzdevums: Precīza sakritība ar pareizo atbildi.
2. apakšuzdevums: Precīza sakritība ar pareizo atbildi.
3. apakšuzdevums: Novērtēšana tiek veikta, izmantojot F1 Macro:
f1_macro ≥ 0.80 → 55 punktif1_macro < 0.60 → 0 punkti4. apakšuzdevums: Novērtēšana tiek veikta, izmantojot Adjusted Rand Index (ARI):
ARI ≥ 0.90 → 20 punktiARI ≤ 0.00 → 0 punktiIesniegšanas failam jābūt CSV formātā ar šādām kolonnām:
subtaskID – apakšuzdevuma indekssdatapointID – unikāls identifikators no datu kopasanswer – atbilde vai prognozePiemērs:
subtaskID,datapointID,answer1,1,India2,2,Sales3,10001,<=50K3,10002,>50K4,10001,04,10002,2Piezīme:
datapointID jābūt attiecīgi 1 un 2.datapointID jābūt sampleid vērtībai no test.csv.Adult / Census Income Dataset – UCI Machine Learning Repository