الصعوبة
أفضل نتيجة لك
غير متوفر
تم توظيفك كعالم بيانات في "مختبر التنبؤات الاقتصادية" الصغير. مهمتك هي اكتشاف من يتجاوز حاجز الـ 50,000 دولار سنوياً ومن لا يتجاوزه، باستخدام بيانات حقيقية حول التعليم والعمل والحياة اليومية. لديك ملفان يحتويان على بيانات اجتماعية واقتصادية، موصوفة أدناه:
| العمود | الوصف |
|---|---|
| sampleid | معرف فريد لكل ملاحظة |
| age | عمر الشخص |
| workclass | نوع صاحب العمل (مثال: Private, Self-emp-not-inc إلخ) |
| fnlwgt | الوزن النهائي من التعداد السكاني (final weight) |
| education | المستوى التعليمي (مثال: Bachelors, Masters إلخ) |
| educational_num | تمثيل رقمي للمستوى التعليمي |
| marital_status | الحالة الاجتماعية |
| occupation | المهنة |
| relationship | العلاقة في الأسرة |
| race | العرق |
| gender | الجنس |
| capital_gain | الأرباح الرأسمالية |
| capital_loss | الخسائر الرأسمالية |
| hours_per_week | عدد ساعات العمل في الأسبوع |
| native_country | بلد المنشأ |
| profile_description | وصف نصي للملف المهني |
| income | الدخل السنوي (<=50K / >50K) – العمود المستهدف |
ملاحظة:
العمود income متاح فقط في بيانات التدريب (train.csv).
قم بتحليل بيانات التدريب (train.csv) وحدد:
ما هو بلد المنشأ (native_country) بخلاف United-States الذي يضم أكبر عدد من الأشخاص الذين لديهم دخل >50K؟
يجب أن تكون النتيجة عبارة عن نص (string) باسم البلد تماماً كما يظهر في البيانات.
قم بتحليل بيانات التدريب (train.csv) وحدد:
ما هي المهنة (occupation) التي لديها أعلى معدل دخل >50K؟
يتم حساب معدل الدخل >50K لمهنة ما كالتالي: عدد الأشخاص الذين لديهم دخل >50K في تلك المهنة مقسوماً على العدد الإجمالي للأشخاص في تلك المهنة.
يجب أن تكون النتيجة عبارة عن نص (string) باسم المهنة تماماً كما يظهر في البيانات.
قم ببناء نموذج تصنيف قادر على التنبؤ بقيمة العمود income لجميع الملاحظات في test.csv.
يجب أن ينتج النموذج إحدى الفئتين:
<=50K>50Kيحتوي العمود profile_description على أوصاف نصية للملفات المهنية. قم بتطبيق طريقة تجميع (clustering) على هذا العمود لتجميع الملاحظات في test.csv إلى مجموعات (clusters).
أعد لكل ملاحظة في test.csv تسمية المجموعة (قيمة عددية صحيحة).
المهمة الفرعية 1: مطابقة تامة للإجابة الصحيحة.
المهمة الفرعية 2: مطابقة تامة للإجابة الصحيحة.
المهمة الفرعية 3: يتم التقييم باستخدام F1 Macro:
f1_macro ≥ 0.80 ← 55 نقطةf1_macro < 0.60 ← 0 نقطةالمهمة الفرعية 4: يتم التقييم باستخدام Adjusted Rand Index (ARI):
ARI ≥ 0.90 ← 20 نقطةARI ≤ 0.00 ← 0 نقطةيجب أن يكون ملف الإرسال بصيغة CSV، مع الأعمدة التالية:
subtaskID – معرف المهمة الفرعيةdatapointID – معرف فريد من مجموعة البياناتanswer – الإجابة أو التنبؤمثال:
subtaskID,datapointID,answer1,1,India2,2,Sales3,10001,<=50K3,10002,>50K4,10001,04,10002,2ملاحظة:
datapointID هو 1 و 2 على التوالي.datapointID هو قيمة sampleid من test.csv.Adult / Census Income Dataset – UCI Machine Learning Repository