الصعوبة
أفضل نتيجة لك
غير متوفر
يمكن استخدام نماذج اللغة المدربة مسبقاً بشكل صريح (مثل: BERT، RoBERTa، sentence-transformers) مع الأوزان المحملة. تسريع GPU للتدريب والاستنتاج مسموح به تماماً. كما أن مسارات معالجة اللغات الطبيعية (NLP) الكلاسيكية القائمة على TF-IDF مسموح بها وموصى بها أيضاً.
في مكان ما في سهول نيو مكسيكو الجافة، عام 1883.
كان لدى الشريف العجوز كليم دادلي عادة لم يفهمها أي من نوابه قط: في كل مساء، مهما كان اليوم طويلاً، كان يضع قبعته على سرج حصانه، ويتمدد على بطانيته وينظر مباشرة إلى الأعلى، نحو السماء.
كان يقول دائماً: "النجوم لا تكذب. أي هارب، أي متشرد، أي رجل شريف — الجميع ينظرون إلى نفس السماء."
في ليلة من ليالي أغسطس، وهو منهك بعد ثلاثة أيام من مطاردة عصابة فيغا عبر الصحراء، استلقى كليم تحت سماء سوداء كالحبر، مرصعة بنجوم أكثر مما عده في حياته. حاول النوم عندما بدأت النجوم في التحرك — ببطء في البداية، مثل الجمر الذي تحمله الرياح من نار تحتضر. ثم أسرع فأسرع. كانت ترسم خطوطاً بينها. مثلثات. لولبيات. حيوانات. أرقام. أشكال لم يكن يعرف أسماءها.
تمتم قائلاً: "لا بد أنها الحرارة". لكنه استمر في المراقبة.
تحولت الأشكال إلى كلمات. لم تكن منطوقة — بل محسوسة. بدت كل كوكبة وكأنها تحمل معنى، ثقلاً، قصة معلقة بها مثل ملصق "مطلوب" على لوحة الشريف. مد يده ليمسك بقلمه ليدونها، وعندها — لا شيء.
استيقظ في مكان آخر.
أرض ما بين النجوم. هكذا كانوا يسمونها.
كانت إقليماً شاسعاً وصامتاً حيث كانت السماء هي الأرض، وكانت الكوكبات هي القرى — كل منها مجموعة من النجوم مرتبة في شكل معين، وكل شكل يحمل اسماً ينتظر أن يطابق قصته. كان سكان هذه الأرض، "كتبة النجوم"، يحتفظون بسجلات دقيقة لقرون: مذكرات، قصائد، يوميات سفر، أساطير — كلها كتبها بشر نظروا إلى نفس أشكال النجوم من الأسفل، من الأرض.
لكن شيئاً ما سار بشكل خاطئ. عاصفة سماوية كبرى — يطلق عليها السكان المحليون اسم الشتات — انتزعت كل ملصق من كل كوكبة وألقت بها في مهب الريح. الآن تطفو آلاف النصوص غير المقيدة فوق أشكال النجوم التي وصفتها ذات يوم، ولم يعد بإمكان كتبة النجوم معرفة أي قصة تنتمي لأي سماء.
سُلّم كليم شارة مصنوعة من ضوء النجوم وتعليمات بسيطة:
"أعد مطابقة الكلمات بالنجوم يا شريف. قبل أن تأتي العاصفة التالية."
يتم تزويدك بمجموعة من كوكبات النجوم، كل منها موصوف بتسلسل من النقاط ثنائية الأبعاد التي تشكل شكلاً هندسياً (مثل: صليب، لولب، شكل بخمس زوايا، أرقام مثل 6، 7، 8، مجموعات من الأرقام، إلخ). كما يتم تزويدك بمجموعة كبيرة من مقتطفات النصوص المرشحة — مذكرات، أساطير، أوصاف — كل منها كُتب في الأصل عن كوكبة محددة واحدة.
هدفك هو بناء نموذج قادر على تخصيص الكوكبة الصحيحة لكل نص من المجموعة بشكل صحيح، بناءً حصرياً على العلاقة الدلالية والهيكلية بين هندسة الإحداثيات ومحتوى النص.
يحتوي train.csv على 300 زوج من (كوكبة-نص) مع التصنيفات:
| العمود | الوصف |
|---|---|
id | معرف الكوكبة (0-299) |
coords | متجه إحداثيات بـ 728 بعداً، مفصولة بخطوط عمودية: \|x1\|x2\|...\|x728\| |
text | المقتطف الأدبي المقابل |
يحتوي test.csv على 50 تسلسلاً من الكوكبات بدون تصنيفات (datapointID 1-50):
| العمود | الوصف |
|---|---|
datapointID | عدد صحيح من 1 إلى 50 |
coords | نفس تنسيق الأنابيب (pipe) كما في التدريب |
يظهر كل datapointID من 40-65 مرة. لا يتم توفير نصوص مقابلة.
يحتوي candidates.csv على 500 مقتطف نصي:
| العمود | الوصف |
|---|---|
text_id | عدد صحيح 0-499 |
text | مقتطف أدبي (مذكرات، قصيدة، أسطورة) |
يجب أن يكون ملف التسليم بتنسيق CSV مع الأعمدة التالية:
| الحقل | الوصف |
|---|---|
subtaskID | يجب أن يكون 1 لجميع الصفوف |
datapointID | عدد صحيح 1-50، معرف كوكبة الاختبار |
answer | الـ text_id المتوقع (عدد صحيح 0-499) |
يجب أن يظهر كل من الـ 50 datapointID الخاصة بالاختبار مرة واحدة فقط.
مثال:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...يتم تقييم كل توقع كـ classification وحيد التسمية (single-label) عبر 500 معرف نص مرشح. التوقع إما صحيح (1) أو غير صحيح (0).
المعيار النهائي هو عدد التوقعات الصحيحة / 50.
يتم تحويل الدرجات الخام إلى نقاط مسابقة باستخدام دالة خطية مع حد أدنى:
| الدقة (Accuracy) | النقاط |
|---|---|
| < 0.30 | 0 نقطة |
| >= 0.85 | 100 نقطة |
| ما بينهما (0.30 - 0.85) | قياس خطي بين 0 و 100 |
باختصار: يجب عليك مطابقة ما لا يقل عن 15 من أصل 50 كوكبة بشكل صحيح (دقة = 0.30) للحصول على أي نقاط، والمطابقة الصحيحة لـ 43 أو أكثر (دقة >= 0.85) تمنحك الدرجة الكاملة.
"النجوم لا تكذب. يمكنك أن تثق بنجمة أكثر مما تثق بإنسان..." — الشريف كليم دادلي، 1883