Сложность
Ваш лучший результат
Н/Д
В параллельном мире социальных сетей Chirper является самой популярной платформой микросообщений.
Недавно платформа была куплена знаменитым (и слегка эксцентричным) Melon Husk, который решил ребрендить её под названием Y.
Чтобы сделать Y более чистой и дружелюбной, Melon Husk просит вашу команду data science построить модель классификации, которая автоматически обнаруживает проблематичные chirp-ы (спам, нерелевантный контент или шум), чтобы их можно было отфильтровать из ленты.
Вы получили набор исторических chirp-ов и должны построить модель,
которая сможет классифицировать новые chirp-ы.
В ваше распоряжение предоставлены два файла:
label (problematic = 1 / normal = 0)Основная цель: предсказание вероятности того, что chirp является проблематичным
(значение между 0 и 1, где 0 = точно нормальный chirp, 1 = точно проблематичный chirp).
Каждая строка представляет chirp, опубликованный на Chirper Y, со следующими атрибутами:
id – уникальный идентификатор chirp-аchirp – текст chirp-аlabel – только в train.csv, 1 (проблематичный) / 0 (нормальный)Конечная цель: предсказать label для строк из test.csv.
Первые два подзадания проверяют простой анализ chirp-ов.
Последнее подзадание оценивает производительность модели классификации.
Определите длину каждого chirp-а как количество символов.
Выведите для этого подзадания целое число.
Подсчитайте, сколько вхождений символа # есть в chirp-е
(важный индикатор чрезмерных хештегов, любимых спамерами 😄).
Постройте модель классификации, которая предсказывает вероятность того, что chirp
является проблематичным (p ∈ [0,1]) для каждой строки из test.
Оценка производится с использованием ROC кривой и AUC (Area Under the ROC Curve).
Подзадания 1–2 оцениваются точно (путем сравнения).
Файл submission.csv должен содержать 3 строки для каждой строки из test,
соответствующие 3 подзаданиям.
Структура:
subtaskID,datapointID,answerгде:
где:
id# (целое число)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083Для Подзадания 3 оценка производится с использованием ROC AUC (Area Under the ROC Curve).
Это единая мера, которая обобщает производительность классификатора
для всех возможных порогов принятия решений.
Строится ROC кривая, которая представляет:
Площадь под кривой (AUC) вычисляется с использованием правила трапеций:
Интерпретация оценки: