Сложность
Ваш лучший результат
Н/Д
Ваша компания хочет защитить пользователей от нежелательных писем (спама).
Для этого было принято решение построить автоматическую систему, которая будет идентифицировать
спам-письма и отделять их от легитимных (неспам).
Вы получили набор размеченных писем и должны построить модель,
которая сможет классифицировать новые письма.
В ваше распоряжение предоставлены два файла:
label (spam = 1 / nonspam = 0)Основная цель: предсказание вероятности того, что письмо является спамом (значение между 0 и 1, где 0 = точно неспам, 1 = точно спам).
Каждая строка представляет письмо со следующими атрибутами:
sample_id - уникальный идентификаторtext - содержимое письмаlabel - только в train.csv, 1 (спам)/ 0 (неспам)Конечная цель: предсказать label для строк из test.csv.
Первые две подзадачи проверяют простой анализ писем.
Последняя подзадача оценивает модель классификации.
Определите длину каждого письма как количество символов.
Выведите для этой подзадачи целое число.
Подсчитайте, сколько вхождений слова free есть в письме.
Постройте модель классификации, которая предсказывает вероятность того, что письмо является спамом (p ∈ [0,1]) для каждой строки из test.
Оценка производится с использованием ROC кривой и AUC (Area Under the ROC Curve).
Подзадачи 1–2 оцениваются точно (путем сравнения).
Файл submission.csv должен содержать по 3 строки для каждой строки из test,
соответствующие 3 подзадачам.
Структура:
subtaskID, datapointID, answerгде:
sample_idfree (целое число)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Для Подзадачи 3 оценка производится с использованием ROC AUC (Area Under the ROC Curve).
Это единая мера, которая обобщает производительность классификатора для всех возможных порогов принятия решений.

