Машинное обучение

139 задачвместе с подтемами
Число у задачи — рейтинг сложности, слово рядом — насколько она трудна по сравнению с другими задачами такого же типа. Шкалы задач с ответом и задач с кодом между собой не сравниваются. Рядом — счётчики попыток: успешные, неуспешные.

Напиши программу для анализа качества классификации.

Входные данные:

Первая строка: n — количество примеров

Вторая строка: n чисел — реальные классы (0 или 1)

Третья строка: n чисел — предсказанные классы (0 или 1)

 

Выходные данные:

Выведи через пробел (округли до 2 знаков):

1. Accuracy

2. Precision

3. Recall

4. F1-score

 

Примечания:

- Если Precision или Recall считать невозможно (деление на 0), выведи 0.00

- Формат вывода: 0.87 0.92 0.85 0.88 (4 числа через пробел)

По заданным параметрам: коэффициенту модели (w), свободному члену (b), температуре(t) и порогу принятия решения (p) определите и выведите на экран значения z, p, класс (1-болен/0-здоров/? - граница)

Формат входных данных
4 вещественных числа, каждое в отдельной строке:
w - коэффициент модели 
b - свободный член
t - температура пациента 
p - порог принятия решения

Формат выходных данных
Выведите три числа через пробел: z (вещественное число с точностью до сотых), p (вещественное число от 0 до 1 с точностью до сотых), класс (1-болен/0-здоров/? - граница)
Когда log-loss будет БОЛЬШИМ (модель ошиблась сильно)?
  1.  Предсказали p=0.9, реальный класс y=1
  2.  Предсказали p=0.5, реальный класс y=0
  3.  Предсказали p=0.1, реальный класс y=0
  4.  Предсказали p=0.1, реальный класс y=1
Почему линейная регрессия не подходит для классификации?
  1.  Она слишком сложная
  2.  Она может выдавать значения вне диапазона [0, 1]
  3.  Она не может работать с числами
  4.  Она всегда ошибается
Если для задачи модерации комментариев важнее НЕ удалять нормальные комментарии (меньше ложных тревог), какую модель ты выберешь и почему?
  1. Модель 1 — у неё выше F1
  2. Модель 2 — у неё выше Precision
  3. Обе подходят одинаково
  4. Ни одна не подходит

У тебя есть две модели для детекции мошеннических транзакций:

Модель A:

  • Accuracy: 95%
  • Из 1000 мошеннических транзакций нашла 900
  • Из 99,000 нормальных транзакций правильно определила 94,100

Модель B:

  • Accuracy: 98%
  • Из 1000 мошеннических транзакций нашла 100
  • Из 99,000 нормальных транзакций правильно определила 97,900

Вопрос: Какую модель лучше использовать для банка и почему?

Тип: Выбор одного ответа с пояснением

  1. Модель A — у неё ниже Accuracy, но она находит больше мошенников
  2. Модель B — у неё выше Accuracy, значит она лучше
  3. Обе модели одинаково хороши
  4. Нельзя определить без дополнительных данных

Линейная регрессия предсказала для трёх объектов следующие значения:

  • Объект A: y = −0.5

  • Объект Б: y = 0.8

  • Объект В: y = 1.4

Какая проблема возникает при использовании этих предсказаний как вероятностей (выберите только один верный вариант)?

  1. Все предсказания правильные, проблем нет
  2. Объект A имеет отрицательную вероятность 
  3. Объект В имеет вероятность больше 1 
  4. И объект A, и объект В имеют невозможные вероятности
Создайте модель, которая предсказывает оценку на экзамене в зависимости от потраченных часов на подготовку.

Формат входных данных
В первой строке записано натуральное число n (n <= 1000). Вторая и третья строки содержат соответственно время подготовки (в часах) и количество баллов набранных на экзамене i-м студентом (1<=i<=n). Все числа положительные целые. В первой строке числа не превышают 10, во второй строке - не превышают 100.

Выполните следующие задания
1. Создайте DataFrame из входных данных
2. Обучите модель LinearRegression
3. Предскажите оценку для студента, который готовился 5.5 часов
4. Во второй строке выведите через пробел два числа: коэффиценты k и b линии регрессии
6. В третьей строке выведите время подготовки, необходимое для получения чтобы получить 75 баллов 

Все числа необходимо вывести с точностью до одного знака после запятой

АЛГОРИТМ РАСЧЕТА R²

Шаг 1: Вычисляем среднее значение Y

y_mean = (y₁ + y₂ + ... + yₙ) / n

Шаг 2: Считаем общую сумму квадратов (TSS) Total Sum of Squares — насколько данные разбросаны вокруг среднего

TSS = Σ(y_i - y_mean)²

Шаг 3: Считаем сумму квадратов ошибок (RSS) Residual Sum of Squares — насколько наши предсказания ошибаются

RSS = Σ(y_i - y_pred_i)²

Шаг 4: Вычисляем R²

R² = 1 - (RSS / TSS)
 


Задача

Напишите программу, которая оценивает качество модели предсказания оценок студентов.

Формат входных данных
Программа получает на вход две строки: в первой строке через пробел записаны целые числа - реальные оценки студентов, во второй строке записаны вещественные числа - оценки, полученные в результате предсказания с использованием модели. Количество чисел в первой и второй строке равно 10.

Формат выходных данных
Выведите одно число - коэффициент R2 с точностью до 2-х знаков после запятой
 

Метеорологическая служба использует исторические данные о температуре, влажности, давлении за последние 10 лет, чтобы предсказать температуру на завтра.

К какому типу задач машинного обучения это относится?

  1. Классификация
  2. Кластеризация
  3. Регрессия

Интернет-магазин анализирует поведение покупателей и автоматически делит их на группы: «экономные», «люксовые покупатели», «импульсные покупатели» и т.д.

Какой тип машинного обучения здесь применяется?

  1. Классификация
  2. Кластеризация
  3. Регрессия

Что отличает задачу классификации от задачи регрессии?

Варианты ответа:
1) Классификация предсказывает непрерывные значения, а регрессия — категориальные.
2) Классификация и регрессия обе предсказывают только непрерывные значения.
3) Классификация предсказывает категориальные метки, а регрессия — непрерывные значения.
4) Классификация и регрессия обе предсказывают только категориальные метки.

19#50313
Каково назначение метода describe() в Pandas?
  1. Для описания типов данных в столбцах
  2. Для отображения сводной статистики фрейма данных
  3. Для предоставления информации о пропущенных значениях
  4. Для описания структуры фрейма данных
Поделиться
Класснуть