Искусственный интеллект

119 задачвместе с подтемами
Число у задачи — рейтинг сложности, слово рядом — насколько она трудна по сравнению с другими задачами такого же типа. Шкалы задач с ответом и задач с кодом между собой не сравниваются. Рядом — счётчики попыток: успешные, неуспешные.

IT-компания отбирает резюме. Файл resume.txt содержит данные о 5500 кандидатах. В каждой строке три целых числа через пробел: стаж_лет знание_английского балл_за_алгоритмы (английский: 1 — есть, 0 — нет; балл — от 0 до 100).

Кандидат проходит на собеседование, если выполнено условие:

(стаж не меньше 3 лет ИЛИ балл за алгоритмы не меньше 80) И есть знание английского.

Определите количество кандидатов, прошедших отбор. В ответе запишите одно целое число.

Метеостанция классифицирует дни по среднесуточной температуре. Файл days.txt содержит 8000 строк, в каждой — одно вещественное число: температура.

Классы:

  • класс 1 «мороз»: температура меньше −10;
  • класс 2 «холодно»: от −10 (включительно) до 5 (не включая);
  • класс 3 «прохладно»: от 5 (включительно) до 20 (не включая);
  • класс 4 «тепло»: 20 и выше.

Определите номер класса, к которому относится наибольшее количество дней. Гарантируется, что такой класс единственный. В ответе запишите одно целое число — номер класса.

Почтовый сервис фильтрует письма. Файл mail.txt содержит данные о 7000 письмах. В каждой строке три целых числа через пробел: число_ссылок процент_заглавных_букв отправитель_в_белом_списке (последнее поле: 1 — да, 0 — нет).

Правила применяются по порядку, срабатывает первое подходящее:

  1. если отправитель в белом списке — письмо «не спам»;
  2. если число ссылок не меньше 10 — «спам»;
  3. если процент заглавных букв больше 60 — «спам»;
  4. иначе — «не спам».

Определите количество писем, помеченных как «спам». В ответе запишите одно целое число.

Медцентр анализирует данные пациентов. Файл patients.txt содержит 4500 строк. В каждой строке два числа через пробел: рост_м вес_кг (оба вещественные).

Индекс массы тела вычисляется по формуле \( ИМТ = \dfrac{вес}{рост^2} \).

Пациент относится к категории «норма», если \( 18{,}5 \le ИМТ < 25 \).

Определите количество пациентов категории «норма». В ответе запишите одно целое число.

Служба такси классифицирует поездки. Файл taxi.txt содержит данные о 6000 поездках. В каждой строке два числа через пробел: расстояние_км час_начала (расстояние — вещественное, час — целое от 0 до 23).

Тариф определяется первым сработавшим правилом (правила проверяются по порядку):

  1. если расстояние больше 30 км — тариф «межгород» (класс 3);
  2. иначе, если час начала меньше 6 или не меньше 23 — тариф «ночной» (класс 2);
  3. иначе — тариф «городской» (класс 1).

Определите количество поездок по тарифу «ночной». В ответе запишите одно целое число.

Интернет-магазин формирует витрину. Файл goods.txt содержит данные о 5000 товарах. В каждой строке три целых числа через пробел: цена_руб остаток_на_складе снят_с_производства (последнее поле: 1 — снят, 0 — выпускается).

Товар попадает на витрину, если его цена не превышает 5000 руб, остаток на складе больше нуля и товар не снят с производства.

Определите, сколько товаров попадёт на витрину. В ответе запишите одно целое число.

Тренер отбирает легкоатлетов в сборную. Файл athletes.txt содержит результаты 2800 спортсменов. В каждой строке два числа через пробел: время_на_100м_сек прыжок_в_длину_см (время — вещественное, прыжок — целое).

В сборную попадает спортсмен, у которого время на 100 м находится в диапазоне от 11.0 до 12.5 секунды включительно, а прыжок в длину строго больше 650 см.

Определите количество отобранных спортсменов. В ответе запишите одно целое число.

Магазин предоставляет скидку постоянным покупателям. Файл buyers.txt содержит данные о 4200 покупателях. В каждой строке два целых числа через пробел: сумма_покупок_руб число_визитов.

Покупатель получает скидку, если сумма его покупок больше 10000 руб или число визитов не меньше 30.

Определите, сколько покупателей получат скидку. В ответе запишите одно целое число.

Банк рассматривает заявки на кредит. Файл clients.txt содержит данные о 3500 клиентах. В каждой строке три целых числа через пробел: возраст доход_тыс_руб кредитный_рейтинг (рейтинг — от 0 до 10).

Правило одобрения: доход не меньше 50 и кредитный рейтинг не меньше 5 и возраст не меньше 21 года.

Определите, сколько клиентов получат одобрение. В ответе запишите одно целое число.

Файл students.txt содержит данные о 2400 учениках. В каждой строке два целых числа через пробел: балл_за_тест посещаемость_процент.

Ученик считается успешным, если его балл за тест не меньше 60 и посещаемость не меньше 75%.

Определите количество успешных учеников. В ответе запишите одно целое число.

Инженеры сравнивают две модели предсказания нагрузки на сервер:

  • Модель 1: \( y = 2x + 30 \)
  • Модель 2: \( y = 2x + 45 \)

Файл load.txt содержит 5500 строк с реальными данными: число_запросов нагрузка.

Сравните модели по двум метрикам:

  • MAE — средняя абсолютная ошибка;
  • максимальная абсолютная ошибка.

В ответе запишите два числа через пробел: номер модели, лучшей по MAE, и номер модели, лучшей по максимальной ошибке.

Разные метрики могут указывать на разные модели — это нормально.

Система распознавания дорожных знаков классифицирует знаки на три класса: 0 — запрещающие, 1 — предупреждающие, 2 — информационные.

Файл signs.txt содержит 9000 строк: прогноз_системы реальный_класс.

Для каждого класса вычислите точность по классу — долю объектов этого реального класса, которые система распознала верно.

Найдите класс с наименьшей точностью.

В ответе запишите два числа через пробел: номер худшего класса и его точность в процентах, округлённую до целого числа.

Файл signal.txt содержит 7000 строк: входной_сигнал выходной_сигнал.

Первые 5000 строк — обучающая выборка, последние 2000 — контрольная.

Постройте линейную регрессию только по обучающей выборке.

Вычислите RSS этой модели отдельно:

  • на обучающей выборке (строки 1–5000);
  • на контрольной выборке (строки 5001–7000).

В ответе запишите два числа через пробел: RSS на обучении и RSS на контроле, каждое округлено до целого числа.

Банк использует правило выявления мошеннических операций:

  • «мошенничество», если сумма > 50000 и час операции < 6 (ночная операция);
  • «норма» в остальных случаях.

Файл fraud.txt содержит 6000 строк: сумма час метка, где метка — 1 (реальное мошенничество) или 0 (легальная операция).

Определите:

  • количество ложных срабатываний (false positive) — правило пометило операцию как мошенничество, но она легальная;
  • количество пропусков (false negative) — правило пометило операцию как норму, но это мошенничество.

В ответе два числа через пробел.

Два аналитика предложили модели для предсказания стоимости доставки по расстоянию:

  • Модель 1: \( y = 1{,}4x + 50 \)
  • Модель 2: \( y = 1{,}6x + 30 \)

Файл delivery.txt содержит 5000 строк с реальными данными: расстояние_км стоимость_руб.

Для каждой модели вычислите MAE (среднюю абсолютную ошибку). Лучшая модель — та, у которой MAE меньше.

В ответе запишите два числа через пробел: номер лучшей модели (1 или 2) и её MAE, умноженную на 10 и округлённую до целого числа.

Исследователь изучает связь между временем самостоятельных занятий и результатом теста. Файл study.txt содержит 3200 строк: часы_занятий балл_теста.

Постройте линейную регрессию и вычислите коэффициент детерминации:

\( R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2} \),

где \( \hat{y}_i \) — предсказание модели, \( \bar{y} \) — среднее значение баллов.

В ответе укажите \( R^2 \), умноженный на 1000 и округлённый до целого числа.

Например, если \( R^2 = 0.857 \), ответ: 857.

Компания анализирует оплату внештатных сотрудников. Файл salary.txt содержит 2800 строк: отработанные_часы выплата_руб.

Постройте линейную регрессию \( \text{Выплата} = a \cdot \text{Часы} + b \).

Выплата считается сильно отклоняющейся, если её относительная ошибка превышает 10%:

\( \frac{|y_i - \hat{y}_i|}{|\hat{y}_i|} > 0{,}1 \), где \( \hat{y}_i \) — предсказание модели.

Определите количество сильно отклоняющихся выплат.

Автодилер собрал данные о 3500 проданных автомобилях одной модели. Файл cars.txt содержит строки: пробег_тыс_км цена_тыс_руб.

Постройте линейную регрессию \( \text{Цена} = a \cdot \text{Пробег} + b \).

Вычислите среднюю абсолютную ошибку (MAE) модели — среднее модулей отклонений реальных цен от предсказанных.

В ответе укажите MAE, умноженную на 10 и округлённую до целого числа.

Метеостанция собрала данные за 4000 дней. Файл weather.txt содержит строки: температура влажность давление дождь, где дождь — 1 (был) или 0 (не был).

Метеоролог использует правило прогноза:

  • «дождь», если температура > 5 и влажность > 70 и давление < 745;
  • «без осадков» в остальных случаях.

Примените правило к каждому дню и вычислите точность (accuracy) — долю дней, когда прогноз по правилу совпал с реальностью.

В ответе укажите точность в процентах, округлённую до целого числа.

Даны результаты 2200 экспериментов. Файл experiment.txt содержит строки: давление_атм объём_л. Зависимость объёма от давления приближённо линейная.

Постройте линейную регрессию \( V = a \cdot P + b \) методом наименьших квадратов.

Вычислите остаточную сумму квадратов (RSS) — сумму квадратов отклонений реальных значений от предсказанных построенной моделью.

В ответе укажите RSS, округлённую до целого числа.

Поделиться
Класснуть