О чем этот курс
Этот курс — мягкое и практичное погружение в машинное обучение на Python. Мы сознательно упрощаем математику и делаем акцент на интуицию, примеры и живые эксперименты в Jupyter Notebook. Вы разберётесь, что такое признаки и целевая переменная, чем отличаются задачи регрессии, классификации и кластеризации, как делить данные на обучение и тест и как не попасть в ловушку переобучения.
Мы будем использовать популярные инструменты: pandas и NumPy для работы с данными, scikit-learn для моделей и пайплайнов, а также Matplotlib/Seaborn для визуализации. Шаг за шагом вы соберёте базовый ML‑конвейер: от загрузки данных и первичного анализа до обучения, подбора гиперпараметров и оценки качества.

В конце курса вы реализуете мини‑проект: выберете учебный датасет, проведёте разведочный анализ, подготовите признаки, обучите несколько моделей (например, логистическую регрессию и случайный лес), сравните метрики и оформите итог с понятными графиками и выводами.
flowchart TD
A["Данные"]
B["Очистка/EDA"]
C["Разделение
(Train/Test)"]
D["Пайплайн признаков"]
E["Выбор модели"]
J["Кросс-валидация
(k-fold)"]
H["Подбор
гиперпараметров"]
F["Обучение"]
G["Оценка
(метрики)"]
I{"Итерация
нужна?"}
K["Деплой (опционально)"]
A --> B --> C --> D --> E --> H --> F --> G --> I
D --> J
E --> J
J --> H
I --|Да|--> H
I --|Нет|--> K
Ниже — пример короткого рабочего фрагмента кода на scikit‑learn, который показывает базовый цикл: загрузка данных, разбиение на train/test, обучение модели и оценка качества.
# Базовый пример классификации на Iris с логистической регрессией
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import Pipeline
from sklearn.metrics import accuracy_score
# 1) Данные
X, y = load_iris(return_X_y=True)
# 2) Разделение на обучение/тест
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42, stratify=y)
# 3) Пайплайн: масштабирование + модель
pipe = Pipeline([
("scaler", StandardScaler()),
("clf", LogisticRegression(max_iter=1000, n_jobs=None))
])
# 4) Обучение и оценка
pipe.fit(X_train, y_train)
y_pred = pipe.predict(X_test)
print("Accuracy:", accuracy_score(y_test, y_pred))
Оглавление
-
Что такое машинное обучение: интуитивное введение
-
Виды обучения: supervised и unsupervised, признаки и целевая переменная
-
Распредели задачи по типам и укажи признаки/target
-
ML-пайплайн: данные, разбиение на train/test, метрики и переобучение
-
Квиз: основы терминов
-
Практика в Python: первый мини-проект на Iris
-
Квиз: оценка качества и лучшие практики
-
Опишите свой кейс применения ML
- Инструменты: Python, Jupyter, библиотеки (pandas, NumPy, scikit-learn)
- Данные, признаки и целевая: загрузка, очистка и разведочный анализ
- Train/Test, валидация и базовый ML‑конвейер
- Линейная регрессия: интуиция, визуализация, практика
- Логистическая регрессия и метрики классификации
- Деревья решений и случайный лес: интерпретация и стабильность
- Кластеризация: k-means и оценка качества без таргета
- Переобучение, регуляризация, подбор гиперпараметров и пайплайны
- Итоговый мини‑проект: от данных до первой модели
-
Сертификат



