Машинное обучение и наука о данных
48 ак.часов
Computer Vision Pro: анализ изображений, генерация и продакшен
-
О КУРСЕКурс «Computer Vision Pro» — это 48 академических часов интенсивной работы, за которые вы пройдёте весь путь от базовых принципов обработки изображений до современных генеративных моделей и вывода нейросетей в продакшен. В первых модулях вы познакомитесь с эволюцией CV и экосистемой PyTorch, научитесь применять классические операции OpenCV (фильтры, морфология, гистограммы) и построите собственный CNN-классификатор с аугментациями данных. Далее курс углубляется в прикладные задачи: детекцию объектов (YOLO v8), семантическую и инстанс-сегментацию (U-Net, Mask R-CNN), а также метрики качества, transfer learning и best-practice по подготовке датасетов.
Во второй половине курса вы реализуете вариационные автоэнкодеры и GAN для генерации изображений, увидите в действии Stable Diffusion и RealESRGAN, а затем освоите инструментарий разработчика: MLflow для трекинга экспериментов, экспорт моделей в ONNX, квантизацию и прунинг для ускорения инференса. Итогом станет финальный проект, в котором участник интегрирует выбранную модель в полноценный CV-пайплайн, измерит производительность до и после оптимизаций и презентует результаты на демо-дне. Выпускник курса получает портфолио-кейс и практический набор навыков, охватывающих весь жизненный цикл CV-решений — от идеи до деплоя.
Junior/Middle ML-инженеры, data-scientists, software-разработчики, которые хотят освоить или углубить навыки Computer Vision, а также которым требуется анализ изображений для текущих или будущих проектов
Профессионалы, которым нужен практический опыт построения CV-моделей (классификация, детекция/сегментация, генерация изображений) для своих проектов или задач компании
Инженеры, отвечающие за вывод AI-решений в продакшен и оптимизацию инференса (MLOps/Backend)
Модуль 1. Введение в CV и Deep Learning: от Лапласа до трансформера
- Что такое CV и почему это важно: разбор реальных кейсов
- Методы в CV до нейросетей: фильтры, Фурье, детекторы границ и дескрипторы для анализа изображений
- Краткая история Deep Learning: от перцептрона до трансформеров (AlexNet, VGG, ResNet, Unet, ViT)
- Обзор фреймворков обучения нейросетей: PyTorch, TensorFlow, Keras, JAX
- Экосистема DL: знакомство с Kaggle и Hugging Face
Модуль 2. Классический CV: анализ изображений с помощью OpenCV
- Основы работы с изображениями: пиксели, цветовые пространства (RGB, HSV, Grayscale, LAB)
- Точечные преобразования: гистограммы, яркость, контраст, нормализация и эквализация
- Фильтрация и морфология: свертки, размытие (гауссово, медианное) для подавления шума, эрозия, дилатация
- Выделение границ: операторы Собеля, Лапласа и детектор границ Кэнни
- Продвинутые методы: преобразование Фурье, Лапласовская пирамида. Сэмплирование
- Практикум: библиотека OpenCV, применение фильтров, коррекция гистограммы, выделение контуров объектов, анализ иображений
Модуль 3. Основы PyTorch: ваш первый классификатор
- Настройка среды разработки: Google Colab
- PyTorch: тензоры, операции, граф вычислений
- Архитектура нейросети: слои (Linear, Conv2d), функции активации, нормализация
- (LayerNorm, GroupNorm, BatchNorm) и функции потерь
- Обзор и реализация архитектур в CV: перцептрон, VGG, Resnet
- Аугментация изображений: применение трансформаций (повороты, шум, вырезание) с помощью библиотеки Albumentations
- Полный цикл обучения: Dataset, DataLoader, цикл обучения, оптимизаторы (SGD, Adam, AdaBelief)
- Практикум: написание и обучение с нуля нейросетей для классификации изображений
Модуль 4. Детекция, сегментация, распознавание лиц
- Transfer Learning: как использовать обученные нейросети для своих задач (fine-tuning и feature extraction)
- Ключевые метрики в CV: Accuracy, Precision, Recall, F1-score, IoU — что и когда применять
- Детекция объектов: обзор архитектур (YOLO, Faster R-CNN) и концепция якорей (anchors)
- Сегментация изображений: семантическая (U-Net для медицины) и инстанс-сегментация (Mask R-CNN)
- Распознавание лиц: верификация на основе векторов (embeddings)
- Практикум: запуск модели YOLO для детекции объектов, сегментация медицинских снимков, удаление фона и верификация лиц
Модуль 5. Творческий AI: Автокодировщики, VAE, GAN, Super Resolution, Diffusion
- Автоэнкодеры (AE): сжатие информации в скрытое пространство
- Вариационные автоэнкодеры (VAE): как научить модель генерировать новые данные
- Состязательные сети (GAN): битва генератора и дискриминатора
- Диффузионные модели: от шума к шедевру (DDPM, Stable Diffusion), магия текстовых промптов.
- Практикум: реализация плавного перехода между цифрами с помощью VAE, запуск RealESRGAN, Stable Diffusion
Модуль 6. Инструментарий DL разработчика: от ноутбука к продакшену
- MLFlow & Hydra: трекинг экспериментов и управление конфигурациями
- Оптимизация моделей: квантизация и прунинг для ускорения инференса
- Формат ONNX: как запустить PyTorch-модель где угодно (на C++, JS или в мобильном приложении)
- Практикум: Обернуть модели из прошлых модулей в ONNX, замерить производительность до и после квантизации и залогировать результаты в MLFlow
-
Как проходит обучение:
Лекции в формате вебинаров (13 часов) ↓
Выполнение лабораторных работ, воркшопы (23 часа) ↓
Разбор практических работ и кейсов с преподавателем (5 часов) ↓
Время на самостоятельные работы вне вебинаров (≈ 20–24 ч)
По завершении программы у Вас будет собственный мини-проект для личного портфолио
-
Для успешного прохождения курса необходимы:
- Уверенное владение Python 3 и базовыми инструментами разработки (Git, Jupyter/Colab)
- Знание линейной алгебры и основ статистики (матрицы, вектора, дисперсия, градиент)
- Базовое понимание нейронных сетей и градиентного спуска; опыт работы с любой DL-библиотекой приветствуется, но ключевые концепции PyTorch будут повторены в курсе
- Доступ к GPU (Google Colab Pro / локальная карта ≥ 8 GB VRAM) для выполнения лабораторных и финального проекта
-
По окончании курса слушатели смогут:
◉ Анализировать изображения классическими и DL-методами: применять OpenCV-фильтры, строить и обучать CNN-классификаторы с аугментациями
◉ Решать прикладные задачи CV: детектировать объекты (YOLO v8), выполнять семантическую и инстанс-сегментацию (U-Net, Mask R-CNN), оценивать качество по метрикам Accuracy, IoU, mAP
◉ Использовать генеративные модели: реализовывать и интерпретировать VAE и GAN, запускать и донастраивать Stable Diffusion/RealESRGAN для улучшения и создания изображений
◉ Оптимизировать и деплоить модели: логировать эксперименты в MLflow, экспортировать сети в ONNX, применять квантизацию и прунинг для ускорения инференса на CPU/GPU/мобильных устройствах
◉ Собрать полноценный CV-пайплайн: от подготовки данных до продакшен-инфраструктуры, включая измерение производительности «до/после» оптимизаций и презентацию готового решения


