mipt_lecture26_plan
МФТИ Лекция 26 — План (2 марта 2026, 13:55-16:55)
Контекст
- Последняя лекция курса (лекция 26 из 26)
- Лекция 25 = Gradient Flow (detailed): discretization, convergence, accelerated/stochastic GF, Fokker-Planck
- Курс покрыл: линалгебра → автодифф → выпуклость → двойственность → LP → градиентные методы → ускорение → Ньютон → проекции → субградиенты → проксимальные → стохастические → AdamW/Muon/Shampoo → нейросетевые insights → large model training → двойственные → continuous-time optimization → gradient flow
- Формат: 3 часа (2 × 1.5ч с перерывом)
- next_step проекта: “Организовать проектный процесс”
Предложение: Гибридная лекция
Часть 1 (1.5ч): Современные рубежи оптимизации в ML
Тема: “За пределами SGD: оптимизация на стыке обучения и вывода”
-
RLHF как задача оптимизации (20 мин)
- reward model → PPO pipeline → constrained optimization (KL penalty)
- Связь с двойственностью (лекция 23) -
Direct Preference Optimization (DPO) (20 мин)
- Как превратить RLHF в supervised задачу
- DPO loss как implicit reward model
- Связь с Legendre transform (лекция 4!) -
Test-Time Compute & Scaling Laws (15 мин)
- Оптимальное распределение compute: train-time vs test-time
- Scaling laws как optimization insight -
Билevel оптимизация (15 мин)
- Meta-learning (MAML) как bilevel optimization
- Hyperparameter optimization (implicit differentiation)
- Связь с автодиффом (лекция 2) и двойственностью -
Open problems & куда двигается поле (10 мин)
- Muon/Shampoo direction → matrix-aware methods
- RL for optimization (DeepResearcher, Search-R1)
- Non-convex landscape understanding
Часть 2 (1.5ч): Проектный процесс
Запуск проектов на весенний семестр:
-
Формат проектов (20 мин)
- Вдохновение: STAT-4830
- OODA-цикл: Observe → Orient → Decide → Act (еженедельно)
- Обязательный self-critique на каждом этапе -
Структура репозитория (10 мин)
project-repo/ ├── report.md # Эволюционирующий отчёт ├── notebooks/ # Jupyter эксперименты ├── src/ # Модульный код ├── tests/ # Воспроизводимость └── docs/ ├── development_log.md # Лог решений └── llm_exploration/ # AI-ассистированная работа -
Оценивание (15 мин)
- Report (20%) — формулировка, методология, результаты
- Implementation (35%) — рабочий код, тесты, эксперименты
- Development process (15%) — decision log, итерации
- Self-critique (15%) — рефлексия и анализ ошибок
- Repo organization (15%) — структура и документация -
Дедлайны и milestones (15 мин)
- Каждые 2 недели: report draft + code update + self-critique
- Неделя 8: lightning talks (mid-semester)
- Неделя 14-15: финальные презентации
- Цель: 5 статей, поданных на конференции/журналы/воркшопы -
Примеры проектов (15 мин)
- Из домена курса: ускоренные методы для специфических структур
- Оптимизация LLM training pipeline
- Билевельная оптимизация для AutoML
- Прокс-методы для compressed sensing / sparse recovery
- Распределённая оптимизация для federated learning -
Формирование команд (15 мин)
- Ассистенты: Тришин, Ребриков, Рубцов, Забара, Хафизов
- Каждый ассистент курирует 2-3 проекта
- Студенты pitch-ают идеи или выбирают из предложенных
Подготовка (TODO для Даниила)
- Подготовить слайды по RLHF/DPO (связать с материалами курса)
- Создать template репозитория для проектов (fork из damek/STAT-4830)
- Составить список 10-15 предложенных тем проектов
- Обсудить с ассистентами распределение проектов
- Подготовить schedule milestones на весну
Альтернативы
Вариант B: Вся лекция = проекты (если тема 26 не нужна)
Вариант C: Тема “Distributed Optimization” (если проекты могут подождать)
Вариант D: Тема “Zeroth-Order & Derivative-Free Methods” (практически полезно)