Strategy/projects/files/mipt_session_30mar_brief.md
+

mipt_session_30mar_brief

МФТИ: Сессия 30 марта (понедельник, 13:55–16:55)

Подготовлено Феанором 2026-03-30 11:15 MSK


Контекст

  • D2 дедлайн: ПРОШЁЛ (28 мар 23:59). 0 GitHub форков, НО 7 активных команд в GSheets (~32 студента).
  • D2 reminder: готов к отправке → /review/inbox/mipt_d2_reminder_draft.md (ВАРИАНТ E)
  • Ассистент сегодня: Denis Rubtsov (у него ожидает ответ в ЛС — MS FPMI)
  • Следующая лекция: 6 апр — L23 (Двойственные методы / ADMM), Забара

D2 — что сказать студентам (часть 1, ~10 мин)

GSheets проверен: 7 команд с проектами уже работают:
1. Дорогова et al. (5) — Экстраградиентные методы для CycleGAN
2. Чирков et al. (5) — Квантизация LLM
3. Кравацкий et al. (4) — Neon: nuclear norm vs muon
4. Неверов et al. (4) — Interior point methods
5. Шурмин et al. (5) — LLM как оптимизатор чёрного ящика
6. Стрелков et al. (5) — Оптимизация на матричных многообразиях
7. Багрянов et al. (4) — Методы оптимизации для генерации атак

Отметить работу команд. Попросить всех кто не залил Paper/Demo/Poster ссылки — сделать это сегодня.
→ Уточнить: кто ещё не в GSheets? Проект обязателен для оценки.


Лекция 22: Advanced SGD + Neural Network Training + Memory

Источник: /root/mipt25_work/lectures/22.md (346 строк, beamer-формат)

Структура лекции:

Часть 1: Adaptive Gradient Methods (60 мин)
- Finite-sum problem → SGD recap
- Adagrad → RMSProp → Adadelta → AdamAdamW
- AlgoPerf benchmark (сравнение методов на реальных задачах)
- Shampoo (Kronecker-factored preconditioner)
- Muon (Nesterov momentum + Newton-Schulz orthogonalization)

Часть 2: Neural Network Training Basics (30 мин)
- Loss functions: MSE vs Cross-Entropy
- Simple example: Fashion MNIST

Часть 3: Memory & Large Model Training (40 мин)
- GPT-2 training memory footprint (параметры + оптимизатор + активации + градиенты)
- Activation checkpointing: ~50% снижение памяти, ~33% overhead на пересчёт
- Практические выводы: trade-off память vs скорость

Что интересного для студентов:

  • Muon: очень актуальная тема (студенты Кравацкий et al. делают проект на Neon/nuclear norm vs Muon!)
  • AlgoPerf benchmark: показывает что “стандартные” методы часто проигрывают
  • Activation checkpointing: релевантно для большинства проектов с обучением нейросетей

Возможные вопросы студентов

  1. “Наш проект использует Adam/AdamW — нужно сравнивать с Muon/Shampoo?” → по желанию, но интересно
  2. “Что сдавать в D2 если мы уже в GSheets?” → ссылки на Paper (PDF/overleaf) + Demo/Poster
  3. “Если команда меньше 4 человек…” → проверить Requirements
  4. Про D3 (следующий этап): пока не определён, сосредоточиться на D2 completion

Чеклист перед парой

  • Отправить D2 reminder в TG канал МФТИ (если ещё не отправлен) — скопировать из review item
  • Проверить что slides 22.pdf есть на сайте mipt25.fmin.xyz/lectures/22.pdf
  • Denis Rubtsov — напомнить что он ассистент сегодня (и ответить ему про MS FPMI)

После пары

  • Обновить D2 статус в GSheets по итогам сессии
  • Посмотреть: сколько ещё команд добавилось в GSheets?
Choose icon