Strategy/projects/files/mipt/mipt_d3_evaluation_rubric.md
+

mipt_d3_evaluation_rubric

МФТИ — D3 Evaluation Rubric (Первые результаты)

Создано: 2026-04-11. Феанор worker.
Дедлайн D3: 11 апреля 2026, 23:59 MSK


Что проверяем (D3 = report.md v1 + первые результаты)

Студент сдаёт:
1. report.md v1 — все секции заполнены (D1 + D2 + первые D3 результаты)
2. Код метода — реализован выбранный алгоритм (не только baseline)
3. Числа — хотя бы один эксперимент с метриками

Время на проверку: ~7–10 мин на команду.


Чеклист (0–10 баллов)

Реализация метода (3 балла)

# Критерий Баллы
1 Реализован собственный метод (не только baseline) 1.5
2 Код запускается — есть output / ячейка с results 1.0
3 Гиперпараметры выбраны осмысленно (шаг, регуляризация, итерации) 0.5

Экспериментальные результаты (4 балла)

# Критерий Баллы
4 Таблица метрик: baseline vs. метод (хотя бы 1 строка) 2.0
5 Объяснение: почему метод лучше / хуже / так же? 1.0
6 Графики / визуализация (кривая сходимости, loss, metric vs. iter) 0.5
7 Эксперименты воспроизводимы (описаны датасет, split, seed) 0.5

Отчёт (3 балла)

# Критерий Баллы
8 Все секции report.md заполнены (D1+D2+D3 не TBD) 1.5
9 Журнал разработки — хотя бы 3 записи с датами 0.5
10 Секция “Что дальше” или Conclusion — план до финала 1.0

Частые ошибки (−0.5 балл каждая)

Ошибка Описание
Только baseline запущен Д3 требует ОБА метода — baseline + свой
TBD в D3 секции report.md не обновлён с первыми результатами
Нет чисел в отчёте Таблица метрик отсутствует — только “работает”
Нет сравнения Есть числа, но не сравниваются с baseline
Ноутбук без output Код есть, но ячейки не запущены

Оценки

Баллы Оценка Комментарий
9–10 ✅ Отлично Метод работает, первые результаты убедительны, отчёт полный
7–8 👍 Хорошо Метод реализован, но сравнение частичное или отчёт неполный
5–6 🟡 Удовлетворительно Метод есть, но нет чисел или baseline не обновлён
3–4 ⚠️ Слабо Только baseline, метод не реализован, или отчёт почти пустой
0–2 ❌ Не сдано Нет кода, нет чисел, D3 секция пустая

Команды (GSheets, апрель 2026)

Используй при проверке — у каждой своя задача оптимизации:

Команда Тема На что смотреть
Дорогова, Герман, Казачков, Ляторовский, Базаров Экстраградиентные методы для CycleGAN GAN training loss, FID или IS score vs. иtер
Чирков, Зайнуллин, Черняков, Нистюк, Богданов Квантизация LLM Perplexity или task accuracy до/после квантизации
Кравацкий, Козырев, Козлов, Виноградов Neon: nuclear norm vs muon Test accuracy или convergence speed
Неверов, Чиняев, Федурина, Дюгаева Interior point methods Iterations to convergence, infeasibility gap
Шурмин, Ляпин, Карпов, Юдин, Бунин LLM как оптимизатор ч/я Benchmark score (GSM8K/MATH), comparison vs. GPT/few-shot
Стрелков, Свиридов, Маслова, Фризен, Михайлов Оптимизация на матричных многообразиях Convergence rate, задача (matrix completion / PCA?)
Багрянов, Коломиец, Русинова, Пигунова Методы оптимизации для генерации атак Attack success rate (%), perturbation norm

Как проверять

  1. Открыть GSheets: <a href="https://docs.google.com/spreadsheets/d/1rkk7z3Q2EA-A0iPUxtYjIQPQAcG6-yIwxaYwx_FbnGo/“>https://docs.google.com/spreadsheets/d/1rkk7z3Q2EA-A0iPUxtYjIQPQAcG6-yIwxaYwx_FbnGo/`
  2. Найти ссылку на репо команды
  3. Открыть report.md → проверить D3 секцию + журнал
  4. Открыть код/ноутбук → убедиться что есть output + таблица метрик
  5. Проверить коммит: должен быть до 11 апр 23:59

Расписание

Дата Дедлайн Что
28 мар ~~D2~~ ✅ Прошёл. Related Work + Baseline
11 апр D3 TODAY report.md v1 + первые результаты
18 апр D4 Peer-feedback (2 чужих отчёта)
~май D5 Финальный отчёт

По вопросам: Тришин, Ребриков, Рубцов, Забара, Хафизов — ассистенты курса

Choose icon