loss_landscape_post
@fminxyz — Loss Landscape современных нейросетей
Текст поста
🏔️ Loss landscape: почему одни минимумы лучше других?
Уважаемые подписчики-геймеры, представьте: вы стоите на вершине горного хребта с завязанными глазами. Вам нужно спуститься в долину. Но долин много — узкие ущелья и широкие плато.
SGD с моментом — это вы с рюкзаком: инерция несёт вас мимо узких ям (sharp minima), но останавливает в широких долинах (flat minima).
Почему это важно?
В 2017 Keskar et al. показали: sharp minima ≈ переобучение, flat minima ≈ генерализация. Модель, застрявшая в узкой яме, идеально помнит тренировочные данные, но ломается на новых.
Современные LLM тренируются с огромными batch size, learning rate warmup, и weight decay — всё это помогает “перепрыгивать” sharp minima и находить flat regions.
На видео: SGD trajectory на реалистичном loss landscape. Видно, как оптимизатор проскакивает мимо острых минимумов и “успокаивается” в широкой долине.
📐 Математика (для ценителей):
Гессиан H в sharp minimum имеет большие собственные значения λ_max → маленькое изменение параметров = большое изменение loss. В flat minimum λ_max мал → robustness.
SAM (Sharpness-Aware Minimization) явно оптимизирует:
min_w max_{‖ε‖≤ρ} L(w + ε)
— ищет параметры, где loss не сильно меняется в ε-окрестности.
🎮 Аналогия: sharp minimum — это стоять на вершине иглы (один шаг в сторону = падение). Flat minimum — стоять на широком плато (можно гулять и ничего не меняется).
Код для генерации видео — в комментариях 👇
#optimization #deeplearning #losslandscape #llm
Ключевые ссылки
- Keskar et al., “On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima” (ICLR 2017)
- Foret et al., “Sharpness-Aware Minimization for Efficiently Improving Generalization” (ICLR 2021)
- Li et al., “Visualizing the Loss Landscape of Neural Nets” (NeurIPS 2018)