Strategy/content/heavy_tails_post.md
+

heavy_tails_post

review_statusnew
projectfminxyz
creation_date2026-03-03

🦁 Тяжёлые хвосты: почему среднее вас обманывает

Представьте: вы смотрите на распределение богатства в стране. Среднее — $50k. Звучит нормально? Теперь Илон Маск заходит в комнату. Среднее стало $5M. Среднее сломалось — потому что распределение богатства имеет тяжёлый хвост.

Гауссовское распределение ведёт себя прилично: вероятность отклонения на 5σ — это $3 \times 10^{-7}$. Коши (классический тяжёлый хвост) не имеет определённой дисперсии вообще. Выброс в 1000× — не аномалия, а закономерность. Именно это видно в анимации: при сэмплировании из Коши выбросы появляются регулярно, а у Гаусса — почти никогда.

Почему это важно в ML?

Scaling Laws нейросетей — это степенной закон: Loss ∝ N^{-α}, где N — число параметров. На log-log графике это прямая линия. Градиентный шум в трансформерах тоже имеет тяжёлые хвосты — именно поэтому Adam работает лучше SGD: он нормализует градиенты, подавляя выбросы. Частоты токенов в языке следуют закону Ципфа (ещё один степенной закон) — 100 самых частых слов покрывают ~50% любого текста.

Практически: если ваши данные имеют тяжёлые хвосты — не используйте среднее, используйте медиану. Clip gradients по norm, не по value. И помните: в реальных данных «невозможные» события случаются намного чаще, чем предсказывает Гаусс.

#ML #math #statistics #deeplearning #нейросети

Choose icon