oselodets_april_meeting_prep
Подготовка к встрече с Оселедцом — апрель 2026
Контекст: Встреча для обсуждения статьи “Stochastic gradient algorithms from ODE splitting perspective” (JCAM target).
Статья: Strategy/projects/files/splitting/split-sgd/main_jcam.tex (28pp, PDF компилируется ✅)
Последнее обновление: 2026-03-17 23:10 MSK (worker, Феанор)
Статус статьи перед встречей
Что готово ✅
- Архитектура: SGD = first-order splitting (LT), SGD с симметрией = Strang splitting
- Теорема (LLS): аналитическая формула для linear least squares
- Теорема (global split error): верхняя оценка глобальной ошибки сплиттинга
- Секция LASSO: Theorem A (LT) + Theorem D (Strang-ISTA) + Remark C_D + Corollary
- Theorem A: ПОЛНОЕ доказательство (descent lemma + prox optimality + telescoping) — аналог Beck & Teboulle 2009, Thm 3.1
- Theorem D: доказательство-набросок (4 шага; шаги 3-4 — приближения, нужна верификация)
- C_D formula: ⚠️ ПЕРЕСМОТРЕТЬ — formula C_D = ‖As*‖²/8 = 0.769 недооценивает реальный C_D ≈ 0.96 (Strang активирует off-support компоненты с dual≈λ; подробности в Q1)
- JCAM elsarticle template: 26pp PDF ✅ (рост: 20 → 22 → 25 → 26pp)
- Figures: lasso_convergence.pdf, lasso_bias_floor.pdf, lasso_fixed_point_shift.pdf
- Conclusions section: добавлена 2026-03-17 (3 параграфа: splitting view SGD, Kaczmarz limit, LASSO splitting order)
Что нужно обсудить (блокеры) 🔴
- C_D formula: Is C_D = ‖A·sign(θ*)‖²/8 rigorous?
- Theorem D proof: шаги 3-4 используют приближения — как сделать exact?
- Co-authorship: Oselodets уже в авторах (main_jcam.tex) — подтвердить
- Journal: JCAM vs COAP vs Numerical Algorithms?
- Кандминимумы: какой статус у Даниила (отдельная тема)?
Открытые математические вопросы
Q1. Доказательство C_D = ‖A·sign(θ*)‖²/8
Контекст: Strang-ISTA сходится не к θ*, а к смещённой точке θ̄ʰ.
Гипотеза: При малых h, фиксированная точка Strang-ISTA:
$$\bar\theta^h - \theta^* \approx \frac{h\lambda}{2}\operatorname{sign}(\theta^*)$$
Из этого через разложение Тейлора:
$$F(\bar\theta^h) - F(\theta^*) = \frac{h^2\lambda^2}{8}(\mathbf{s}^*)^\top H \mathbf{s}^* + O(h^3)$$
где $H = A^\top A$, $\mathbf{s}^* = \operatorname{sign}(\theta^*)$.
Так как $H\mathbf{s}^* = A^\top A\operatorname{sign}(\theta^*)$, получаем:
$$C_D = \frac{\|A\operatorname{sign}(\theta^*)\|^2}{8}$$
Нужно от Оселедца:
- Правильна ли формула фиксированной точки $\bar\theta^h - \theta^* \approx \frac{h\lambda}{2}\operatorname{sign}(\theta^*)$?
(Это уравнение на $\vect{0} \in \partial \tilde{F}_h(\bar\theta^h)$ для модифицированного функционала)
- Нужна ли полная версия доказательства или достаточно скетча для JCAM?
⚠️ ВАЖНАЯ НАХОДКА (worker 2026-03-17 04:45 MSK, уточнена 2026-03-18 03:05 MSK):
Численный анализ (A∈ℝ^{200×20}, d=20, nnz=6, λ=0.05) показал, что:
- LT фиксированная точка: support = {0,1,2,3,4,5} (совпадает с θ)
- Strang фиксированная точка: support = {0,1,2,3,4,5, 8} — компонент 8 становится активным!
- Компонент 8: dual value для LT = 0.02816 = 0.563·λ > λ/2* (выше половины λ!)
- j=8 активируется Strang для ВСЕХ h/L ∈ [0.10, 0.70] — не h-зависимый эффект
- C_D (analytic, только support {0..5}) = 0.769, C_D (empirical) = 0.959
- Разрыв: 19.8% от empirical C_D = вклад компонент с dual ∈ (λ/2, λ)
Ключевое теоретическое объяснение (worker 2026-03-18):
Условие фиксированной точки Strang-ISTA для θ_j = 0:
$$S_{h\lambda/2}(-h \cdot [A^\top(A\bar\theta - y)]_j) = 0$$
$$\Longleftrightarrow |d_j| \leq \lambda/2$$
Условие фиксированной точки LT (ISTA) для θ_j = 0:
$$S_{h\lambda}(-h \cdot d_j) = 0 \Longleftrightarrow |d_j| \leq \lambda$$
⭐ ВЫВОД: Strang активирует компоненты с λ/2 < |d_j| < λ — те, что “inactive” для LT,
но “active” для Strang (threshold λ/2 вместо λ).
Для j=8: dual_j = 0.563·λ > λ/2 ✅ → правильно предсказывает активацию Strang.
Формула поправки: нужно добавить вклад компонент с dual ∈ (λ/2, λ):
$$C_D = \frac{\|A\operatorname{sign}(\theta^*)\|^2}{8} + C_D^{\text{boundary}}$$
где граничная зона: $\{j: \lambda/2 < |[A^\top(A\theta^* - y)]_j| < \lambda\}$.
Figures generated (2026-03-18 03:05):
- Strategy/phd/figures/lasso_support_expansion.pdf — Fig 4a: все d=20 компонент, LT vs Strang fixed-point values, j=8 annotated
- Strategy/phd/figures/lasso_dual_variables.pdf — Fig 4b: dual variables для каждого компонента, λ/2 threshold zone
- Results: Strategy/phd/results/article3_support_expansion.json
Для Оселедца:
1. Верен ли вывод: Strang fixed-point активирует j ⟺ |d_j| > λ/2 (а не λ)?
2. Если да — это “Proposed Theorem C” (support characterisation)
3. Полная формула C_D: нужно учесть energy contribution активированных компонент
Q2. Rigorous Proof of Theorem D (Steps 3-4)
Проблема в Step 3: Мы используем:
$$\tilde{F}_h(\mathbf{u}) = F(\mathbf{u}) + O(h^2\lambda^2)$$
Но точная форма $\tilde{F}_h := \tilde{f}_h + (h\lambda/2)\|\cdot\|_1$ отличается от $F = f + \lambda\|\cdot\|_1$ на разницу регуляризаций: $(\lambda - h\lambda/2)\|\cdot\|_1$ — это не $O(h^2)$, это $O(h\lambda)$.
Альтернативный подход (стоит предложить Оселедцу):
1. Огибающая Морё: Strang шаг = prox_{g/2} ∘ grad_f ∘ prox_{g/2}, что связано с проксимальным методом на огибающей Морё $g$.
2. Можно проанализировать через modified Lagrangian вместо tilde_F_h.
Вопрос к Оселедцу: Как лучше сформулировать Theorem D?
- Вариант A: оставить скетч + numerical evidence (acceptance bar для JCAM может быть ниже?)
- Вариант B: доказать через Moreau envelope framework
- Вариант C: убрать C_D = конкретная формула из теоремы, написать “существует C_D ≥ 0” (консервативно)
Q3. Дополнительные теоремы?
Потенциальные усиления для журнальной версии:
1. Theorem B: Strang-ISTA с уменьшением шага (h_k → 0) → C_D h²λ² → 0, нет bias floor
2. Theorem C (СРОЧНО): LASSO, точная характеризация поддержки $\bar\theta^h_{Strang}$.
- Эмпирически: Strang АКТИВИРУЕТ компоненты с dual variable близким к λ
- Уточнённая гипотеза (2026-03-18): $j \in \text{supp}(\bar\theta^h_S) \iff |[A^\top(A\theta^*-y)]_j| > \lambda/2$
- Это существенно для полной формулы C_D
3. Proposition: В пределе h → 0, Strang-ISTA → ISTA (оба = прокс-градиент, нет различия)
4. NEW: Полная формула C_D = ‖As*‖²/8 + вклад активированных near-boundary компонент
Agenda встречи (предлагаемый порядок)
| # | Тема | Цель | Время |
|---|---|---|---|
| 1 | Состояние статьи: показать main_jcam.tex (28pp, Highlights + Cover letter готовы) | Information | 5 мин |
| 2 | Theorem A proof: полное доказательство, стандартное — ОК? | Approval | 5 мин |
| 3 | Theorem D proof sketch + Q2 выше | Discussion | 15 мин |
| 4 | Q1: C_D formula derivation | Math discussion | 15 мин |
| 5 | Journal choice: JCAM vs alternatives | Decision | 5 мин |
| 6 | Эксперименты: какие нужны? | Planning | 10 мин |
| 7 | Co-authorship + submission timeline | Admin | 5 мин |
Что нужно сделать ДО встречи
- Conclusions section добавлен (2026-03-17) ✅
- Финальная компиляция с реальными figures (LLS/Logreg/Softmax + LASSO) ✅ — все фигуры включены, 28pp
- Multiply-defined labels исправлены (2026-03-17 18:10): удалены дублирующиеся леммы из Proofs секции ✅
- JCAM Highlights добавлены в frontmatter (2026-03-17 20:07): 5 пунктов ≤85 символов ✅
- Cover letter подготовлен (2026-03-17 21:08): 5 вкладов, 4 suggested reviewers, originality statement ✅
- Запустить полный набор экспериментов (LT vs Strang-ISTA bias plot) с красивыми графиками
- Отправить draft Оселедцу за 1-2 недели до встречи (deadline: 24 мар) — ждёт ОК Даниила
- Проверить кандминимумы: сданы ли экзамены?
- Уточнить у Оселедца дату: апрель или конкретная неделя?
References для обсуждения
- Beck & Teboulle (2009, SIAM J Imaging Sci) — Theorem A base reference
- Blanes, Casas, Murua (2024, Acta Numerica) — splitting survey, positioning
- Combettes & Wajs (2005, Multiscale Model Simul) — proximal splitting framework
- Moreau (1965) — Moreau envelope / infimal convolution
- Lions & Mercier (1979) — operator splitting for convex optimization
Создан: 2026-03-17 worker (авто). Обновлять перед встречей.