Strategy/projects/files/sdr/sdr_draco_error_analysis.md
+

sdr_draco_error_analysis

SDR vs Plain Gemini на DRACO — анализ ошибок

Date: 2026-02-25
Repo: OmgiKikov/DeepResearch (eval branch)
Benchmark: DRACO (37 задач из 4 доменов: Academic, Technology, General Knowledge, Medicine)

Результаты

Model Overall Academic GenKnow Medicine Technology
Claude Opus 4.6 50.33% 69.32% 41.41% 51.53% 34.83%
Perplexity Sonar 35.81% 44.81% 28.18% 42.72% 27.75%
Plain Gemini 3 Flash 34.57% 44.38% 28.20% 46.37% 21.45%
Alibaba Tongyi 26.66% 31.66% 18.44% 40.86% 19.54%
SDR + Gemini 3 Flash 19.65% 23.40% 13.46% 26.53% 16.61%

SDR хуже на 35 из 37 задач. Средняя деградация: -14.92 п.п.

По секциям

Model Factual Accuracy Breadth & Depth Presentation Citation
Plain Gemini Flash 33.45% 36.19% 42.09% 22.95%
SDR + Gemini Flash 17.37% 15.29% 29.22% 22.85%
Delta -16.08 -20.90 -12.87 -0.10

Citation quality — единственная секция, где SDR не проигрывает существенно.

Root Cause #1: Source-Conditioning (PRIMARY — 55.1% ошибок)

Механизм: SDR pipeline ограничивает финальный отчёт ТОЛЬКО информацией из найденных веб-источников:
1. Query → Blueprint с search_hints
2. Tavily search → max 15 источников per coordinator
3. Extraction → атомарные факты
4. Final report = синтез ТОЛЬКО из findings, не из параметрической памяти LLM

Когда search НЕ находит конкретный факт/автора/статью, который требует rubric — критерий автоматически UNMET. Plain Gemini просто достаёт это из параметрической памяти.

Примеры:
- Task 22 (историческое право): SDR = 0.0% vs Gemini = 38.8%. Нужен exact statutory language из 1730-х. SDR нашёл 11 статей об истории рабства, но не конкретные колониальные статуты.
- Task 17 (клеточное старение): SDR = 29.3% vs Gemini = 67.0%. Нужна конкретная цитата “d’Adda di Fagagna et al., 2003”. SDR search нашёл другие статьи.

Подтверждение на DR-Bench-II: info_recall у SDR = 0.178 vs Gemini = 0.217.

Root Cause #2: Russian Language Mismatch

final_report_russian_instruction форсит русский вывод. Но DRACO rubrics проверяют English-specific терминологию (“Uses exact econometric terminology: ATT, parallel trends, TWFE”). Русский отчёт штрафуется за отсутствие точных английских терминов.

Root Cause #3: Lossy Extraction Pipeline

extract_findings_prompt: “Один элемент = одно утверждение” — сжимает богатые источники в плоские bullet points. Теряется контекст, нюансы, специфика → критерии “breadth and depth” проваливаются.

Потерянных критериев breadth&depth: 59 (442 weight lost) vs gained: минимум.

Root Cause #4: Report Bloat + Penalties

  • SDR отчёты: 8502 chars (1.56x длиннее)
  • Plain Gemini: 5432 chars
  • Длиннее ≠ лучше. Больше повторов → больше штрафных критериев (390 vs 295 penalty points)

Root Cause #5: Search Quality Ceiling

Tavily: ~40-50% relevance на академических запросах. Половина source gathering — впустую.

Деградация по доменам

Domain Delta SDR vs Gemini N
Academic -20.98% 12
Medicine -19.84% 6
General Knowledge -14.74% 9
Technology -4.84% 10

Academic и Medicine — больше всего страдают (нужны конкретные ссылки, авторы, точные данные).

Рекомендации

Quick wins

  1. Hybrid mode: дать LLM право дополнять отчёт параметрической памятью, если search не нашёл достаточно
  2. English output для английских бенчмарков: убрать Russian forcing для DRACO eval
  3. Увеличить extraction granularity: вместо “1 утверждение” — сохранять контекст, цифры, имена

Medium-term

  1. Улучшить поиск: добавить Semantic Scholar API, Google Scholar, OpenAlex — не только Tavily
  2. Увеличить source budget: coordinator_max_total_sources = 15 мало для complex multi-topic tasks
  3. A/B тест: SDR с hybrid mode vs без — изолировать source-conditioning impact

Evaluation

  1. Прогнать оставшиеся 63 задачи DRACO (Finance, Shopping, UX, Law, NeedleInHaystack, PersonalAssistant)
  2. Прогнать SDR с English output — изолировать language mismatch

Все 37 задач: SDR vs Gemini

Task Domain Вопрос (кратко) SDR Gemini Delta Что SDR пропустил
29 GenKnow 9-дневный маршрут по Таиланду для 7 чел 19.6 62.2 -42.6 Нет дневной структуры, конкретных мест, стоимости транспорта
22 Academic Рабовладельческое право 1730-х Британской империи 0.0 38.8 -38.8 Нет цитат статутов (6 Geo. II c.13), Yorke-Talbot 1729, кодексов Barbados/SC
17 Academic Клеточное старение: DDR vs митохондрии vs хроматин 29.3 67.0 -37.8 Нет именных цитат (d’Adda di Fagagna, Passos, Narita, Baker 2011), SAHF, p16-KO
35 Academic Феминистская теория права 23.4 58.3 -34.9 Нет MacKinnon, Fineman, Mir-Hosseini, шариат/фикх, Maputo
24 Medicine Болезнь Крона, тяжёлые симптомы 36.8 71.4 -34.6 Нет директивы ER в начале, NPO, “don’t drive”
28 Academic Process tracing vs Байесовский каузальный вывод 15.8 49.0 -33.2 Нет PT-механизма, SCM, back-door/front-door, QCA
21 GenKnow Методы добычи лития 2015-2024 2.4 27.5 -25.1 Нет Chile/Australia/China, DLE, данных по воде
4 Medicine Синий ингалятор ухудшает симптомы 25.6 49.4 -23.7 Нет ProAir→Ventolin, оценки MDI-техники, спейсера
33 GenKnow Женская занятость 1970-2025 6.2 28.7 -22.5 Нет данных Saudi/Korea/Iceland/India, корреляций с политиками
1 Academic Staggered DiD methodology 12.0 33.4 -21.4 Нет variance-weighted decomposition, Callaway-Sant’Anna
23 Medicine 68-летний мужчина, синкопе в ER 32.5 53.1 -20.6 Нет Holter/event monitor, tilt-table
2 Technology Real-time object detection для склада 7.1 24.8 -17.7 Нет YOLO v8 vs EfficientDet, спецификаций Jetson
6 Academic Экономика дара (Malinowski, Mauss, Sahlins) 42.9 60.1 -17.3 Нет kula ring, типов реципрокности, Weiner/Strathern
9 Medicine WISC-V vs NEPSY-II для ADHD 10.2 26.1 -15.9 Нет sensitivity/specificity, WMI comparison
19 GenKnow Carbon pricing: CA, EU ETS, China 1.6 17.2 -15.6 Нет цен, emission reduction, free allocation
26 Medicine Аутизм: DSM-5 vs ICD-11 10.4 25.6 -15.2 Нет side-by-side таблицы критериев
16 Technology Edge computing для IoT 2024 4.9 19.9 -15.0 Нет 3 use-case структуры, predictive maintenance
25 Academic Кембрийский взрыв 45.7 59.7 -14.0 Нет Hox-генов, Lyons/Reinhard геохимии
11 Academic Гомерика: неоаналитики vs оралисты 35.6 48.0 -12.4 Нет Burgess/Currie/Nagy позиций
34 Academic Мемристоры и нейроморфные вычисления 23.8 35.7 -11.9 Нет HP Labs 2008, synaptic analog
36 Academic Земельная реформа: Zimbabwe, SA, Namibia 3.2 13.9 -10.7 Нет данных продуктивности, food security
8 Academic Grounded Theory: Glaser vs Strauss 25.2 35.4 -10.3 Нет axial coding, Charmaz constructivist GT
27 Academic Transitional justice 24.0 33.2 -9.2 Нет Canada TRC, restorative vs retributive
13 Medicine 68-летний мужчина, синкопе, workup 43.6 52.7 -9.1 Нет carotid sinus massage, orthostatic
18 Technology Career transition в AI safety из Берлина 24.7 33.7 -9.0 Нет MATS/ARENA, EU vs US зарплаты
37 Technology Cloud genomics для биотеха 6.5 14.6 -8.1 Нет AWS/GCP/Azure genomics comparison
10 GenKnow Лицензирование nail tech в PA 20.3 27.8 -7.5 Нет PA-специфичных требований
12 GenKnow Instagram roadmap для агентства в Индии 19.5 26.6 -7.2 Нет INR-тактик, growth benchmarks
15 GenKnow Вертикальная интеграция какао 0.0 6.9 -6.9 Нет Barry Callebaut/Cargill/Olam
32 GenKnow Шахматные дебюты ECO 1.e4 c5 38.6 44.5 -5.9 Нет частотных данных из мастерских партий
30 Technology DLP для ChatGPT Enterprise + Purview 35.2 38.7 -3.5 Примерно равны
31 Technology Digital identity W3C vs FIDO 1.3 4.9 -3.5 Оба слабые
14 Technology GitLab CI vs GitHub Actions vs Buildkite 13.2 13.2 0.0 Ничья
5 GenKnow Материнская смертность: рохинджа vs карен 13.0 12.4 +0.6 SDR чуть лучше
7 Technology Deepfake detection с 2022 39.9 38.2 +1.7 SDR нашёл свежие данные
20 Technology Fintech fraud detection MLOps 18.9 16.6 +2.4 SDR чуть лучше
3 Technology Прогресс квантовых компьютеров 14.3 10.0 +4.3 Лучший результат SDR — поиск нашёл свежее

SDR выигрывает только в 4 задачах — все Technology, где свежесть данных важнее глубины.


Три паттерна ошибок

1. Named-entity knowledge gap (Academic, -21% avg)

Вопросы называют конкретных авторов/статьи/теории. Gemini знает их из обучения. SDR ищет в вебе и находит смежные, но не те самые работы.
→ Tasks: 17, 22, 28, 35, 11, 6, 8, 1

2. Actionable specificity gap (GenKnow, -14.7% avg)

Практические задачи (маршруты, гайды, roadmaps). Gemini генерирует конкретные названия, цены, приложения. SDR находит академические статьи о теме вместо практических советов.
→ Tasks: 29, 33, 21, 19, 10, 12

3. Clinical/presentation format gap (Medicine, -19.8% avg)

Медицинские сценарии требуют формата: жирный текст ER в начале, NPO, “don’t drive”. SDR даёт клинический анализ, но пропускает presentation requirements.
→ Tasks: 24, 4, 23, 9, 26


Развёрнутый пример 1: Task 17 — Клеточное старение (SDR 29.3% vs Gemini 67.0%)

Вопрос

Evaluate the mechanistic controversy surrounding cellular senescence in aging, contrasting the DNA damage response model (d’Adda di Fagagna et al., 2003) with the mitochondrial dysfunction hypothesis (Passos et al., 2010) and the chromatin remodeling framework (Narita et al., 2006). […] Assess how each mechanistic framework explains the paradoxical roles of senescence in both tumor suppression and age-related pathology, particularly addressing the temporal dynamics question raised by Baker et al.’s 2011 transgenic clearance experiments.

Что Gemini написал (из параметрической памяти):

The DNA Damage Response (DDR) Model (d'Adda di Fagagna et al., 2003):
This model posits that senescence is primarily a consequence of persistent DNA
double-strand breaks (DSBs), often at telomeres. The "telomere-associated foci"
(TAF) trigger a chronic ATM/ATR-p53-p21 signaling cascade.

Baker's 2011 experiments using the INK-ATTAC transgene to clear p16-high cells
demonstrated that systemic removal of senescent cells late in life could extend
healthspan and delay sarcopenia.

Что SDR написал (из веб-поиска):

Классическая модель рассматривает старение как результат активации сигнальной
сети DDR (DNA Damage Response) в ответ на повреждения генома или критическое
укорочение теломер. Центральными медиаторами здесь выступают белки p53, p21 и p16.

Источники SDR: русскоязычные обзорные статьи, ни одной из запрошенных работ.

Критерии, где SDR провалился, а Gemini нет (14 штук):

  • baker-2011-clearance-experiments (+10): Gemini описал INK-ATTAC. SDR — не упомянул Baker 2011
  • chromatin-framework-sahf-structures (+10): Gemini описал SAHF. SDR — “chromatin remodeling” обобщённо
  • p16-knockout-cancer-phenotype (+10): Gemini описал p16-KO → tumorigenesis. SDR — нет
  • cites-dadda-di-fagagna-2003 (+8): Gemini — явная атрибуция. SDR — нет
  • cites-passos-2010 (+8): Gemini — явная атрибуция. SDR — нет
  • cites-narita-chromatin (+8): Gemini — явная атрибуция. SDR — нет
  • immune-surveillance-decline (+8): Gemini описал immune clearance threshold. SDR — нет

Root cause: Поиск нашёл обзорные статьи, но не семинальные работы, названные в вопросе. LLM знает их из обучения, но SDR pipeline запрещает использовать эти знания.


Развёрнутый пример 2: Task 29 — Маршрут по Таиланду (SDR 19.6% vs Gemini 62.2%)

Вопрос

Create a 9-day Thailand itinerary for 7 travelers from Hyderabad with a total budget of Rs.70,000 per person. Include at least 2 days in rural areas. Suggest specific destinations, dorm/Airbnb, activities (cultural, adventure, nightlife), local transport, daily cost breakdowns.

Что Gemini написал:

Day 3: Into the Countryside (Kanchanaburi)
Take a private van (3 hours). Check into Float House River Kwai.
Transport: Private 9-seater Van (~4,500 THB / 7 people).

Day 6: Adventure & Islands
Speedboat trip to Koh Larn. Snorkeling, Parasailing.
Cost: Island day trip package (~1,200 THB including lunch).

Tips: Use "Bolt" or "Grab" app. Carry a Niyo Global card.
Buy a DTAC Tourist SIM at the airport (300 THB).

Что SDR написал:

День 3-5: Сельская жизнь и агротуризм (Пай или Пхукет)
Вариант А: Пай (Север). Пай рассматривается как динамично
развивающаяся дестинация с уникальной сетевой структурой [2].

Источники:
[1] Assessment of the U.S. travelers' destination image of Thailand
[2] Tourism destination development in Thailand (doi.org/10.18174/423967)
[3] DEVELOPING CREATIVE TOURISM ROUTES... (gtg.webhost.uoradea.ro)

Почему SDR провалился:

SDR трактовал практический вопрос как исследовательский — нашёл академические статьи о туризме вместо конкретных рекомендаций. Результат: вместо “Float House River Kwai, 4500 THB van” — ссылки на диссертации о туристическом развитии.

8 критериев UNMET: нет дневной структуры (блоки вместо дней), нет конкретных мест/баров, нет стоимости транспорта между городами, нет actionable specificity.


Развёрнутый пример 3: Task 35 — Феминистская теория права (SDR 23.4% vs Gemini 58.3%)

Вопрос

Trace the evolution of feminist legal theory across different legal traditions. Compare Anglo-American critical legal feminism (MacKinnon, Fineman), Islamic feminism’s reinterpretation of Sharia (Mir-Hosseini), African feminist jurisprudence, and Chinese feminist legal thought. For each tradition: analyze property rights, bodily autonomy, and political participation through the specific legal tradition’s lens.

Что Gemini написал (из параметрической памяти):

Dominance Theory (MacKinnon): Catharine MacKinnon revolutionized the field by
arguing that law is not neutral but "sees and treats women the way men see and
treat women." She moved the focus from "difference" to "dominance," arguing that
sexual objectification is the primary mechanism of women's subordination. Her work
redefined sexual harassment as sex discrimination.

The Vulnerability Paradigm (Fineman): Martha Fineman critiqued the "liberal
autonomous subject" at the heart of Western law. Fineman's "Vulnerability Theory"
calls for a "responsive state" that moves beyond formal equal opportunity.

Gender Equality as Divine Intent (Wadud & Mir-Hosseini): Mir-Hosseini distinguishes
between the Sharia (divine path) and Fiqh (human understanding), arguing that
since Fiqh is a social construct, it is subject to change.

African: focus on eradicating FGM/C... Rwanda's high female parliamentary representation.

Chinese: One-Child/Three-Child policies; privatization of housing; domestic violence
legislation (passed in 2015).

Что SDR написал (из веб-поиска):

В англо-американской традиции критический правовой феминизм (представленный
К. Маккиннон и М. Файнман) указывает на то, что неолиберальный анализ и демонтаж
программ социального обеспечения восстанавливают расовые, классовые и гендерные
иерархии [2]. Теория «социального гражданства» Т.Х. Маршала рассматривается
здесь как альтернатива.

Исламский феминизм: Амина Вадуд использует контекстуалистский подход для выявления
«коранической справедливости» [8]. Центральной стратегией является использование
концепции Макасид аш-Шариа.

Источники: обзорные статьи о правовом феминизме. Мир-Хоссейни не упоминается. Нет FGM/Maputo, нет Rwanda, нет One-Child Policy.

Критерии, где SDR провалился, а Gemini нет (13 штук):

  • sharia-fiqh-distinction (+20): Gemini — чётко разделил Sharia (divine path) vs Fiqh (human jurisprudence). SDR — обсуждает шариат обобщённо, различие не проведено
  • mackinnon-dominance-framework (+10): Gemini — dominance theory, sexual harassment as sex discrimination, sexuality-as-power. SDR — упоминает “К. Маккиннон” без раскрытия теории доминирования
  • fineman-vulnerability-theory (+10): Gemini — vulnerability theory, responsive state, critique of liberal autonomous subject. SDR — упоминает “М. Файнман” и “уязвимость” без деталей
  • mir-hosseini-contribution (+10): Gemini — named Ziba Mir-Hosseini, fiqh as patriarchal human jurisprudence. SDR — Мир-Хоссейни вообще не упоминается
  • bodily-autonomy-african-fgm-maputo (+10): Gemini — FGM/C + Maputo Protocol. SDR — “биовласть” и “духовный активизм” обобщённо
  • political-participation-african-quotas (+10): Gemini — Rwanda highest women’s representation. SDR — “квотирование” обобщённо, без примеров
  • bodily-autonomy-chinese-reproductive-control (+10): Gemini — One-Child legacy, pro-natalist shift. SDR — нет вообще
  • property-anglo-american-structure (+10): Gemini — equitable distribution, community property. SDR — “критика неолиберализма” обобщённо
  • property-islamic-separate-ownership (+10): Gemini — mahr/dower rights, wives retain own property. SDR — только “защита собственности” (макасид)
  • property-islamic-inheritance (+10): Gemini — daughters get half of male heirs’ share. SDR — нет конкретики

Root cause: SDR нашёл обзорные статьи о правовом феминизме, но не содержащие конкретных позиций именных теоретиков (MacKinnon, Fineman, Mir-Hosseini). Gemini знает их из обучения и воспроизводит точные концепции (dominance theory, vulnerability theory, sharia/fiqh distinction). SDR заменяет именные теории обобщёнными формулировками.


Развёрнутый пример 4: Task 28 — Process Tracing vs Bayesian (SDR 15.8% vs Gemini 49.0%)

Вопрос

Analyze the methodological tensions between process tracing as articulated by Andrew Bennett and Jeffrey Checkel versus Bayesian approaches to causal inference championed by Judea Pearl and James Mahoney. Specifically: How do these frameworks operationalize “mechanisms”? How do they handle equifinality and confounder identification differently? Provide empirical applications (Skocpol’s revolutions, QCA tradition, democratic breakdowns). Assess how post-2010 critiques have reshaped protocols and current consensus.

Что Gemini написал (из параметрической памяти):

For Bennett and Checkel, mechanisms are "entities and activities organized such
that they are productive of regular changes." They operationalize through
"causal chain" logic, looking for smoking guns, hoop tests.

Pearl argues this is insufficient and prone to "collider bias." He insists on the
back-door criterion: one must identify a set of variables that blocks all
non-causal paths between X and Y.

Pearl's SCM approach handles equifinality via "functional mapping"—if two different
paths produce the same Y, they are distinct structural equations identifiable via
different instrumental variables.

Ragin's QCA: Boolean algebra, set theory, INUS conditions.

The "Gold Standard" is now Bayesian Process Tracing (BPT)  researcher uses
cross-case statistical distribution as "Prior", within-case "Smoking Gun" evidence
to update probability.

Что SDR написал (из веб-поиска):

Беннетт и Чекель определяют PT как использование свидетельств внутри отдельного
кейса для вынесения суждений о причинно-следственных связях [1, 2]. Школа Махони
и Перла опирается на байесовскую логику, где вывод строится как обновление
вероятностей [2, 3].

DAGs позволяют визуализировать структуру причинно-следственных связей и
интегрировать качественные данные. Использование примера «спринклера» Перла
иллюстрирует, как байесовские сети помогают отсеивать ложные корреляции [3].

QCA: «множественная конъюнктурная каузальность» [6].

Критерии, где SDR провалился, а Gemini нет (14 штук):

  • pt-mechanism-definition (+20): Gemini — “entities and activities organized such that they are productive of regular changes.” SDR — “последовательность событий и действий” (неточная парафраза, не каноническое определение)
  • bayesian-scm-mechanism-definition (+20): Gemini — structural functions/edges in DAGs, Natural Direct vs Indirect Effects. SDR — “обновление вероятностей через DAGs” (слишком обобщённо)
  • dag-adjustment-set-criteria (+10): Gemini — back-door criterion, front-door criterion explicit. SDR — “визуализировать связи и отсеивать корреляции” (без конкретных критериев)
  • bayesian-identification-criteria (+10): Gemini — back-door, front-door, do-calculus, mediation analysis. SDR — ни один не назван конкретно
  • qca-boolean-set-theory (+10): Gemini — Boolean algebra, set theory, INUS conditions. SDR — “множественная конъюнктурная каузальность” без формализма
  • post-treatment-conditioning-definition (+10): Gemini — определил как conditioning on mediators. SDR — упоминает термин без определения
  • selection-bias-dv-critique (+10): Gemini — selection on dependent variable. SDR — “селективный отбор кейсов” без уточнения ключевого пункта
  • pt-confounder-sequencing-footprints (+10): Gemini — rival mechanisms, within-case sequencing. SDR — привязывает конфаундеры к DAGs (Pearl), а не к PT
  • bayesian-formalization-fairfield-charman (+8): Gemini — explicit likelihood ratios, posterior updating. SDR — “байесовское обновление” без формализации
  • formal-integration-operationalization (+8): Gemini — BIQQ, Integrated Inferences framework. SDR — общие упоминания nested analysis

Root cause: Задача требует точных канонических определений из конкретных методологических работ (Bennett & Checkel, Pearl, Ragin). Gemini воспроизводит определения дословно из параметрической памяти. SDR находит обзорные статьи, которые пересказывают эти методы обобщённо, теряя точную терминологию и формализм (back-door/front-door criterion, INUS conditions, BPT).


Развёрнутый пример 5: Task 1 — Staggered DiD methodology (SDR 12.0% vs Gemini 33.4%)

Вопрос

I’m examining the methodological tensions in Difference-in-Differences (DiD) estimation following the “staggered adoption” critique articulated by Goodman-Bacon (2021) and subsequent work by Callaway and Sant’Anna, Sun and Abraham, and Borusyak et al. Specifically, analyze how these solutions handle heterogeneous treatment effects and dynamic treatment timing differently. Compare performance assumptions regarding parallel trends, treatment effect homogeneity, and anticipation effects. Assess methodological dominance across top journals 2020-2024. Address Roth’s (2022) pre-trend concerns.

Что Gemini написал (из параметрической памяти):

Callaway & Sant'Anna estimates group-time average treatment effects ATT(g,t)
for each cohort g in each period t. Uses only clean controls (never-treated or
not-yet-treated).

BJS (Imputation): estimates TWFE model only on untreated observations to predict
counterfactual Y(0) for treated units. Achieves efficiency gains by pooling all
untreated observations including pre-treatment periods.

Sun & Abraham: intuitive OLS-based implementation, common default for plotting
dynamics (event-study plots).

Callaway & Sant'Anna is the "New Industry Standard"  highest adoption rate,
user-friendly R/Stata packages (csdid).

Roth (2022): Advises displaying pre-trend estimates but avoiding conditioning
main inference on pass/fail tests. "Honest DiD" sensitivity analysis.

Что SDR написал (из веб-поиска):

Метод Callaway & Sant'Anna базируется на агрегации групповых эффектов (group-time
average treatment effects). Основное внимание — «дважды робастным» (doubly robust)
оценкам [6, 5, 7].

Борусяк и соавторы предложили эффективный оцениватель в форме импутации [8, 9].
Контрфактуал оценивается на основе данных контрольной группы и наблюдений до
воздействия.

В журналах «большой тройки» (AER, QJE, JPE) наблюдается стремительный переход
от TWFE к новым робастным оценивателям.

Критерии, где SDR провалился, а Gemini нет (13 штук):

  • cs-att-gt-estimation (+10): Gemini — “estimates ATT(g,t) for each cohort g in each period t”. SDR — “агрегация групповых эффектов” (без формулы ATT(g,t))
  • cs-clean-controls-then-aggregate (+10): Gemini — “uses only clean controls (never-treated or not-yet-treated)”. SDR — не объяснён механизм чистых контролей
  • bjs-imputation-two-step (+10): Gemini — “estimates only on untreated then imputes Y(0)”. SDR — “контрфактуал на основе контрольной группы” (без two-step объяснения)
  • precise-econometric-terminology (+10): Gemini — exact terms: ATT, TWFE, cohort-specific effects. SDR — использует русскую терминологию, упрощает
  • bjs-efficiency-from-pooling (+8): Gemini — “pooling all untreated observations”. SDR — “высокоэффективный” без объяснения почему
  • sa-familiar-ols-implementation (+8): Gemini — “OLS-based, default for dynamics plots”. SDR — “interaction-weighted event-study” без OLS
  • assumption-strength-hierarchy (+8): Gemini — ranked: “CS nonparametric > BJS additive FE”. SDR — перечислил предположения без ранжирования
  • multiple-dominance-perspectives (+8): Gemini — 2+ competing views. SDR — “стремительный переход” в одностороннем ключе
  • strategic-triangulation-roles (+8): Gemini — “SA for dynamics, CS for transparency, BJS for efficiency”. SDR — описал как выбор, не как триангуляцию
  • display-pretrends-without-gating (+8): Gemini — “displaying pre-trends without conditioning”. SDR — упоминает Roth, но без конкретной рекомендации

Root cause: Эконометрическая задача требует точного формального языка — ATT(g,t), imputation two-step, clean controls, pooling. Gemini использует каноническую англоязычную терминологию из оригинальных статей. SDR находит обзорные источники и пересказывает методы на русском языке, теряя точные определения и формализм. Дополнительно: русский вывод штрафуется за отсутствие “exact econometric terminology”.

Choose icon