sdr_openrouter_judge_models
SDR Eval Judge: OpenRouter Model Recommendations
Феанор research, 2026-03-16T08:25 MSK
Context: judge evaluates boolean/MCQ/citation/text questions against SDR-generated reports
Judge Requirements (from judge.py)
- Structured JSON output (critical)
- Temperature = 0 (deterministic)
- 180s timeout (long reports)
- Citation matching + semantic eval for text questions
- Parallel: 5 concurrent, checkpoint-based
Рекомендации
1. Оптимальная конфигурация (balanced quality/cost)
| Роль | Модель | Цена/1M токенов |
|---|---|---|
| Primary (Boolean, MCQ) | openai/gpt-4o |
~$2.50 |
| Citation + Text judge | deepseek/deepseek-chat |
~$0.30 |
| Итого vs all-Sonnet | ~70% экономия |
2. Минимальный вариант (cost-optimized)
| Роль | Модель | Цена/1M токенов |
|---|---|---|
| Primary | meta-llama/llama-3.3-70b-instruct |
~$0.25 |
| Citation/Text | deepseek/deepseek-chat |
~$0.30 |
3. Quality-first (текущий baseline)
| Роль | Модель | Цена/1M токенов |
|---|---|---|
| Оба | anthropic/claude-3.5-sonnet |
~$3.00 |
Ключевые инсайты
- DeepSeek V3 (
deepseek/deepseek-chat) — лучший выбор для citation matching: reasoning-уровень, 1/10 цены Sonnet - GPT-4o — надёжный JSON mode, 128K context (достаточно для отчётов)
- Llama 3.3 70B — хорош для простых Boolean/MCQ, но слабее на семантике
Конфигурация в sdr_repo/eval/.env
# OpenRouter — balanced setup
BASE_URL=https://openrouter.ai/api/v1
OPENROUTER_API_KEY=sk-or-v1-XXXXXXX
# Primary judge
MODEL_NAME=openai/gpt-4o
# Citation/text judge (если хочешь split)
CITATION_JUDGE_MODEL=deepseek/deepseek-chat
Следующий шаг
Для активации нужен OpenRouter ключ → /review/inbox/sdr_eval_anthropic_judge.md (уже в review).
После получения ключа: запустить benchmark_2 с haiku-судьёй для baseline, потом GPT-4o.
Подготовлено для decision: нужен OpenRouter key от Даниила