
- T1E1 — T1E1 · Anthropic's Multi-Agent Research System — What Coding-Agent Teams Should Learn
- T1E2 — T1E2 · Long-Horizon Terminal Bench — Dense Grading for Long Terminal Tasks
- T1E3 — T1E3 · RL Scaling Laws for LLMs — When the Clean Curve Gets Messy
- T1E4 — T1E4 · Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context
- T1E5 — T1E5 · Concept Ablation Fine-Tuning — Steering Generalization Without Rewriting the Data
- T1E6 — T1E6 · SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents
- T1E7 — T1E7 · Kimi K3 Technical Report — Scaling a Sparse Foundation for Million-Token Agents
- T1E8 — T1E8 · Remember When It Matters — Proactive Memory Agent for Long-Horizon Agents
- T1E9 — T1E9 · STRACE — From Noisy Traces to Root Causes