
- SE0 — Series Overview — The New Data Unit for Coding Agents
- T1E0 — T1E0 · Topic 1 Overview — Foundations of Agentic Coding
- T1E1 — T1E1 · From Code Generation to Agentic Work
- T1E2 — T1E2 · The Agent-Computer Interface
- T1E3 — T1E3 · Trajectories as Training Data
- T1E4 — T1E4 · SWE-bench — Real Issues, Real Repositories
- T1E5 — T1E5 · SWE-agent and the Agent-Computer Interface
- T1E6 — T1E6 · Aider Benchmark — Can the Model Fix Its Own Mistakes?
- T1E7 — T1E7 · GitHub Copilot Cloud Agent — From Session to Reviewable Work
- T2E0 — T2E0 · Evaluation and Code Review for Coding Agents
- T2E1 — T2E1 · How to Evaluate a Coding Agent in Practice
- T2E2 — T2E2 · Public Tests, Hidden Tests, and Oracle Tests
- T2E3 — T2E3 · Leaderboard Literacy
- T2E4 — T2E4 · Code Review Agents: The Other Half of Agentic Coding
- T2E5 — T2E5 · Evaluating Review Quality
- T2E6 — T2E6 · Code Review Benchmarks and Datasets
- T2E7 — T2E7 · SWE-bench Verified
- T2E8 — T2E8 · SWE-bench-Live
- T2E9 — T2E9 · Aider Polyglot Benchmark
- T2E10 — T2E10 · Terminal-Bench 2.0
- T2E11 — T2E11 · FeatureBench
- T2E12 — T2E12 · CodeClash
- T2E13 — T2E13 · LLM-as-a-Verifier
- T2E15 — T2E15 · CodeReviewer
- T2E16 — T2E16 · CodeReviewQA
- T2E17 — T2E17 · CodeFuse-CR-Bench
- T2E18 — T2E18 · CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
- T2E19 — T2E19 · SWE-PRBench
- T2E20 — T2E20 · CodeReviewBench: Planted Bugs, Two Judges
- T2E21 — T2E21 · Martian's Code Review Bench: Graded by Real Developer Behavior
- T2E22 — T2E22 · MetaMateCR: AI-Assisted Fixes to Code Review Comments at Scale
- T3E0 — T3E0 · Agent Systems, Harnesses, and Observability
- T3E1 — T3E1 · GitHub Copilot Coding Agent: From Task to Reviewable Work
- T3E2 — T3E2 · OpenAI Codex: Tasks, Workflows, and the Agent-First Loop
- T3E3 — T3E3 · Building a Multi-Agent Research System
- T3E4 — T3E4 · Effective Harnesses for Long-Running Agents
- T3E5 — T3E5 · Harness Design for Long-Running Application Development
- T3E6 — T3E6 · Harness Engineering in an Agent-First World
- T3E7 — T3E7 · Meta-Harness: End-to-End Optimization of Model Harnesses
- T3E8 — T3E8 · The Harness Problem
- T3E9 — T3E9 · Harness Engineering as a Discipline
- T4E0 — T4E0 · Training Signals and Improvement Studies
- T4E1 — T4E1 · CWM — Code Generation with World Models
- T4E2 — T4E2 · Debugging Code World Models
- T4E3 — T4E3 · SWE-Gym — Training Agents and Verifiers
- T4E4 — T4E4 · SWE-smith — Scaling Data for SWE Agents
- T4E5 — T4E5 · SWE-RL — Reinforcement Learning on Software Evolution
- T4E6 — T4E6 · Agent-RLVR — Guidance and Environment Rewards
- T4E7 — T4E7 · R2E-Gym — Procedural Environments and Hybrid Verifiers
- T4E8 — T4E8 · SWE-Hub — A Production System for Executable SWE Tasks
- T4E9 — T4E9 · Nemotron-Terminal — Data Engineering for Terminal Capability
- T4E10 — T4E10 · SWE-Bench Mobile
- T5E0 — T5E0 · Data Products for Agentic Coding Training
- T5E1 — T5E1 · The Agentic Coding Data Record
- T5E2 — T5E2 · Trajectory Data for Training and Analysis
- T5E3 — T5E3 · Verification and Review Labels
- T5E4 — T5E4 · From Production Telemetry to Training Data
- T5E5 — T5E5 · Governance and Splits
- T5E6 — T5E6 · The Six-Layer Content Schema