William Liu · Podcasts

All podcasts · Series

Agentic Coding Capability: From Coding Models to Coding Agents

The series overview lays out the shared mental models and expert disagreements that recur throughout the podcast.

59 episodes 59 with audio
  1. SE0 — Series Overview — The New Data Unit for Coding Agents
  2. T1E0 — T1E0 · Topic 1 Overview — Foundations of Agentic Coding
  3. T1E1 — T1E1 · From Code Generation to Agentic Work
  4. T1E2 — T1E2 · The Agent-Computer Interface
  5. T1E3 — T1E3 · Trajectories as Training Data
  6. T1E4 — T1E4 · SWE-bench — Real Issues, Real Repositories
  7. T1E5 — T1E5 · SWE-agent and the Agent-Computer Interface
  8. T1E6 — T1E6 · Aider Benchmark — Can the Model Fix Its Own Mistakes?
  9. T1E7 — T1E7 · GitHub Copilot Cloud Agent — From Session to Reviewable Work
  10. T2E0 — T2E0 · Evaluation and Code Review for Coding Agents
  11. T2E1 — T2E1 · How to Evaluate a Coding Agent in Practice
  12. T2E2 — T2E2 · Public Tests, Hidden Tests, and Oracle Tests
  13. T2E3 — T2E3 · Leaderboard Literacy
  14. T2E4 — T2E4 · Code Review Agents: The Other Half of Agentic Coding
  15. T2E5 — T2E5 · Evaluating Review Quality
  16. T2E6 — T2E6 · Code Review Benchmarks and Datasets
  17. T2E7 — T2E7 · SWE-bench Verified
  18. T2E8 — T2E8 · SWE-bench-Live
  19. T2E9 — T2E9 · Aider Polyglot Benchmark
  20. T2E10 — T2E10 · Terminal-Bench 2.0
  21. T2E11 — T2E11 · FeatureBench
  22. T2E12 — T2E12 · CodeClash
  23. T2E13 — T2E13 · LLM-as-a-Verifier
  24. T2E15 — T2E15 · CodeReviewer
  25. T2E16 — T2E16 · CodeReviewQA
  26. T2E17 — T2E17 · CodeFuse-CR-Bench
  27. T2E18 — T2E18 · CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
  28. T2E19 — T2E19 · SWE-PRBench
  29. T2E20 — T2E20 · CodeReviewBench: Planted Bugs, Two Judges
  30. T2E21 — T2E21 · Martian's Code Review Bench: Graded by Real Developer Behavior
  31. T2E22 — T2E22 · MetaMateCR: AI-Assisted Fixes to Code Review Comments at Scale
  32. T3E0 — T3E0 · Agent Systems, Harnesses, and Observability
  33. T3E1 — T3E1 · GitHub Copilot Coding Agent: From Task to Reviewable Work
  34. T3E2 — T3E2 · OpenAI Codex: Tasks, Workflows, and the Agent-First Loop
  35. T3E3 — T3E3 · Building a Multi-Agent Research System
  36. T3E4 — T3E4 · Effective Harnesses for Long-Running Agents
  37. T3E5 — T3E5 · Harness Design for Long-Running Application Development
  38. T3E6 — T3E6 · Harness Engineering in an Agent-First World
  39. T3E7 — T3E7 · Meta-Harness: End-to-End Optimization of Model Harnesses
  40. T3E8 — T3E8 · The Harness Problem
  41. T3E9 — T3E9 · Harness Engineering as a Discipline
  42. T4E0 — T4E0 · Training Signals and Improvement Studies
  43. T4E1 — T4E1 · CWM — Code Generation with World Models
  44. T4E2 — T4E2 · Debugging Code World Models
  45. T4E3 — T4E3 · SWE-Gym — Training Agents and Verifiers
  46. T4E4 — T4E4 · SWE-smith — Scaling Data for SWE Agents
  47. T4E5 — T4E5 · SWE-RL — Reinforcement Learning on Software Evolution
  48. T4E6 — T4E6 · Agent-RLVR — Guidance and Environment Rewards
  49. T4E7 — T4E7 · R2E-Gym — Procedural Environments and Hybrid Verifiers
  50. T4E8 — T4E8 · SWE-Hub — A Production System for Executable SWE Tasks
  51. T4E9 — T4E9 · Nemotron-Terminal — Data Engineering for Terminal Capability
  52. T4E10 — T4E10 · SWE-Bench Mobile
  53. T5E0 — T5E0 · Data Products for Agentic Coding Training
  54. T5E1 — T5E1 · The Agentic Coding Data Record
  55. T5E2 — T5E2 · Trajectory Data for Training and Analysis
  56. T5E3 — T5E3 · Verification and Review Labels
  57. T5E4 — T5E4 · From Production Telemetry to Training Data
  58. T5E5 — T5E5 · Governance and Splits
  59. T5E6 — T5E6 · The Six-Layer Content Schema