<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>AIAgent on 魔都水滴</title>
    <link>https://blog.margrop.net/tag/aiagent/</link>
    <description>Recent content in AIAgent on 魔都水滴</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Sat, 15 Aug 2026 09:00:00 +0800</lastBuildDate>
    <atom:link href="https://blog.margrop.net/tag/aiagent/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>模型天天换，验收没人干：为什么「会不会验收 AI 写的代码」比「选哪个模型」重要 10 倍</title>
      <link>https://blog.margrop.net/post/ai-code-review-bottleneck-acceptance-over-model/</link>
      <pubDate>Sat, 15 Aug 2026 09:00:00 +0800</pubDate>
      <guid>https://blog.margrop.net/post/ai-code-review-bottleneck-acceptance-over-model/</guid>
      <description>先说结论&#xA;这两年我把市面上的 Coding Agent 几乎用了个遍：Claude Code、Codex、Cursor、Gemini CLI、OpenClaw……模型换了一茬又一茬，跑分榜天天刷新。但我越来越确信一件事：真正决定你能不能用好 AI 的，不是你选了哪个模型，而是你有没有一套「验收 AI 写的代码」的本事。 模型负责把代码「生」出来，验收负责把代码「放生」出去。前者 AI 已经做得又快又便宜，后者恰恰成了整个流水线里最卡脖子的环节。本文聊聊这个瓶颈是怎么形成的、AI 代码最常踩的 6 种坑、以及我自己在用的四层验收体系和一张工位清单。&#xA;图 1：本文主视觉——AI 像传送带一样 24 小时不间断产出 PR，而人类拿着放大镜一个一个验。自制文章配图。&#xA;1. 问题背景：我们都得了「模型选择困难症」 先坦白，我曾经是个重度「模型党」。&#xA;每次新模型发布，我比谁都积极：刷榜、看跑分、翻 X 上的测评帖，然后把同样的需求分别丢给三四个 Agent，对比谁的代码更优雅、谁的思路更「像我」。我甚至给不同任务维护了一张「模型-任务匹配表」：重构用 A，写测试用 B，查 bug 用 C，改文案用 D。&#xA;听起来很专业对吧？直到有天我复盘一个线上事故，发现一个尴尬的事实：那次出问题的代码，恰恰是我用「当时跑分最高的模型」生成的。 而它出问题的原因，不是模型不够聪明，是我当时看它「写得挺像那么回事」，扫了一眼就合并了。&#xA;那一刻我突然意识到：我一直在优化「生产端」，却对「验收端」零投入。这就好比一个餐厅老板，天天研究换更好的炒菜机器人，却从来不管端出去的菜有没有人尝过咸淡。菜炒得再快，试菜员不尝，早晚出事。&#xA;2. 问题表现：验收，成了新的拥堵点 当你开始用 Coding Agent，一个微妙的角色转变发生了：你从「写代码的人」变成了「审代码的人」。&#xA;以前一天写 200 行，现在 Agent 一小时给你吐 2000 行。生成的环节被压缩到了几分钟，但「看懂这 2000 行到底干了什么、敢不敢合进去」的环节，一点没压缩，反而因为量大而被无限拉长。整个流水线的瓶颈，从「生产」悄悄迁移到了「验收」。&#xA;图 2：瓶颈迁移——生成环节被 AI 压缩到几分钟，验收环节却越堆越高。自制示意图。&#xA;这不是我一个人的体感。2026 年 6 月，The New Stack 发了一篇标题就很扎心的文章：《How long before we stop reading the code?</description>
    </item>
  </channel>
</rss>
