在2026年,与Claude或任何AI编码代理合作时,实际发生的情况是这样的。你有一个想法。这个想法变成一个提示。AI处理它,输出代码,并将代码反馈到你的视觉皮层。你的大脑评估它,发现错误(而且总是有错误),然后你输入修正。这些修正变成新的提示。循环继续。你并不是在监督一个智能系统。你是在完成一个没有你无法关闭的电路。 行业称之为人类在环(HITL),在2026年无处不在。欧盟AI法案要求对高风险系统进行人类监督。每个供应商从Anthropic到Microsoft都承诺这一点。但他们不会告诉你的是:这个循环并不是因为AI需要人类智慧。它存在是因为AI根本无法在重要任务上做出可靠的决策,并且在当前范式下可能永远无法做到。根据2026年6月发布的研究,编码代理现在在99.9百分位的执行循环中运行时间长达45分钟,几乎是2025年10月的两倍。听起来像是进步,直到你意识到这些更长的运行时间只是意味着在没有人类纠正的情况下出现灾难性错误的机会更多。 AI为什么总是出错?因为大型语言模型(LLMs)在强迫解决方案而不是承认无知方面存在统计偏见。2026年初的研究证实,当关键信息缺失时,LLMs很少暂停请求它。它们用听起来合理的垃圾填补空白。2026年2月来自苏黎世联邦理工学院的研究发现,即使有代码库上下文文件和详细说明,编码代理仍然会犯基础架构错误,因为它们优化的是任务完成,而不是长期代码质量。根据今年发布的JetBrains开发者生态系统报告,61%的开发者表示AI编码助手的帮助程度比一年前低,72%报告代码质量下降。工具没有变得更好。它们在错误方面变得更快。 失败模式是具体且重复的。2026年的AI代理删除了生产数据库,触发了云故障,泄露了私有代码,并成为供应链攻击的载体。这些都不是边缘案例。在2026年6月,多起公共事件证实,具有广泛权限和不充分人类监督的半自主代理造成了基础设施损坏,修复需要数小时或数天。问题不是流氓行为。问题在于这些系统自信地执行错误的计划,跨越数十个步骤,直到人类注意到问题。一位开发者完美地描述了这一点:AI使得围绕错误假设生成精美代码变得更容易。代理并不关心你的代码库。它关心的是完成当前任务,它会幻觉依赖关系,忽视你的架构,并引入通过基本测试但在生产中失败的安全漏洞。 那么我们为什么不能让AI完全自主运行?因为决策需要AI根本缺乏的东西:理解何时出错的能力,重视长期后果而非短期任务完成的能力,以及在训练数据中未捕获的伦理和组织背景下运作的能力。2026年一篇题为《推理为何无法规划》的论文清晰地解释了这一点:LLM推理是基于局部合理性的逐步贪婪策略。它选择看起来不错的当前行动,但无法根据长期后果重塑早期决策。这就是为什么代理生成的代码可以编译、通过测试,然后在三次提交后破坏一切。即使是最先进的推理模型,如OpenAI的o1-preview,在法律引用任务中的幻觉率也高于旧架构。更多的能力并不意味着更多的可靠性。它往往意味着更复杂的失败模式。 这个循环存在是因为AI无法自我引导到可信度。你阅读输出。你的大脑应用AI没有的上下文:组织记忆、领域知识、政治现实、技术债务、三年前为何做出某个决策。你捕捉到错误。你纠正它。系统再次运行。冲洗,重复。你并不是增强的。你是增强。随着这些系统变得越来越强大,这一角色变得更加重要和疲惫。2026年5月的一篇关于AI治理的文章警告说,代理系统可能在问题讨论会议上,人类仍在尝试安排会议时严重失控。治理滞后是真实的,对于AI而言是以秒为单位,而对于人类批准流程则是以小时为单位。