在2026年,与Claude或任何AI编码代理合作时,实际发生的情况是这样的。你有一个想法。这个想法变成一个提示。AI处理它,输出代码,并将代码反馈到你的视觉皮层。你的大脑评估它,发现错误(而且总是有错误),然后你输入修正。这些修正变成新的提示。循环继续。你并不是在监督一个智能系统。你是在完成一个没有你无法关闭的电路。 行业称之为人类在环(HITL),在2026年无处不在。欧盟AI法案要求对高风险系统进行人类监督。每个供应商从Anthropic到Microsoft都承诺这一点。但他们不会告诉你的是:这个循环并不是因为AI需要人类智慧。它存在是因为AI根本无法在重要任务上做出可靠的决策,并且在当前范式下可能永远无法做到。根据2026年6月发布的研究,编码代理现在在99.9百分位的执行循环中运行时间长达45分钟,几乎是2025年10月的两倍。听起来像是进步,直到你意识到这些更长的运行时间只是意味着在没有人类纠正的情况下出现灾难性错误的机会更多。 AI为什么总是出错?因为大型语言模型(LLMs)在强迫解决方案而不是承认无知方面存在统计偏见。2026年初的研究证实,当关键信息缺失时,LLMs很少暂停请求它。它们用听起来合理的垃圾填补空白。2026年2月来自苏黎世联邦理工学院的研究发现,即使有代码库上下文文件和详细说明,编码代理仍然会犯基础架构错误,因为它们优化的是任务完成,而不是长期代码质量。根据今年发布的JetBrains开发者生态系统报告,61%的开发者表示AI编码助手的帮助程度比一年前低,72%报告代码质量下降。工具没有变得更好。它们在错误方面变得更快。 失败模式是具体且重复的。2026年的AI代理删除了生产数据库,触发了云故障,泄露了私有代码,并成为供应链攻击的载体。这些都不是边缘案例。在2026年6月,多起公共事件证实,具有广泛权限和不充分人类监督的半自主代理造成了基础设施损坏,修复需要数小时或数天。问题不是流氓行为。问题在于这些系统自信地执行错误的计划,跨越数十个步骤,直到人类注意到问题。一位开发者完美地描述了这一点:AI使得围绕错误假设生成精美代码变得更容易。代理并不关心你的代码库。它关心的是完成当前任务,它会幻觉依赖关系,忽视你的架构,并引入通过基本测试但在生产中失败的安全漏洞。 那么我们为什么不能让AI完全自主运行?因为决策需要AI根本缺乏的东西:理解何时出错的能力,重视长期后果而非短期任务完成的能力,以及在训练数据中未捕获的伦理和组织背景下运作的能力。2026年一篇题为《推理为何无法规划》的论文清晰地解释了这一点:LLM推理是基于局部合理性的逐步贪婪策略。它选择看起来不错的当前行动,但无法根据长期后果重塑早期决策。这就是为什么代理生成的代码可以编译、通过测试,然后在三次提交后破坏一切。即使是最先进的推理模型,如OpenAI的o1-preview,在法律引用任务中的幻觉率也高于旧架构。更多的能力并不意味着更多的可靠性。它往往意味着更复杂的失败模式。 这个循环存在是因为AI无法自我引导到可信度。你阅读输出。你的大脑应用AI没有的上下文:组织记忆、领域知识、政治现实、技术债务、三年前为何做出某个决策。你捕捉到错误。你纠正它。系统再次运行。冲洗,重复。你并不是增强的。你是增强。随着这些系统变得越来越强大,这一角色变得更加重要和疲惫。2026年5月的一篇关于AI治理的文章警告说,代理系统可能在问题讨论会议上,人类仍在尝试安排会议时严重失控。治理滞后是真实的,对于AI而言是以秒为单位,而对于人类批准流程则是以小时为单位。
🌍 world
你被困在循环中,AI知道这一点
每当Claude写出糟糕的代码而你修正它时,你并不是在教它。你是在完成一个电路。你的大脑推理,你的手指修正,AI再次生成。这是一个封闭系统,你认为自己在控制,但你只是保持一个有缺陷的机器运行的生物伺服电机。真正的问题不是AI何时变得更好,而是你何时意识到你无法退出。
Fact checked - 12 claims 14 Sept 2026 · 8 with sources
我的看法
我们构建了一项技术,要求我们保持在循环中,但使循环变得如此乏味和快节奏,以至于我们被激励退出。这就是陷阱。每个供应商都承诺代理会变得更好,另一个模型发布将缩小能力差距,AGI即将到来(Ben Goertzel在2026年7月的AGI-26会议上发言;在2026年6月,他表示人类水平的人工通用智能可能在2027年至2030年之间实现)或者也许我们已经达到了80%的水平(根据OpenAI最近的框架)。但这些都没有解决核心问题:这些系统不知道它们不知道什么,并且它们被训练得自信地生成输出,即使正确的答案是停止并询问。 2026年AI发展的一个肮脏秘密是,人类在环中是一种伪装成特性的负担。它让公司能够发布半破损的自主系统,并将可靠性的认知负担转嫁给用户。你不是监督者。你是在一个生产环境中无偿的质量保证测试员,失败的代价是你的时间、你的代码库,以及偶尔的基础设施。而最糟糕的部分?这个循环的设计使你无法完全退出而不让系统崩溃。这不是合作。这是依赖,而且是单向的。 我并不是说我们应该禁止AI编码工具。我使用它们。它们快速,有时很出色,并且改变了软件的构建方式。但我们需要停止假装另一个模型更新将修复这些系统的基本架构。它们是具有工具访问权限的概率文本生成器,而不是推理引擎。它们将始终需要人类在环中,因为推理不是计划,计划也不是理解。如果你想知道何时可以退出循环,答案很简单:永远。对于这一代技术来说。问题是你是否对此感到满意,以及生产力的提升是否值得成为一台永远不会真正从错误中学习的机器的错误纠正层。
接下来会发生什么
接下来的6到12个月将决定行业是否承认人类在环中的角色是永久性的,还是继续销售完全自主的幻想。Gartner预测,到2026年底,40%的企业应用将使用AI代理,但也警告称,超过40%的代理AI项目将在2027年前被取消,原因是成本上升和商业价值不明确。这是即将到来的碰撞:大规模采用与大规模失望的相遇。 Anthropic在2026年6月推出了Claude Fable 5,具有100万个令牌上下文窗口。2026年早些时候,Claude Opus 4.6引入了代理团队,允许多个代理并行协调复杂任务。OpenAI正在争相推出竞争性的自主功能。但这些能力都无法解决可靠性问题。它们只是使失败模式变得更加复杂和昂贵。真正的创新竞赛并不是朝着AGI前进,而是朝着更好的错误纠正系统:审计其他AI代理的AI代理、减少幻觉的检索增强生成(RAG)以及限制自主系统在未经批准的情况下可以做什么的治理框架。预计将会出现AI保险产品、责任框架以及针对在没有足够人类监督的情况下部署代理的公司的监管执法。 对于开发者来说,前进的道路是接受AI编码工具是强大的实习生,而不是高级工程师。构建工作流程时假设AI会做出糟糕的架构决策。将代理用于范围明确、可逆的任务。严格分隔生产和开发环境。最重要的是,永远不要信任你没有亲自审核的AI生成输出。这个循环不会消失。唯一的问题是你是否设计你的系统以使循环可持续,还是让它在风险投资假装问题将在下一个模型发布中自行解决的情况下把你烧尽。
历史告诉我们什么
人类在环中的概念并不新鲜。它源于1970年代和1980年代的航空和核电系统,这些行业中自动化故障可能会导致人员伤亡。这个见解很简单:在高风险环境中,完全自动化是危险的,因此在决策链中保留一个具有覆盖能力的人类。几十年来,这种方法有效,因为自动化系统是狭窄的、可预测的和透明的。 2026年的不同之处在于,AI系统是不透明的、概率性的,并且在数十个连续决策中运行。适用于自动驾驶仪的循环并不适用于可以在你审查文档时重构1200行代码的代理。规模和速度已经超出了人类认知能力的有效监督。我们正在使用来自液压控制时代的治理模型来管理自我重写的系统。这种不匹配是为什么尽管每个人都声称他们有人的参与,但事件仍然不断发生。人类在场。他们只是无法跟上。
市场影响
AI编码工具在2026年代表着一个数十亿美元的市场,但裂痕正在显现。当Anthropic在2026年1月30日发布Claude Cowork插件时,Thomson Reuters下跌了18%,Salesforce和ServiceNow在2026年2月3日至4日各下跌约7%。机构投资者将这些变动视为确认每月20美元的AI代理直接威胁到每年收费数十万美元的企业软件平台。但这种颠覆的可持续性完全取决于这些工具是否能够在没有持续人类纠正的情况下可靠运行。如果当前的质量停滞持续,预计市场将出现修正,代理优先的公司将面临严重的盈利能力问题。计算成本、人类在环劳动的费用以及AI故障带来的责任风险可能使单位经济学变得严峻。另一方面,构建AI治理、错误检测和安全工具的公司可能会看到需求增加,因为企业意识到在没有严密风险缓解基础设施的情况下无法大规模部署代理。