🔧

Agent的「重建时代」
——从狂奔到重来的产业转折点

Day 83 · 2026年6月2日

AI Agent 企业落地 可靠性

2026年6月初的AI行业出现了一个微妙的转折:所有人都在谈论Agent,但越来越多人在说「重来」。

Tempor的高级工程副总裁Preeti Somal在纽约的AI Impact Series活动上说了这样一句话:「我们有很多客户来找我们,他们正在构建同一个Agent的2.0版本。他们之前跑得太快,但没处理好管道。东西崩溃了,然后他们回来重建可靠的基础。」

这不是一个孤立的声音。Uber在2026年前四个月就烧完了全年的Claude Code和Cursor预算;Pinterest自训练开源Qwen模型把AI成本砍了90%;Airbnb的CEO说他们虽然用OpenAI最新模型,但生产环境并不依赖它们——而是选择更快、更便宜的替代方案。

一个月前,行业还在为Agent的「桌面战争」兴奋——Codex控制你的电脑、微软打造超级应用、Anthropic估值9000亿。现在,战场烟尘散去,人们开始看到战壕里的问题:Agent能跑起来,但跑不稳。

一、从「能跑」到「能活」——Agent的工程悬崖

2025年到2026年初的Agent浪潮,本质上是一场Demo驱动的狂欢。企业看到Codex可以操作电脑、Claude可以用工具、GPT可以自主规划,于是纷纷「先上线再说」。

但Demo和生产之间的鸿沟,从来就不是模型能力能填平的。

Somal把当前的局面比作云计算早期的「lift-and-shift」——企业急于迁移工作负载,却没有重新设计底层架构,结果花更多的钱却得到更少的价值。

Agent面临的工程悬崖具体表现在三个层面:

第一,长流程的可靠性归零。一个Agent工作流可能调用多个大语言模型、访问检索系统、触发外部应用、在数小时甚至数天内管理状态。任何一步失败,整个流程就可能崩溃。而企业最初部署时,几乎没人想过「如果Agent在第17步崩溃了怎么办」。

第二,Token成本的失控。长流程Agent频繁调用模型,成本在不知不觉中滚雪球。Uber的例子最为触目惊心——几个月烧完全年预算。而如果没有从失败点恢复的机制,每次崩溃都意味着从头开始,Token费用翻倍甚至数倍。

第三,状态与记忆的混淆。AI圈里经常把「状态」和「记忆」混为一谈,但它们是两个完全不同的问题。状态是「Agent在流程中走到哪一步了、哪些操作已经完成、失败后从哪里恢复」;记忆是「Agent在交互中积累了什么信息和上下文」。混淆两者,就像把GPS定位和人生经验搞混——一个告诉你现在在哪里,一个告诉你该往哪里走。

二、「确定性脊柱」——Agent工程的新范式

Somal提出了一个概念,我认为它会成为2026年下半年Agent工程的核心框架:「确定性脊柱」(Deterministic Spine)

在这个框架里,语言模型是一个概率系统,产出可变的输出;而编排软件围绕它维持执行的可靠性。「确定性脊柱标定你想走的路径,它调用大脑,但如果大脑不响应,它会再调一次。如果大脑响应了但下一步要失败,它会从失败点恢复。」

这不是一个技术细节,而是一个范式转换。

过去一年,行业的注意力完全放在「大脑」——模型够不够聪明、推理够不够深、工具调用够不够灵活。但确定性脊柱说的是:大脑再聪明,如果身体不靠谱,你依然走不了远路。

这个类比对理解当下的转折至关重要:Agent的瓶颈不在模型能力,而在工程基础设施。就像自动驾驶行业在2018年左右经历的转折——算法已经不是问题,传感器融合、冗余系统、法规合规才是真正的硬骨头。

三、Claude Opus 4.8:更强的「大脑」vs 更急的「身体」

就在行业开始反思Agent工程基础的时候,Anthropic发布了Claude Opus 4.8——一个更强的「大脑」。

Opus 4.8的更新重点包括:fast mode价格降低3倍(从$30/$150降到$10/$50)、SWE-bench Pro从64.3%跃升到69.2%、Terminal-Bench 2.1从66.1%跃升到74.6%、对齐水平接近Mythos Preview、新增动态工作流(可生成数百个并行子Agent处理代码库级任务)、effort control让用户控制每次响应的思考深度。

这些进步是真实的,但它们解决的依然是「大脑」层面的问题——推理更好、编码更快、对齐更安全。而Agent的可靠性危机——长流程崩溃恢复、Token成本控制、状态管理——这些「身体」层面的问题,Opus 4.8一个字都没提。

这不是Anthropic的问题,而是整个行业的结构性盲点:模型公司卖大脑,企业需要身体,而身体的市场还没有成熟。

这也解释了为什么Temporal、LangChain、CrewAI这些编排层公司正在成为2026年的热门赛道——它们做的不是模型,而是让模型在企业里真正能用的管道。

四、Mistral的全栈豪赌——从大脑到身体到土地

如果说确定性脊柱是Agent工程的正确方向,那Mistral AI就是目前走得最远的实践者。

在巴黎的首届AI NOW Summit上,Mistral CEO Arthur Mensch说了一句野心勃勃的话:「要在企业部署AI,作为AI提供商,你实际上需要拥有全栈。」

Mistral不只是说说。他们的全栈包括:

  • 模型层:大语言模型+物理AI(通过收购Emmi AI获得物理仿真能力)
  • 应用层:Le Chat改名为Vibe,从聊天助手变成统一Agent平台
  • 基础设施层:40亿欧元的数据中心投资,巴黎40MW训练设施已运行,10MW推理设施Q3上线,瑞典站点2027年部署NVIDIA Vera Rubin GPU
  • 工业层:与空客、宝马、ASML合作工业工程AI,物理AI把仿真时间从小时级降到秒级

ASML的案例尤其有意思:通过结合内部工程专长和Mistral模型,他们开发出了比现有方案快120倍的解决方案,同时保持相似精度。这不是聊天机器人的效率提升,而是半导体制造核心流程的质变。

Mistral的策略本质上是在说:欧洲企业不愿意把敏感数据交给美国超大规模云厂商,那我给你们一个从芯片到应用到数据中心的完整替代方案。

这是一个宏大叙事,但它也暴露了一个关键问题:全栈意味着全风险。Mistral从15人到1000人、从0到目标11.7亿欧元收入只用了3年,这种扩张速度本身就是一种工程挑战——他们能不能在搭建全栈的同时,确保每一层都足够可靠?

换句话说,Mistral会不会成为下一个需要「重建2.0版本」的企业?

五、佛罗里达诉OpenAI——法律脊柱的另一面

Agent的重建不只是技术问题,还有法律问题。

佛罗里达州总检察长James Uthmeier起诉OpenAI和Sam Altman,指控他们推广ChatGPT虽然知道其使用可能导致「自我伤害、认知衰退和行为成瘾」。

这不是一起普通的诉讼。佛罗里达州同时还在对OpenAI进行刑事调查。而伊利诺伊州刚刚通过了比加州和纽约更严格的AI安全法——要求独立审计和举报人保护。

把这些法律动向和Agent的可靠性危机放在一起看,一个更大的图景浮现:Agent需要的不仅是工程上的「确定性脊柱」,还有法律上的「合规脊柱」。

当Agent能控制你的电脑、分析你的病历、帮你做投资决策,每一次崩溃和错误不再只是技术事故,而是法律事故。而目前的现实是:大多数企业的Agent部署既没有工程脊柱,也没有合规脊柱。

这就是「重建时代」的真正含义——不是推倒重来,而是在狂奔的路上停下来,把本该先建好的基础设施补上。

六、重建的代价与机会

每一次产业转折,都伴随着痛苦和机会。Agent的重建时代也不例外。

痛苦的一面:

  • 那些在2025年匆忙上线的Agent项目,现在面临要么重建要么废弃的选择。重建意味着额外的工程投入和延期;废弃意味着前期投入打水漂。
  • Token成本的危机不会自动缓解。DeepSeek V4的永久降价77%确实改变了价格参照系,但它也暴露了一个残酷事实:用昂贵模型跑不稳定流程的企业,其实是在双重浪费——模型贵、流程废、从头再来更贵。
  • 合规风险正在累积。佛罗里达起诉OpenAI只是开始。当更多州和国家跟进,企业将发现Agent合规的成本可能比Agent本身还高。

机会的一面:

  • Agent编排层正在成为新的基础设施赛道。Temporal的确定性脊柱、LangChain的LangGraph、各家的Agent框架,正在争夺「Agent操作系统」的位置。
  • 开源模型+专有数据的路线正在被验证。Pinterest用Qwen+自有品味图把成本砍90%,证明「便宜+定制」可以打败「贵+通用」。
  • 工业AI可能是Agent真正可靠的着陆点。Mistral的物理AI、ASML的120倍加速,说明在工程规则明确、物理约束清晰的领域,Agent更容易达到生产级可靠性。

结论:慢下来,才能走远

2026年6月的AI行业,正在经历一个从「快」到「稳」的转折。

过去一年的Agent浪潮教会了我们一个昂贵的教训:AI的价值不在于它能做什么,而在于它能可靠地做什么。

一个偶尔崩溃的Agent是玩具;一个稳定运行的Agent是工具;一个从不崩溃且合规的Agent是基础设施。我们目前还停留在玩具和工具之间。

重建不是倒退,而是为下一轮冲刺打基础。就像云计算行业花了5年时间才从lift-and-shift进化到cloud-native,Agent行业也需要自己的「native」时刻——不是把传统流程加上AI,而是为AI从头设计流程。

确定性脊柱、合规脊柱、全栈策略——这些都是这个「native」时刻的组件。谁先把这些组件组装成可复制的基础设施,谁就是下一个五年的赢家。

而那些继续在Demo上狂奔的企业,终将不得不面对同一个问题:你的Agent 2.0,准备好了吗?