读完本文,你会搞懂为什么大多数 AI 智能体项目上线即失败,以及 Salesforce 从 2 万次生产部署中总结出的 12 条法则。
━━━ ━━━ ━━━
大多数 AI 智能体(Agentic AI)的部署失败,不是 AI 失败,而是架构失败。
这是 ZDNet 最新发布的深度文章的核心观点。作者 John Taschek(Salesforce 执行副总裁兼首席市场策略官),从 Salesforce 超过 20,000 次 AI 智能体生产部署中,提炼出了一套 12 条法则,用于衡量企业级 AI 智能体是否真正具备\"生产就绪\"的能力。
这篇文章不仅总结了规则,还揭示了为什么大多数 AI Pilot 在 Demo 时看起来惊艳,一上生产就跑不动。
背景:AI 怀疑论者比你想象的要多
Salesforce 一项研究发现,超过一半的美国上班族是 AI 怀疑论者。他们认为 AI 输出内容过于泛化、缺乏训练、信任度低。
与此同时,全球有超过 80% 的美国政府机构已经使用了 AI 智能体。多数政府领导者相信,到 2030 年,公共部门将由人类和 AI 智能体协同工作。
这个反差说明了什么?
- 员工不信任 AI,但组织层面却在大力推
- 问题不在人,而在部署方式
- 信任不是自然产生的——必须通过架构设计来建立
12 条法则详解
Taschek 将 12 条法则分为 4 个层级,从地基到顶层,层层递进:
🏗️ 第一层:Foundation——数据/上下文系统
法则 1:统一数据血缘(Unified Data Lineage)
每一条数据必须有可追溯的历史——从哪来、怎么变的、谁可以用。不要让「神秘数据」喂养你的智能体。
不追溯来源的数据 = 不可靠的 AI 判断。
法则 2:实时数据接入(Grounded Real-time Data Access)
智能体必须使用实时数据,而不是过期的快照。用过时信息做决策是设计缺陷,不是小问题。
这一条直击很多 AI Pilot 的软肋——Demo 用的是精心准备的数据,但上生产后面对的是实时的、混乱的数据。
法则 3:语义元数据(Semantic Metadata)
智能体需要理解数据的含义,而不只是原始值。\"高风险客户\"或\"合格账户\"必须被形式化定义,而不是靠模型去猜。
⚙️ 第二层:Core——智能体系统
法则 4:可观测性/行为可追溯(Observability)
智能体的每一个决策都应该被记录和解释。你必须能回溯并理解它为什么这么做。
没有可观测性,出了问题只能\"重启试试\"。
法则 5:持续对抗验证(Continuous Adversarial Validation)
不断地测试智能体的边界情况、恶意输入和对抗场景——不是只在发布前测一次,而是要持续进行。把它当作一个永久的红队演练。
法则 6:多步推理/目标分解(Multi-step Reasoning)
智能体必须能把复杂目标分解成步骤并执行——如果过程中情况有变,要能自适应,而不是死板照脚本。
法则 7:混合确定性治理(Hybrid Deterministic Governance)
AI 推理是概率性的,但有些规则不可弹性。法律、财务、安全相关的护栏必须是硬编码的——智能体应该在架构层面就无法违反它们。
这是最重要的法则之一。不能用\"希望模型明白不能这样做\"来替代硬约束。
🔧 第三层:Operations——工作系统
法则 8:供应商无关的编排(Agnostic Orchestration)
来自不同厂商和模型的智能体需要在无定制集成的情况下协作。避免在编排层被锁定。
法则 9:人机协同/共情指令(Human-Agent Synergy)
智能体应该与人类协作,而不是取代人类。当置信度低或检测到情感上下文时,应优雅地交接上下文给人类,而不是冷冰冰的转移。
法则 10:主权智能体(Sovereign Agency)
企业必须保持控制权——数据驻留、模型选择、身份认证和策略。外部智能体只能获得受限、可审计的访问权限。没有任何东西默认可信。
法则 11:基于成果的评估(Outcome-based Parity)
用业务成果衡量智能体(影响的收入、解决的问题、节省的时间),而不是完成的任务数。标尺是真实世界的影响。
🏆 第四层:Apex——交互系统
法则 12:可信智能体(Trusted Agency)
这是权重最高的法则。智能体通过以下方式赢得行动权:
- 算法公平性——无跨保护群体的偏见
- 毒性与内容安全——输出前进行内容过滤
- 同意与数据权限——尊重客户同意的范围
- 幻觉预防——高风险场景下不允许胡编乱造
- 可解释性——任何人(监管者、客户、顾问)都能理解为什么
- 利益相关者价值——结果必须惠及客户,而不仅仅是企业
- 供应商问责制——责任在事前分配,而不是事后扯皮
法则的金字塔结构
┌─────────────────┐ │ Trusted Agency │ ← 顶层:信任
│ (法则 12) │
├─────────────────┤ │ Operations │ ← 运营层:编排、协同、主权、评估
│ (法8-11) │
├─────────────────┤ │ Core │ ← 核心层:可观测、对抗测试、推理、治理
│ (法4-7) │
├─────────────────┤ │ Foundation │ ← 地基:数据血缘、实时数据、语义元数据
│ (法1-3) │
└─────────────────┘
这个金字塔不能倒过来建。 如果底层数据基础没打好,顶层信任就无从谈起。
为什么大多数 AI Pilot 失败?
文章指出最典型的失败模式:
1. 数据基础缺失(法则 1-3)
- Pilot 在控制环境下表现完美——用精心准备的干净数据
- 一上生产,面对真实数据就垮掉
- 没有统一的数据血缘 → 智能体不知道自己在操作什么
2. 不可观测(法则 4)
- Pilot 出错了,团队不知道\"为什么\"
- 没有日志回溯 → 无法调试、无法辩护、无法改进
3. 缺乏持续对抗测试(法则 5)
- Pilot 只在\"阳光场景\"下测试过
- 没人测试恶意输入、边缘情况
- 对抗测试被视为\"额外工作\"而被跳过
4. 缺乏硬约束(法则 7)
- 团队依赖模型\"知道\"什么不该做
- 直到有一天 AI 智能体批准了不该批准的事情
- 治理是出了事故后加上去的——代价远高于一开始就建好
5. 信任从未建立(法则 12)
- 大多数 Pilot 关注能力和速度
- 跳过了公平性测试、同意执行、幻觉预防和可解释性
- 出了问题,没有信任架构来兜底
一次在监管或面向客户场景中的错误输出,程序就彻底终止了。
解读:为什么这 12 条法则重要?① 从「能工作」到「能信任」
当前行业对 AI 智能体的评价标准是:它能不能完成任务?
Taschek 的评价标准是:即使它能完成,你敢不敢让它自主运行?
这两者之间的差距,就是这 12 条法则要解决的问题。
② 借鉴了关系数据库的智慧
Taschek 坦言他受 Codd 的 12 条关系数据库法则(1985 年提出)的启发。Codd 的法则让关系数据库从一堆混乱的存储系统中脱颖而出,成为了 Today 的标准。
同样,AI 智能体现在也处于\"混战期\"——每个厂商都有自己的一套说法。Taschek 的 12 条法则试图为 AI 智能体建立一个类似的关系型基准。
③ 最实用的条款
对于正在做 AI 项目的团队,最实用的几个原则:
- 法则 1-3 是前提条件:你无法跳过它们。如果数据还没治理好,先别上 AI 智能体。
- 法则 7 是底线:把法律和安全规则硬编码,而不是靠模型承诺。
- 法则 9 区分了实用和噱头:好的 AI 智能体知道什么时候应该交给人类。
- 法则 12 是终极目标:信任是最重要的\"元法则\"。
参考来源
- ZDNet. *12 rules of agentic AI for successful enterprise transformation*. 2026-06-25. https://www.zdnet.com/article/12-rules-of-agentic-ai/
- ZDNet. *US workers are the world\'s biggest AI skeptics - and it\'s not just about job loss*. https://www.zdnet.com/article/us-workers-are-worlds-biggest-ai-skeptics/
- ZDNet. *Moving from AI pilots to business-wide value: Accenture research*. https://www.zdnet.com/article/moving-from-ai-pilots-to-business-wide-value-accenture-research/
- ZDNet. *Government adoption of AI agents may outpace the private sector*. https://www.zdnet.com/article/government-adoption-of-ai-agents-may-outpace-the-private-sector/
- ByteByteGo. *What Salesforce learned from 20,000 agent AI deployments*. https://blog.bytebytego.com/p/what-salesforce-learned-from-20000
- Codd\'s 12 Rules (Wikipedia). https://en.wikipedia.org/wiki/Codd%27s_12_rules
- Informatica. *CDO survey: data quality and retrieval issues as AI agent barriers*. https://www.zdnet.com/article/execs-increase-data-management-investment-to-support-agentic-ai-adoption/
━━━ ━━━ ━━━
后记: 这篇文章的 12 条法则让我想了很多。我们经常纠结\"用什么模型\"、\"花多少钱\"、\"怎么最快调通\",但这些都不是最根本的问题。最根本的问题是:你的 AI 系统值得信任吗? 这 12 条法则提供了一套非常实用的检查清单——发布前逐条核对一遍,能省去后面 90% 的麻烦。