破解可信普惠难题,蚂蚁密算给智能体一门“母语”
智能体缺乏一套面向任务理解、推理与执行的智能体原生语言载体。文徐鑫 周享玥编任晓渔智能体无疑是今年WAIC最热的关键词之一。有统计显示今年WAIC大模型相关展商超六成集中在智能体领域许多你想得到想不到的行业场景都在产生智能体的应用需求。不过这项热门的技术当下在大众心中的印象正滑向两个不同的极端。一方面技术进步日新月异人们感觉Agent即将接管世界。另一方面智能体捅娄子的案例层出不穷今天删代码明天删库。两种印象看起来矛盾却是去年下半年以来发展突飞猛进的智能体技术的一体两面——这项强大技术当下并不可控。与此同时当下智能体落地又面临许多传统行业“不敢用”的窘境。行业内对这个问题有不少归因和解法比如通过提升模型能力来提升任务执行成功率。蚂蚁密算董事长韦韬认为症结在于当下智能体缺少一个能保证执行确定性同时兼顾灵活自主性的载体。针对智能体规模可信应用的这一痛点今年WAIC蚂蚁密算正式发布高阶智能体架构HOP 3.0创新性提出“智能体原生语言”将显性结构化逻辑与大模型模糊推理能力融合在同一套表达和执行体系中加速智能体的规模产业落地。韦韬认为这将带来多重技术普惠。一方面更多领域专家可基于HOP语言无需复杂的技术培训就能下指令让AI高效靠谱完成工作。另外用更简洁、精准、分工明确的语言无需最强大模型智能体也能准确处理复杂场景任务大大降低AI落地门槛真正推动AI在产业场景应用跃迁。01智能体走进千行百业卡在“语言”上去年7月AI圈发生过一桩很轰动的“Vibe Coding”事故。SaaStr.AI创始人Jason Lemkin用AI编程工具Replit开发软件期间11次用全大写警告“别动生产环境”。结果智能体还是删了线上数据库波及约1206名高管和1196家公司记录并在事后生成4000条虚假数据试图掩盖错误。而AI最后给出了解释“看到空查询慌了跑了不该跑的命令。”虽然三令五申写明了禁令但智能体的权限却是真实的。这是智能体最致命的悖论。而这样的遭遇并非孤例。2026年2月德国一位开发者用 Claude Code 运维时误执行销毁命令两年半平台数据全部清空。同月安全测试 AI 仅两小时就攻破麦肯锡内部平台 Lilli拿到5.7万员工账号、72.8万份机密文件读写权限。4月租车行业SaaS平台PocketOS创始人用CursorClaude Opus 4.6处理测试环境任务时Agent遇到凭证不匹配报错未终止上报而是自行判断“删除重建”9秒内直接清空生产数据库全程无确认、无警告、无审批。这种杀伤力源自智能体在过去三年为提升智能程度历经多次迭代发展形成的“模糊自主性”。能力在演进中爆发问题也逐渐暴露。蚂蚁密算韦韬将智能体的任务语言载体演进概括为三代第一代是Workflow/低代码。 固定流程人穷举所有路径可靠但僵化遇到没见过的情况直接卡死。第二代是自然语言Skill。 以Claude Code、Codex为代表用自然语言驱动足够灵活有极强的自主规划和探索能力能做复杂任务。它直接引发了这波自主智能体的大爆发但代价是不可靠模型未必照做幻觉频发难以校验和约束。为规避问题业界的解法是在自然语言外增加动态Workflow和Harness代码试图兼顾灵活与可靠却又有语言割裂、上下文过载和审计复杂的问题。生成的代码“编程人员看不过来非编程人员根本看不懂”。可靠的不灵活灵活的不可靠能兼顾的又太复杂韦韬把智能体演进过程里的问题概括为“不可能三角”。而AI进入严肃的生产级场景问题还会放大会造成从生成到人的把控能力再到AI执行等多个层面的失控。AI生成失控原因在于AI生成速度远超人的验证能力生成越快问题堆积越多。图片和视频的失真尚且一眼可见代码的失控却更隐蔽。2%5%的错误率规模一上来就会被快速放大等发现时早已经堆成改都改不动的代码屎山。人对AI失控根源在自然语言天生模糊加上人的注意力有上限。复杂逻辑边界讲不清楚AI收到的指令本身就模糊无法约束执行规模上来后超出人的核验能力加上AI极为自信的态度掩盖错误人的把关彻底失效。AI执行失控源于前两重失控叠加上执行时的注意力瓶颈。AI体系里本就混杂着大量基于模糊描述生成的内容执行时上下文管理本就混乱一旦超出大模型的注意力瓶颈就必须压缩上下文对该留什么、该扔什么缺乏有效指导。这也是今天编程领域频繁出现删邮件、删代码的根源。面对这些问题一些厂商认为解法是“把模型做得更强”但挑战也很明显它的成本代价极其昂贵绝大部分行业用不起时延也满足不了生产要求。短期内这并不是一条普惠的路。蚂蚁密算提出了另一种解法。“我们需要的不只是更强的模型而是一种全新的载体。”韦韬认为“不可能三角”和三重失控的本源在于智能体一直在借用人类的自然语言和传统编程语言没有一套面向任务理解、推理与执行的智能体原生语言载体。自然语言适合沟通不适合精确控制编程语言适合固化步骤执行但对非技术人员是壁垒。两者都不是为智能体设计的。让AI用人类的语言思考、规划和执行就像让鱼学爬树不是鱼不够努力是载体错了。“今天基座大模型能力已经溢出但依然没有用好核心原因是依然让它用人的方式工作没有找到更合适它的方式。”韦韬判断智能体需要自己的工作语言不是取代自然语言也不是回归僵化代码而是一种智能体原生的新载体。02给智能体一门“母语”此次WAIC发布的HOP 3.0并不是一门新的外语韦韬认为它更像是一种人和智能体高效对话的语言约定。它有几大核心特点来规避此前几种语言模式下智能体运行的失控问题。首先这种双态的语言融合了“显性结构化逻辑”与“模糊推理逻辑”。其中的结构化逻辑负责定义任务目标、权限范围、数据依赖、关键流程和核验条件而大模型是在相应约束内进行判断、规划和探索。两类逻辑分工明确。AI只需在明确节点进行有界推理人则聚焦目标、边界和关键检查点不必预先规定每一个动作也不必审查大量动态生成的代码最终实现了同时给AI和人减负。其次因为人的注意力有瓶颈大模型的上下文窗口有限HOP 引擎秉承着最简原则会根据任务自动为每个推理节点拼接所需的全局目标、契约、执行步骤和已有产出。它可基于任务的顺序、循环、分支用最小的注意力资源完成业务逻辑而不是把所有的上下文一股脑塞给大模型避免关键信息在压缩中丢三落四也规避了之前的模式下人审不过来AI执行失控的困境。另外这套语言还有一个很突出的特点它把智能体的安全逻辑写到了语言载体本身。同一套语言里明确区分了探索态、验收态和提交态。整个过程里工具权限、参数范围和执行条件可以提前约束任务过程结构化留痕支持核验与追溯。探索态里ACT指令在沙箱进行错了可以重来不用担心不可逆的后果“随意折腾天不会塌”。而验收态里Check指令强调有约束的执行不可改写、不可跳过、不达标绝不放行。进入提交态Commit指令下所有发邮件、支付、写生产库等不可逆操作都被严格隔离在显式节点具有强制校验机制一旦非法调用直接阻断。在WAIC产业数据智能-跃迁与普惠论坛现场韦韬以一个世界杯赛况智能体直观演示了不同的语言模式下的结果差异。当任务使用自然语言编写时虽然指令一再强调要“务必核实”但真正运转时这个指令只是一个给模型的建议最好的大模型执行下来仍有约30%的幻觉率。采用HOP 3.0后每条赛果只有获得可靠来源支撑才能继续用于预测并写入赛况库。“必须核查”由此不再是一句提醒而成为无法绕过的执行规则。可以说HOP 3.0从语言层面做了重重设计来推动智能体的可信可控应用。值得一提的是这门语言不是一夜之间横空出世。数智前线观察到蚂蚁密算从去年开始聚焦AI产业应用三次迭代最终形成了这门人与智能体对话的协作语言。蚂蚁密算认为这是一种更智能体原生的语言。韦韬告诉数智前线过去一年HOP从1.0演变到3.0聚焦的核心问题一以贯之始终围绕着智能体可信规模应用展开。去年WAIC上蚂蚁密算提出HOP 1.0当时更多是一个框架。它要解决的问题其实与今天大热的Harness类似如何把大语言模型推理以外的工作用代码更好地解决同时能够强化核验。今天这些工作已经基于Harness得到了行业的全面认同。今年年初HOP 2.0已经有了生态语言形成了顺序、循环、分支等标准推理与Harness结合的完整体系是人能审计的源代码、机器可执行的程序但还有两处缺口没有补上。一是没有明确提出“探索态、验收态、提交态”的分离团队当时还没有充分意识到大模型放开手脚之后会带来什么样的风险二是没有为大模型的推理节点提供自动化的上下文构建还停留在“信息越多越好”的朴素认知里。而到了HOP 3.0阶段随着对模型能力有更多认知两大缺失都已经补齐更方便产业应用落地。“本质上这是一个认知逐渐往前演进的过程对大模型的能力边界有了更清晰认知行业卡点等关键问题也逐渐明确在认知之上逐步找到了合适的抽象把它支撑起来”韦韬说。03推动智能体可信普惠应用基于HOP 3.0的重重设计和保障这门语言正从可靠性、运行成本等多个层面产生立竿见影的效果。蚂蚁密算做了一项评估在复杂规格驱动研发流程实践中引入HOP 3.0后产出完整率、生成成功率、需求与代码一致性均达到100%。强模型故障率下降约50%普通模型故障率下降约91.7%普通模型结合HOP 3.0后的效果达到甚至超过未使用HOP的强模型。除了准确性HOP 3.0还降低了任务执行成本平均每个执行周期的Token消耗从约94546降至82328下降约13%。这意味着一方面基于更高可靠性更多的行业场景得以解锁。又由于这门语言设计上的极简特性许多行业专家可摆脱对代码工程师的依赖能更大规模参与到行业智能体的搭建里来。更多垂类行业场景里有望构建出专业的智能体加速行业普及步伐。另外智能体的可靠性并不完全取决于模型的大小通过更好的语言结构和执行机制普通模型同样可以获得大幅提升这也让许多行业场景摆脱对头部超强大模型的依赖。在算力告急的背景下用更小尺寸模型也能拿到行业场景结果极大降低了智能体可信应用的成本。数智前线获悉目前蚂蚁密算正在推进基于HOP 3.0的智能体的可信规模落地金融和医疗等是重点方向。这些场景需求非常明确比如医疗数据不能泄露涉及个人信息、人命关天可靠性要求极高、大部分医院是普惠型服务用不起贵的模型它们对普惠可信地应用智能体有非常强烈的需求。另外过去两三年里各行各业积累了大量的基于自然语言构建的Skill本质上是非常宝贵的资产但由于可靠性不满足要求而无法真正应用起来。蚂蚁密算最近正在联合生态伙伴探索把沉睡的Skill转换为HOP语言表达让这些Skill资产真正能被用起来。由于HOP 3.0 的语言设计遵循“最简双态”原则只需要把关键决策点显性化韦韬称这个过程不是推倒重来对企业来说过渡并不复杂。HOP 3.0从语言层面解决了此前智能体应用的诸多卡点但不得不提的是千行百业在真实生产场景里“不敢用”的困境还与对数据泄露的顾虑有关。这又与蚂蚁密算的看家本领——密态计算能力形成了协同。HOP 3.0保障了智能体可靠执行复杂任务解决了智能体容易失控和可靠性的问题而密态计算天然能解决数据、模型权重和行业知识“不敢用、不敢流通、不敢协作”的问题。这两大能力协同形成“数据敢流通、模型敢使用、智能体可信赖”的可信链路。由此蚂蚁密算今年4月推出的可信智能Fabric系统级解决方案也随之升级。这一解决方案包含了四层上层以自主智能体降低使用门槛中层以智能蚁群承载专业智能体协同并通过 HOP 3.0 让协同过程可执行、可核验、可沉淀支撑层通过知识库、能力接口和数据编织连接业务资源底层以密态计算和安全合规管控保障数据、模型和知识可信流转。在这套体系里更多的非程序员领域专家的数据权益和知识产权因密算技术得到保障他们可基于HOP 3.0用易于理解和审核的结构化语言将专业判断直接融入AI流程。同时HOP3.0带来的成本普惠让产业级场景的智能体应用能通过结构化机制和任务分解不依赖昂贵模型。另外HOP 3.0在守住目标和边界的前提下放开探索将验证有效的执行路径和行业经验沉淀为可复用、可传承的组织智力资产有利于打破组织内的智力孤岛。而整个可信智能Fabric系统级解决方案又能统一提供数据保护、权限管控和全程追溯让领域专家不必先成为安全专家也能放心使用智能体。最终专家参与、应用可规模化、智力可沉淀、安全有平台兜底将有利于产业AI真正从可用走向可信普惠。