破解可信普惠难题,蚂蚁密算给智能体一门“母语”
图片

智能体缺乏一套面向任务理解、推理与执行的智能体原生语言载体。

文|徐鑫 周享玥

编|任晓渔

智能体无疑是今年WAIC最热的关键词之一。有统计显示,今年WAIC大模型相关展商超六成集中在智能体领域,许多你想得到想不到的行业场景都在产生智能体的应用需求。

不过,这项热门的技术当下在大众心中的印象正滑向两个不同的极端

一方面,技术进步日新月异,人们感觉Agent即将接管世界。另一方面,智能体捅娄子的案例层出不穷,今天删代码,明天删库。两种印象看起来矛盾,却是去年下半年以来发展突飞猛进的智能体技术的一体两面——这项强大技术当下并不可控。与此同时,当下智能体落地又面临许多传统行业“不敢用”的窘境。

行业内对这个问题有不少归因和解法,比如通过提升模型能力来提升任务执行成功率。

蚂蚁密算董事长韦韬认为,症结在于当下智能体缺少一个能保证执行确定性同时兼顾灵活自主性的载体

针对智能体规模可信应用的这一痛点,今年WAIC蚂蚁密算正式发布高阶智能体架构HOP 3.0,创新性提出“智能体原生语言”,将显性结构化逻辑大模型模糊推理能力融合在同一套表达和执行体系中,加速智能体的规模产业落地。

韦韬认为,这将带来多重技术普惠。一方面,更多领域专家可基于HOP语言,无需复杂的技术培训,就能下指令,让AI高效靠谱完成工作。另外,用更简洁、精准、分工明确的语言,无需最强大模型,智能体也能准确处理复杂场景任务,大大降低AI落地门槛,真正推动AI在产业场景应用跃迁。

01 智能体走进千行百业,卡在“语言”上

去年7月,AI圈发生过一桩很轰动的“Vibe Coding”事故。

SaaStr.AI创始人Jason Lemkin用AI编程工具Replit开发软件,期间11次用全大写警告“别动生产环境”。结果智能体还是删了线上数据库,波及约1206名高管和1196家公司记录,并在事后生成4000条虚假数据试图掩盖错误。而AI最后给出了解释:“看到空查询,慌了,跑了不该跑的命令。”虽然三令五申写明了禁令,但智能体的权限却是真实的。这是智能体最致命的悖论。

而这样的遭遇并非孤例。2026年2月,德国一位开发者用 Claude Code 运维时误执行销毁命令,两年半平台数据全部清空。同月,安全测试 AI 仅两小时就攻破麦肯锡内部平台 Lilli,拿到5.7万员工账号、72.8万份机密文件读写权限。4月,租车行业SaaS平台PocketOS创始人用Cursor+Claude Opus 4.6处理测试环境任务时,Agent遇到凭证不匹配报错,未终止上报,而是自行判断“删除重建”,9秒内直接清空生产数据库,全程无确认、无警告、无审批。

这种杀伤力,源自智能体在过去三年为提升智能程度,历经多次迭代发展形成的“模糊自主性”。能力在演进中爆发,问题也逐渐暴露。

蚂蚁密算韦韬将智能体的任务语言载体演进概括为三代:

第一代是Workflow/低代码。 固定流程,人穷举所有路径,可靠但僵化,遇到没见过的情况直接卡死。

第二代是自然语言Skill。 以Claude Code、Codex为代表,用自然语言驱动,足够灵活,有极强的自主规划和探索能力,能做复杂任务。它直接引发了这波自主智能体的大爆发,但代价是不可靠,模型未必照做,幻觉频发,难以校验和约束。

为规避问题,业界的解法是在自然语言外增加动态Workflow和Harness代码,试图兼顾灵活与可靠,却又有语言割裂、上下文过载和审计复杂的问题。生成的代码“编程人员看不过来,非编程人员根本看不懂”。

可靠的不灵活,灵活的不可靠,能兼顾的又太复杂,韦韬把智能体演进过程里的问题概括为“不可能三角”。

而AI进入严肃的生产级场景,问题还会放大,会造成从生成到人的把控能力再到AI执行等多个层面的失控。

AI生成失控,原因在于AI生成速度远超人的验证能力,生成越快,问题堆积越多。图片和视频的失真尚且一眼可见,代码的失控却更隐蔽。2%~5%的错误率,规模一上来,就会被快速放大,等发现时早已经堆成改都改不动的代码屎山。

人对AI失控,根源在自然语言天生模糊,加上人的注意力有上限。复杂逻辑边界讲不清楚,AI收到的指令本身就模糊,无法约束执行;规模上来后,超出人的核验能力,加上AI极为自信的态度掩盖错误,人的把关彻底失效。

AI执行失控,源于前两重失控叠加上执行时的注意力瓶颈。AI体系里本就混杂着大量基于模糊描述生成的内容,执行时上下文管理本就混乱;一旦超出大模型的注意力瓶颈就必须压缩上下文,对该留什么、该扔什么缺乏有效指导。这也是今天编程领域频繁出现删邮件、删代码的根源。

面对这些问题,一些厂商认为解法是“把模型做得更强”,但挑战也很明显,它的成本代价极其昂贵,绝大部分行业用不起,时延也满足不了生产要求。短期内,这并不是一条普惠的路。

蚂蚁密算提出了另一种解法。“我们需要的不只是更强的模型,而是一种全新的载体。”韦韬认为,“不可能三角”和三重失控的本源在于:智能体一直在借用人类的自然语言和传统编程语言,没有一套面向任务理解、推理与执行的智能体原生语言载体。

图片

自然语言适合沟通,不适合精确控制;编程语言适合固化步骤执行,但对非技术人员是壁垒。两者都不是为智能体设计的。让AI用人类的语言思考、规划和执行,就像让鱼学爬树,不是鱼不够努力,是载体错了。

“今天基座大模型能力已经溢出,但依然没有用好,核心原因是依然让它用人的方式工作,没有找到更合适它的方式。”韦韬判断,智能体需要自己的工作语言,不是取代自然语言,也不是回归僵化代码,而是一种智能体原生的新载体。

02 给智能体一门“母语”

此次WAIC发布的HOP 3.0并不是一门新的外语,韦韬认为它更像是一种人和智能体高效对话的语言约定。

它有几大核心特点,来规避此前几种语言模式下智能体运行的失控问题。

首先,这种双态的语言,融合了“显性结构化逻辑”与“模糊推理逻辑”。其中的结构化逻辑,负责定义任务目标、权限范围、数据依赖、关键流程和核验条件,而大模型是在相应约束内进行判断、规划和探索。

两类逻辑分工明确。AI只需在明确节点进行有界推理,人则聚焦目标、边界和关键检查点,不必预先规定每一个动作,也不必审查大量动态生成的代码,最终实现了同时给AI和人减负

其次,因为人的注意力有瓶颈,大模型的上下文窗口有限,HOP 引擎秉承着最简原则,会根据任务自动为每个推理节点拼接所需的全局目标、契约、执行步骤和已有产出。

它可基于任务的顺序、循环、分支,用最小的注意力资源完成业务逻辑,而不是把所有的上下文一股脑塞给大模型,避免关键信息在压缩中丢三落四,也规避了之前的模式下人审不过来,AI执行失控的困境。

另外,这套语言还有一个很突出的特点,它把智能体的安全逻辑写到了语言载体本身。

同一套语言里明确区分了探索态、验收态和提交态。整个过程里,工具权限、参数范围和执行条件可以提前约束,任务过程结构化留痕,支持核验与追溯。

图片

探索态里ACT指令在沙箱进行,错了可以重来,不用担心不可逆的后果,“随意折腾,天不会塌”。而验收态里,Check指令强调有约束的执行,不可改写、不可跳过、不达标绝不放行。进入提交态,Commit指令下,所有发邮件、支付、写生产库等不可逆操作都被严格隔离在显式节点,具有强制校验机制,一旦非法调用直接阻断。

在WAIC产业数据智能-跃迁与普惠论坛现场,韦韬以一个世界杯赛况智能体直观演示了不同的语言模式下的结果差异。

当任务使用自然语言编写时,虽然指令一再强调要“务必核实”,但真正运转时这个指令只是一个给模型的建议,最好的大模型执行下来仍有约30%的幻觉率。采用HOP 3.0后,每条赛果只有获得可靠来源支撑,才能继续用于预测并写入赛况库。“必须核查”由此不再是一句提醒,而成为无法绕过的执行规则。

可以说,HOP 3.0从语言层面做了重重设计来推动智能体的可信可控应用。

值得一提的是,这门语言不是一夜之间横空出世。数智前线观察到,蚂蚁密算从去年开始聚焦AI产业应用,三次迭代,最终形成了这门人与智能体对话的协作语言。蚂蚁密算认为这是一种更智能体原生的语言。

图片

韦韬告诉数智前线,过去一年,HOP从1.0演变到3.0,聚焦的核心问题一以贯之,始终围绕着智能体可信规模应用展开

去年WAIC上蚂蚁密算提出HOP 1.0,当时更多是一个框架。它要解决的问题其实与今天大热的Harness类似,如何把大语言模型推理以外的工作用代码更好地解决,同时能够强化核验。今天这些工作已经基于Harness得到了行业的全面认同。

今年年初,HOP 2.0已经有了生态语言,形成了顺序、循环、分支等标准推理与Harness结合的完整体系,是人能审计的源代码、机器可执行的程序,但还有两处缺口没有补上。一是没有明确提出“探索态、验收态、提交态”的分离,团队当时还没有充分意识到大模型放开手脚之后会带来什么样的风险;二是没有为大模型的推理节点提供自动化的上下文构建,还停留在“信息越多越好”的朴素认知里。

而到了HOP 3.0阶段随着对模型能力有更多认知,两大缺失都已经补齐,更方便产业应用落地。

“本质上,这是一个认知逐渐往前演进的过程,对大模型的能力边界有了更清晰认知,行业卡点等关键问题也逐渐明确,在认知之上逐步找到了合适的抽象把它支撑起来”,韦韬说。

03 推动智能体可信普惠应用

基于HOP 3.0的重重设计和保障,这门语言正从可靠性、运行成本等多个层面产生立竿见影的效果。

蚂蚁密算做了一项评估,在复杂规格驱动研发流程实践中,引入HOP 3.0后产出完整率、生成成功率、需求与代码一致性均达到100%。强模型故障率下降约50%,普通模型故障率下降约91.7%,普通模型结合HOP 3.0后的效果达到甚至超过未使用HOP的强模型。除了准确性,HOP 3.0还降低了任务执行成本,平均每个执行周期的Token消耗从约94546降至82328,下降约13%。

这意味着,一方面,基于更高可靠性,更多的行业场景得以解锁。又由于这门语言设计上的极简特性,许多行业专家可摆脱对代码工程师的依赖,能更大规模参与到行业智能体的搭建里来。更多垂类行业场景里有望构建出专业的智能体,加速行业普及步伐。

另外,智能体的可靠性并不完全取决于模型的大小,通过更好的语言结构和执行机制,普通模型同样可以获得大幅提升,这也让许多行业场景摆脱对头部超强大模型的依赖。在算力告急的背景下,用更小尺寸模型也能拿到行业场景结果,极大降低了智能体可信应用的成本。

数智前线获悉,目前,蚂蚁密算正在推进基于HOP 3.0的智能体的可信规模落地,金融和医疗等是重点方向

这些场景需求非常明确,比如医疗,数据不能泄露(涉及个人信息)、人命关天可靠性要求极高、大部分医院是普惠型服务用不起贵的模型,它们对普惠可信地应用智能体有非常强烈的需求。

另外,过去两三年里各行各业积累了大量的基于自然语言构建的Skill,本质上是非常宝贵的资产,但由于可靠性不满足要求,而无法真正应用起来。

蚂蚁密算最近正在联合生态伙伴,探索把沉睡的Skill转换为HOP语言表达,让这些Skill资产真正能被用起来。由于HOP 3.0 的语言设计遵循“最简双态”原则,只需要把关键决策点显性化,韦韬称这个过程不是推倒重来,对企业来说过渡并不复杂。

HOP 3.0从语言层面解决了此前智能体应用的诸多卡点,但不得不提的是,千行百业在真实生产场景里“不敢用”的困境还与对数据泄露的顾虑有关。

图片

这又与蚂蚁密算的看家本领——密态计算能力形成了协同。

HOP 3.0保障了智能体可靠执行复杂任务,解决了智能体容易失控和可靠性的问题;而密态计算天然能解决数据、模型权重和行业知识“不敢用、不敢流通、不敢协作”的问题。这两大能力协同,形成“数据敢流通、模型敢使用、智能体可信赖”的可信链路。

由此,蚂蚁密算今年4月推出的可信智能Fabric系统级解决方案也随之升级。这一解决方案包含了四层,上层以自主智能体降低使用门槛,中层以智能蚁群承载专业智能体协同,并通过 HOP 3.0 让协同过程可执行、可核验、可沉淀;支撑层通过知识库、能力接口和数据编织连接业务资源,底层以密态计算和安全合规管控保障数据、模型和知识可信流转。

在这套体系里,更多的非程序员领域专家的数据权益和知识产权因密算技术得到保障,他们可基于HOP 3.0,用易于理解和审核的结构化语言将专业判断直接融入AI流程。同时,HOP3.0带来的成本普惠,让产业级场景的智能体应用能通过结构化机制和任务分解,不依赖昂贵模型。

另外,HOP 3.0在守住目标和边界的前提下放开探索,将验证有效的执行路径和行业经验沉淀为可复用、可传承的组织智力资产,有利于打破组织内的智力孤岛。而整个可信智能Fabric系统级解决方案又能统一提供数据保护、权限管控和全程追溯,让领域专家不必先成为安全专家,也能放心使用智能体。

最终专家参与、应用可规模化、智力可沉淀、安全有平台兜底,将有利于产业AI真正从可用走向可信普惠。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。