网站地图 - XML地图 - 设为首页 - 加入收藏
您的当前位置:主页 > 国内 > 正文

反击

Cortex:自主切分规划subtask,上海AI Lab提出双向协同Agent实现长程化学操作任务_我的网站

百思不得姐

A |     拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。

B |     刚刚,阿里和腾讯几乎同时干了一件类似的事:合并自家龙虾团队。         阿里整合QoderWork、悟空、MuleRun三款智能体产品,将推出千问办公。         对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。

C |          腾讯则将QClaw产品中心相关业务和部分团队调整到云产品六部,也就是WorkBuddy所在部门,换言之,鹅厂手里两只“龙虾”也要整合了。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。         端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。

D |          两家巨头,同样的动作,巧合吗?当然不是。         今天是7月21号,短短半年,大厂龙虾已经跑完了一个小周期↓          2025年底,OpenClaw横空出世,点燃了整个行业的热情。

E |          2026年Q1,大厂纷纷入局,产品井喷,百龙虾大战开打。         另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。         2026年Q2,头部产品跑出数据,腰部、尾部产品开始掉队。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。         2026年Q3,整合开启:阿里三合一,腾讯二合一,大厂内部洗牌结束,行业进入淘汰赛。         VLA根据单帧输入难以判断任务进度而陷入循环。         阿里:三只龙虾合成一只          阿里的龙虾布局,一度是“三头并进”的局面。

F | (其实阿里系还有第四只虾:无影旗下的JVS)。         QoderWork,2026年1月上线,主打桌面AI智能体工具,用户通过自然语言指令即可让AI操作本地应用和文件,完成文档生成、数据分析、文件整理等任务。

G |          近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。         在三款产品中,QoderWork的用户规模和口碑最优。         悟空,2026年3月17日由ATH事业群发布,依托钉钉生态,强调企业协同办公,深度集成企业权限与安全沙箱。         它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。         MuleRun,早在2025年8月就悄悄上线,是阿里云内部孵化的Agent执行引擎,主攻海外市场,已覆盖43个国家,支持多Agent协同。         论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation          项目网站:https://steinate.github.io/cortex.github.io               论文链接:https://arxiv.org/abs/2607.05377               代码链接:https://github.com/InternRobotics/Cortex               为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。         视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ          架构:双系统分工,精准解决          「能不能做」和「做没做完」两大核心问题          在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。         当时拿到第一批骡子测试码的我,还搞不懂这到底是个啥,现在回头看,当时那个所谓的“封装经验、知识即资产”,不就是后来大火的Skill吗。         其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。         阿里三款产品分属不同团队,场景侧重各不相同,但在企业生产力这个大赛道上,功能重叠越来越严重。         资源分散、各自为战,难以形成合力。

H |          System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。         转折发生在今年6月。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。

I |          钉钉创始人陈航卸任,陈宇森接棒,成为阿里最年轻的事业部CEO。         新官上任第一把火,就是推动三款产品的整合。         由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。         7月初启动,现在三合一的千问办公就要出炉了。         以QoderWork为基座,融合悟空的企业协同能力和MuleRun的全球化执行引擎,打造一款面向企业生产力场景的拳头产品。         双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆          数据:统一技能范式,          让规划指令可落地、无歧义          为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。         开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。

J |          讲真,这个整合的思路听着还蛮有道理,把各自优势都结合了          然而,产品整合易,团队整合难。         跨团队协同、资源重配、与钉钉既有企业客户生态的深度耦合,每一道都是硬骨头。         钉钉2025年营收超过40亿元,在制造、政务、教育和传统行业中小企业市场拥有庞大客户群。         对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。         千问办公的商业化还在起步阶段,如何与这棵大树协同生长,是陈宇森必须回答的问题。         围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。         腾讯:两只龙虾的终局          腾讯这边的故事更有戏剧性。

K |          QClaw是腾讯基于OpenClaw开发的本地AI助手,由一位1999年出生的产品经理张舒昱主导。         这个妹子2025年9月加入腾讯电脑管家,带领5人小团队、零营销预算,在2026年3月内测后一周用户量突破数百万,迅速爆火,引起腾讯高层关注,项目随即升格为公司核心战略。         但故事的后半段急转直下。

L |          QClaw出海版在4月用户访问量环比暴跌99.19%。

M |          6月29日,张舒昱正式离职,在腾讯仅待了10个月。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。         另一边,WorkBuddy的表现堪称炸裂。

N |          训练:最关键的训练样本,          集中在动作交界处          长轨迹的大多数画面都落在动作进行中。若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。         Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。

o |          这款由腾讯云CodeBuddy团队开发的桌面Agent工具,2026年1月在腾讯内部开放体验,2月公测,6月正式发布企业版。

p | 模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。

q |          在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。         到7月,官方宣布PC端AI办公智能体DAU第一,全平台MAU 2000万,DAU1300万以上。         Event-balanced sampling 示意图。         据说,腾讯内部已经将WorkBuddy定位为“QQ、微信之后的第三个现象级产品”。橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。

r |          当一只龙虾已经跑出了现象级数据,另一只龙虾的命运其实早已注定。

s |          实验:仿真领先几个百分点,          实机差距出现在完整任务上          Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。

t |          QClaw并入WorkBuddy,是资源向胜者集中的必然选择。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。(其实鹅厂也还有一只虾:Marvis)          为什么大厂不赛虾了          阿里和腾讯几乎同时做出类似动作,我觉得背后原因大概有这么几点↓          ①功能趋同,差异化空间收窄,自家龙虾互掐。

u |          在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。         无论是QoderWork、悟空还是QClaw,核心能力都指向同一个方向:自然语言驱动、本地任务执行、跨应用操作、文件处理、数据分析。         当底层大模型能力趋同、开源框架(如OpenClaw/Hermes/OpenCode)将基础能力拉平之后,产品之间的差异越来越小。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。

v |          更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。         14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。

w |          相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。         它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。         这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。         继续维持多条产品线并行,意味着资源分散、品牌模糊,最终可能一条线都跑不出来          与其让多只虾在同一片池塘里互相抢食,不如拢成一只大虾,集中火力对外。         ②技术收敛,端云协同、Harness架构成为行业共识。

x | 更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。         对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。         作者介绍          论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。

y |          龙虾类产品的技术栈正在快速趋同。         早期各家还在本地部署和云端部署上做不同选择,到2026年中,端云协同架构几乎成了行业共识。         当技术底座趋于统一,分散的产品团队就失去了独立存在的理由。         整合的核心价值并不只是减少产品数量,更是建设统一的智能体Runtime,也就是更稳定更智能更安全的Harness层。         ③算力成本高,商业化压力倒逼组织提效。         AI智能体的烧钱速度远超预期,尤其是对tokens的小号远超对话式AI。         算力成本、模型调用、用户补贴,每一项都是真金白银。         大厂必须证明这些产品能赚钱,合并团队、砍掉冗余、共享推理基础试试,集中资源做商业化,是最直接的路径,对烧钱速度的改善也是立竿见影。

z |          ④从养虾到用虾,行业进入深水区。

|          这届WAIC,大家的共识是:OpenClaw龙虾的热度高峰已过,但智能体作为一条产业主线依然生机勃勃。         这个阶段,需要的是深度整合的行业解决方案,而非浅尝辄止的多点试探。         还有一点,龙虾产品的竞争已经从单点工具升级为平台入口之争,分散的产品线无法形成统一的入口体验,合并是为了在生态卡位战中集中兵力。         从3月全民养虾到7月大厂合虾,短短四个月,龙虾赛道已经走完了从野蛮生长到理性整合的第一程。

|          对大厂来说,龙虾确实卷到头了:从拼数量转向拼质量,从抢首发转向拼留存,从做工具转向做平台。         而对广大用户来说,虾少了,但每只虾可能都更肥了。         因为,我们原本就不需要那么多虾。

|

Current article:http://druppbf.zhouangnaoguangsundianzhenmou.cfd/230gqu1/p1r.html

Published on:19:39:56


注:凡本网注明来源非本站的作品,均转载自其它媒体,并不代表本网赞同其观点和对其真实性负责。
本站致力于帮助文章传播,希望能够建立合作关系。
若有任何不适的联系以下方式我们将会在24小时内删除。联系方式:
Copyright © 2018 我的网站 版权所有