
一 | 拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。 对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。
每天三分钟,知晓天下网球事。球迷朋友大家好,今天是2025年4月21日星期一,欢迎收听收看由《网球之家》为您提供的新闻午报。

二 | 端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。

三 |
北京时间昨晚,两站ATP500赛相继落幕,冠军各有归属。 另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。

四 | 巴塞罗那站:6号种子、丹麦新星鲁内状态火热,以7-6(6) 6-2击败头号种子、本土作战的西班牙红星阿尔卡拉斯,终结其赛会14连胜以及近期的9连胜,夺得职业生涯ATP500赛首冠。
本站,鲁内连续战胜两位TOP10,打破了两年的冠军荒,世界排名将在本周重回前十。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。

五 | 而落败的阿卡在赛后透露,他在比赛的第二盘,右腿的内收肌出现状况,今天他将进行核磁共振检查来明确伤情,以确定是否参加本周三开打的马德里大师赛。
慕尼黑站:头号种子、德国名将小兹维列夫发挥出色,以6-2 6-4完胜2号种子、美国新星谢尔顿,在28岁生日当天成功加冕赛会三冠王。这是小紫薇职业生涯获得的总第24个巡回赛冠军头衔,也是红土赛第9冠。 VLA根据单帧输入难以判断任务进度而陷入循环。 近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。

六 |
女子赛场:在WTA500斯图加特站单打半决赛中,拉脱维亚名将奥斯塔彭科延续火热手感,以6-4 6-4击败俄罗斯人亚历山德洛娃,闯进今年第2个、职业生涯总第18个巡回赛决赛,将向单打第9冠发起冲击。
另一场较量,头号种子、世界第一萨巴伦卡以7-5 6-4击败5号种子、意大利小钢炮鲍里妮,豪取一波八连胜,闯进今年第5个、职业生涯总第36个巡回赛争冠战。奥胖和萨巴这两人,谁能最后开走漂亮的保时捷跑车呢?答案将在今晚揭晓。 它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。

七 |
在女双决赛中,中俄组合张帅/亚历山德洛娃以3-6 3-6不敌头号种子达布劳斯基/卢特利芙,屈居亚军。 论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation 项目网站:https://steinate.github.io/cortex.github.io 论文链接:https://arxiv.org/abs/2607.05377 代码链接:https://github.com/InternRobotics/Cortex 为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。
WTA250鲁昂站:头号种子斯维托丽娜在第二盘挽救两个盘点,最终以6-4 7-6(8)击败3号种子、塞尔维亚人达尼洛维奇,时隔两年强势捧起冠军奖杯。这是乌克兰小白菜红土第7冠,继续保持着红土决赛胜率100%的完美纪录。
我们再来关注本周赛事。 视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ 架构:双系统分工,精准解决 「能不能做」和「做没做完」两大核心问题 在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。北京时间昨晚,WTA1000马德里站公布了单打正赛签表。8号种子、中国一姐郑钦文再次与世界第一萨巴伦卡抽到了同一个四分之一区,真是冤家路窄。

八 | 前八大种子的具体对位情况是:上半区,萨巴伦卡--郑钦文、佩古拉--鲍里妮;下半区,米拉-安德列娃--高芙、凯斯--斯瓦泰克。
具体签表,郑钦文首轮轮空,次轮将对阵俄罗斯人波塔波娃和美国人克鲁格之间的胜者。 其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。另一位中国球员王欣瑜抽到了上半区四分之二区,首轮对阵近期状态低迷的希腊一姐萨卡里,有望战而胜之。
最后来猜一猜认一认。 System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。

九 | 下面这张图片是一位球员对镜自拍。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。不作提示,您能认出她是谁吗?
上期的猜一猜,有球友给出了正确答案。没错,图片上的人就是哈萨克斯坦名将莱巴金娜。

十 | 由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。

十一 |
(来源:网球之家 作者:特立独行)。 双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆 数据:统一技能范式, 让规划指令可落地、无歧义 为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。 开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。 对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。 围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。 训练:最关键的训练样本, 集中在动作交界处 长轨迹的大多数画面都落在动作进行中。

十二 | 若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。 Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。 在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。 Event-balanced sampling 示意图。橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。 实验:仿真领先几个百分点, 实机差距出现在完整任务上 Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。 在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。 更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。 14 步器皿操作流程。

十三 | 高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。 相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。

十四 | 它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。

十五 | 这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。

十六 | 对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。 作者介绍 论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。
Current article:http://keq1uk.bianhajieleigoukusunmen.pics/list_gq70j/0hrly.html
Published on:05:08:02
新闻热点
新闻爆料
图片精选
点击排行