智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

大晓机器人携手港大推出StreamPI,为机器人时序理解开启时空智能新篇

2026-08-28来源:互联网编辑:瑞雪

在机器人技术领域,大晓机器人与香港大学联合发布了一项名为StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的全新研究成果,这一突破性进展为解决视觉-语言-动作模型(VLA)长期存在的“单帧智能”瓶颈提供了关键方案,成功为VLA补上了至关重要的“时间维度”。

传统VLA主要依据当前观测进行独立决策,这种“单帧智能”模式限制了机器人的能力。而StreamPI则为模型构建了持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,还能利用跨帧信息增强精细空间感知与动作决策能力。它推动VLA从单纯“识别当前状态”,迈向“理解正在发生的物理过程”,让机器人对世界的认知从静态画面转变为动态的时间流。

在技术实现上,StreamPI并未采用依赖额外参数堆叠来获取时序能力的方式,而是基于现有的VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现了从单帧决策到连续时序建模的轻量化扩展。这种创新方法避免了因参数堆叠带来的复杂问题,同时保证了模型的高效运行。

真实机器人实验以及在LIBERO、CALVIN等实验环境中的测试结果显示,StreamPI在时序记忆、精细空间操作与长程连续任务等方面取得了显著提升。以“猜杯子”任务为例,物体被藏入杯子并经过多次交换后,答案存在于整个变化过程而非最后一帧,传统单帧决策的机器人难以应对,而StreamPI赋能的机器人能凭借对历史信息的理解准确判断。在滚动物体场景中,单帧只能确定物体位置,连续观测才能理解其运动趋势,StreamPI让机器人真正理解了“物体正往哪里去”。

在给VLA加入时间信息的方法上,以往简单将过去多帧图像组成窗口一次性交给模型的方式存在诸多弊端。历史帧越多,视觉信息量越大,不仅需要反复计算已处理画面,增加推理开销,还易使任务指令被大量视觉信息稀释,导致机器人在长程执行中“忘记目标”。

StreamPI则采用了更科学的方法,它将每个时刻组织为“视觉观测 + 任务指令”的完整时序单元。语言指令持续绑定每次观测,成为贯穿任务始终的语义锚点,让机器人在接收新信息时始终明确目标。在时序单元内部,视觉与语言充分交互;不同单元之间按时间顺序持续读取和聚合历史信息,使模型既能理解当下所见,又能追溯过去发生的事,将离散的单帧判断连接成连续的时序理解。

为了让机器人拥有记忆的同时避免重复计算历史,StreamPI采用流式推理。首帧观测编码后存入键值缓存,后续只需处理新信息并调用历史表示,避免了重复计算整个观测窗口。而且,StreamPI无需额外引入视频编码器或独立记忆模块,通过重构原有VLA的注意力机制,直接继承π0.5的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧VLA获得连续时序能力。

真实机器人的运行环境复杂,相机采集、模型推理、通信与机械臂执行等环节都会产生延迟,导致观测时间波动,只在固定间隔数据上训练的模型在部署时易遭遇时序分布差异。为此,StreamPI引入随机时间间隔训练,随机改变历史观测间的时间距离并隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文,学习更稳定的时序关系。

实验数据充分证明了StreamPI的有效性。在LIBERO上,随机时间间隔训练策略将三帧输入时的平均成功率从96.4%提升至97.5%,五帧输入时从97.0%提升至98.3%。在更依赖长程上下文的LIBERO - Long任务中,成功率从π0.5的92.4%提升至95.0%。在CALVIN上,StreamPI平均连续任务长度达到4.547,超过π0.5的4.313和MemoryVLA的4.090;任务推进到第五步时,成功率仍达85.0%,高于π0.5的79.5%。

团队还设计了四项真机任务检验StreamPI的时序记忆与精细空间感知能力,每项任务采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;在滚动物体抓取任务中,从26.7%提升至63.3%。在强调空间精度的窄瓶口插笔任务中,成功率从40.0%提升至66.7%;纸杯插入杯套任务则从60.0%提升至92.0%。这些数据表明,时间不仅为机器人带来记忆,还帮助它更准确地理解空间。

StreamPI的出现,标志着机器人从基于当前状态决策迈向基于连续过程决策的重要转变。它让机器人对现实世界的认知不再局限于彼此孤立的静态画面,而是能够记忆、理解和持续更新时间流中的信息。目前,StreamPI在超长时间跨度训练和极端异步场景下仍有提升空间,但它的探索为机器人技术的发展开辟了新的道路,推动具身基础模型从空间智能向真正面向动态物理世界的时空智能迈进。

阿里Qoder全新登场:打破编程壁垒,让创意落地不再受技术限制
全新Qoder的核心优势在于既能适配专业开发人员需求,也能覆盖产品、设计、运营、数据、独立创作者等一众目标明确、能辨别产出好坏、希望快速落地创意的人群。 其在平台的模式上同样做了区分:编程模式适配代码开发类…

2026-08-28

OPPO刘作虎发布新一代ProXDR技术
OPPO首席产品官刘作虎近日宣布,公司正式推出新一代ProXDR技术,这项突破性成果被业界视为高动态影像领域的重要里程碑。通过将实时高动态处理与超高像素技术深度融合,该方案首次实现了两大核心特性的协同运作,为移动影像设备带来前所未有的画质提升。

2026-08-28

守护宝新机上市:双场景适配,为银发族与学生打造专属数字守护
近日,守护宝(angelcare)推出全新功能按键老年机,以 "时尚外观 + 智能内核" 打破传统老人机的刻板印象,集成GPS/WiFi/ 基站三重定位、微信视频通话、语音微聊、移动扫码支付等智能功能,同…

2026-08-28

东莞二手手机回收新选择:俊丽通讯全流程透明,适配多元需求!
该门店的服务覆盖本地不同类型用户的需求,针对周边工厂务工人员,营业时间适配下班、周末休息时段,可满足旧机处置、低价购机、办理高性价比流量卡和宽带的需求;针对本地社区居民、家庭用户,可提供旧机处置、换新机置换…

2026-08-28

联想拯救者手机打破界限:全境畅连功能向全品牌Windows PC开放
过去,全境畅连首先面向拯救者PC用户开放,也正是在大家长期的使用、反馈与支持下,这项功能不断完善,逐渐成为越来越多非拯救者PC用户希望体验的能力。无论用户使用的是哪个品牌的Windows PC,只需下载LE…

2026-08-28

vivo T5海外即将上市:天玑7300 Turbo加持,7050mAh大电池成亮点
IT之家 8 月 27 日消息,vivo 旗下 T5 手机现已在 Flipkart 平台曝光,该机将于 9 月 2 日在海外上市。 该机提供青铜/ 银绿双色,整体厚度 7.99mm,正面配备一块 6.83 …

2026-08-28

苹果发布M6与M5 Ultra芯片,以AI算力优势加速拓展企业市场版图
Gartner高级总监分析师Ranjit Atwal表示,这两款新芯片的研发目标是在企业端支撑未来的AI工作负载,包括智能体应用。 A:苹果芯片通过在设备本地运行AI推理,可以减少对云端GPU的依赖,从而降…

2026-08-27