深圳商报·读创客户端记者 张郗郡
在人工智能的语境中,大模型依靠离散表征单元完成统一计算。正如大语言模型以Token(词元)作为最小文本语义处理单元,智能驾驶也已普遍采用多模态token的思路,把摄像头、激光雷达、道路、驾驶动作等转化为统一的离散特征单元。而具身智能则受机器人本体、任务类型和空间高度异构的制约,至今没有一套全行业公认、可通用的标准数据格式。

6月24日,通用具身智能企业RoboScience机器科学在深圳举行的发布会中,以物体第一性的原则重新定义了具身智能的“token”。会上,机器科学正式发布其自研通用具身大模型Visics,并完整披露模型的技术架构VLOA(Vision-Language-Object-Action),现场展示了模型在物品抓取、物流辅助、家具拼装等场景中的真实应用。

会上,RoboScience机器科学创始人兼CEO田野指出,当前机器人操作面临泛化能力差、精细操作难、长程任务误差累积三大核心瓶颈。而Visics大模型的突破在于首次通过自研技术架构VLOA,以物体移动的Object Trajectory(物体3D点云轨迹)作为中间接口,让机器的“认知”与“执行”分离。
在RoboScience机器科学联合创始人、执行总裁汪涛看来,传统的VLA架构本质上是模仿学习,即对硬件行动轨迹的刻板复制,这一行动逻辑所带来的问题之一就是模型和硬件强绑定。“一旦换一个场景或任务,训练好的模型便不再能复用。”汪涛表示,“而我们所定义的Object Trajectory,关注的是被操作物体在三维空间中的运动轨迹或状态变化,与行为主体或动作本身没有直接关系,由此实现能够跨本体、跨物体、跨任务的通用大模型。”
根据现场演示,以抓取操作为例,相比现有基于特定物体和机械臂的方法,搭载VLOA架构的装置在成功率、姿态多样性及计算速度上均有提升。

在内部架构上,Visics采用了“具身世界模型+通用操作模型”的双引擎结构。其中具身世界模型负责认知和预演物理轨迹,即通过感知物体的3D点云轨迹对未来进行预演,想象出物体的运动轨迹;通用操作模型负责将轨迹转化为不同机器人的物理控制信号,即根据物体的点云运动轨迹,把事情执行出来。两者通过Object Trajectory(物体3D点云轨迹)这一具身智能的“token”作为中间接口,以此来实现高层语义与底层物理规律的解耦。
在具身智能领域,数据是模型能力的根基。但面对传统数据路线在成本与产能上的双重天花板,机器科学放弃了真机预训练与人工数据标注等传统方式,选择自研仿真物理引擎RoboMirage,“以算力换时间”。据汪涛分享,Visics的具身世界模型使用互联网中的海量视频数据进行预训练,目前团队已积累数百万小时相关数据集;通用操作模型则通过RoboMirage进行仿真后训练,目前也已积累超百亿次高质量操作轨迹数据集。这样一来,公司单条数据的获取成本降至传统方案的1/20~1/200,同时还以每周数十万小时的增速持续扩展,有效突破了具身智能训练中数据规模与成本的双重瓶颈。

RoboScience机器科学成立于2024年12月,在北京、深圳、苏州、杭州均设有研发和生产中心,其中公司总部将于8月正式迁至深圳宝安。目前,公司已获得京东、商汤科技、达晨财智、招商局创投、零一创投、普华资本等多家CVC和财务机构的投资及产业支持,也与多家零售、物流、康养服务企业及机器人本体、灵巧手公司开展试点合作。
根据发布会上的消息,公司将于8月发布首个机器人本体。未来,机器科学将以具身通用大模型为核心,纵向打通自研本体、控制器与RobotOS,横向赋能模型泛化、便捷开发与多层级生态,构建软硬一体、闭环协同的商业模式。
(图片由受访对象提供)
举报/反馈