AI 学习社区

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 8|回复: 0

一周连发6个模型!这家公司把具身智能的闭环跑通了

[复制链接]

34

主题

0

回帖

63

积分

管理员

积分
63
发表于 前天 04:27 | 显示全部楼层 |阅读模式






模型可以开源,部署经验不能

过去一年,具身智能行业的新闻雷声大、雨点也大。根据量子位不完全统计,截至2026年6月12日,国内具身智能赛道共融资约438亿元,已经达到了2025年全年的近八成。

这些demo和融资,覆盖的场景五花八门,家用陪伴、商业导览、工业产线,每个细分领域都有公司在做。但demo跑通和真正批量部署,是两张皮的事,不是每个场景都能同时跨过去,如果视角直接盯着「具身智能」这个大概念,未免太过宽泛。

那么究竟哪个场景离批量落地最近?答案是工业。

听到「工业」二字,很多人会认为门槛高、技术严苛,但对于具身智能而言,工业生产反而比生活场景来得简单。工业场景中,取放、搬运、插拔,这类动作重复度高,任务边界也相对固定。

相比家用场景里随时可能出现的宠物、玩具、陌生访客,工业场景更容易在短时间内被集中突破。所以,工业变成了具身智能里跑得最快的那条赛道。

国家税务总局的数据显示,2026年1-5月,全国工业企业购进具身智能机器人的总金额同比增长了2.3倍。企业的钱,正在从「买demo」转向「上产线」。

如果说上一轮AI浪潮的主角,是「会聊天的模型」;那这一轮的主角,就是「会干活的机器」。

但「会干活」这件事,没法只靠一次对话或一段演示视频来验证。模型参数堆得再大,论文指标刷得再高,机器人到底能不能在真实产线上运转,答案都只能从产线上找。

这也意味着,具身智能这条赛道,比的是谁先把机器人送进工厂、让它连续转起来。只凭借模型参数的大小,无法取得竞争优势。

但同时也需要明晰,之前可能有一批传统的工业机器人已经开始进场上班,但这种模式仍然不能称为「具身智能的工业化落地」。

焊接、搬运、喷涂这类固定动作,传统工业机器人早已干得又快又稳,但它们面前仍然有两堵绕不开的墙:

过去几十年,工业自动化的边界,被死死圈在「重复、固定、大批量」三个词里。

打破这两堵墙,正是这一轮技术浪潮真正要解决的问题。

为此,机器人得先看懂当前的场景该干什么,这是认知判断;再准确地把动作做出来,这是动作执行;还要在无人盯梢的情况下,稳定运行足够长的时间,不能三天两头出故障。

这背后需要一整套体系,从认知判断,到动作执行,再到长期稳定运行,每一环都要跟上。

要覆盖如此复杂的一整套流程,单靠一个模型可能确实有些捉襟见肘。

最近这几天,有家公司一口气就发布了六款模型,指向了数据生成、认知理解、训练进化、动作执行、端到端部署几个环节。从数据到部署,被这家公司用这六个模型给串起来了。

这家公司,就是专注工业具身智能商业化落地的安努智能。

六款模型,分别是实时长视频生成模型Helios、软物体仿真平台SimLab、让世界模型对动作后果负责的ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5,以及端到端部署系统Nexus。

看上去有点眼花缭乱,没关系,我们先用一张图看一看这些模型构成的体系,接下来再一层一层拆解。

第一步要解决的,是工业具身机器人落地绕不开的一个难题——数据采集。

安努先做了视频生成模型Helios。传统的视频生成往往面临着「生成慢、时间短、易崩坏」的痛点。

Helios通过底层架构的创新,显著改善了这一现状,它不仅能实时生成分钟级的长视频,而且在单张H100 GPU上就能实现19.5 FPS的推理速度。

有意思的是,Helios最初并不是专门为机器人或具身智能设计的,但它解决的几个核心问题——长时序建模、持续生成、实时推理、高效视频生成——恰好也是今天具身智能和世界模型绕不开的基础问题,Helios目前已被多家头部具身智能与世界模型团队采用,成为具身智能研究里不可忽视的关键技术底座。

工业场景里常见的刚性物体仿真,行业已经做得比较成熟,但物料分拣、快递包装这些任务中的软体物体,褶皱和光线一变,用传统物理引擎就很难精确建模,识别难度陡增。

这种软性物体的仿真,至今仍是各家都在攻克的难题。

面向物流软包裹分拣的抓取数据生成、面向工业设备的热视觉数据生成,以及这套仿真到真机的迁移方法,安努SimLab都已经在实际项目里完成验收落地,并且用百元级机械臂、零真实标注就跑通了全流程。

它的核心是一套自研的软体和热学物理求解器,配合基于Isaac Sim搭建的合成数据工厂,再加上一套已经在真实机械臂上验证过的sim2real迁移方法,把仿真里学到的东西搬到真机上。

配合自研的数采套件负责现场配套采集,三者合在一起,构成了给上层输送训练素材的数据工厂。

地基打好之后再往上走,就是ActiWorld。它的核心,就是让机器人对自己动作的后果负责,在真正伸手之前,先知道这一下大概率会不会失败。

纵观现有的世界模型技术路线,有的瞄准物理规律,有的关注空间预测,也有像英伟达Cosmos这样走平台化的路线。

问题在于,画面看起来真实,不代表它真的对应了机器人给出的动作。一旦画面对动作不敏感,视频再逼真也无法支撑决策,这种偏差在操作任务里格外致命。

所以,ActiWorld把资源押在了另外一件事上——动作后果的可验证性。

以前评判一个世界模型好不好,看的是视觉效果和画面流畅度,但这个标准会稀释动作信息,回答不了动作有没有被认真对待这个问题。

所以,ActiWorld换了个问法。

它同时关注动作、时间、空间三个角度,确保模型预测出来的画面包含足够的动作信息,用以分辨出这是抬起还是推动;确保当前状态能够「承上启下」,既能清晰描述过去,又能准确预测未来;确保模型的注意力,放在真正发生变化的地方。

为了把这三个方面的能力真正赋予模型,ActiWorld在训练环节设计了三条约束。

这三条约束只用在训练阶段。真正上岗的推理环节,走的还是标准接口,不多花一分钱的推理成本,而且直接兼容现有动作条件扩散骨干。

而且ActiWorld能干的,不只让画面更符合需求。

研究团队还拿它去做了另一件事,让它提前判断一套动作方案的后果,从而帮助机器人挑出更合适的动作。

测试下来,它对成败的判断和真实结果的偏差,低于3.25%。

这套预演能力,最后也在真机上得到了验证。

例如一个要求把包裹二维码朝上放到传送带上的分拣任务,原本执行策略的成功率是56%,加上ActiWorld引导的预演之后,相对失败率降了大概13.6%。

相比其他头部团队的世界模型,ActiWorld只关注一件事:动作对不对、能不能提前预判失败。

它训练时就把动作逻辑钉死,推理不加成本,也不绑任何本体,工厂落地,最缺的正是这种「先想一步」的判断力。

光有判断力还不够,机器人真正开始动手实操后,暴露出来的问题往往更棘手。

比如光照条件一变,动作可能就跟着乱套。这是RoHIL和EvoHIL两代真机强化学习技术要解决的问题。

在RoHIL和EvoHIL框架下,机器人训练只需要30分钟就能达到满分水准,跨光照场景也不需要重新采集数据。奖励标准同样不用人工每次离线重新标注,系统会根据人工确认过的成功样本自己迭代,不用停线重训。

以USB插入这类精密任务为例,做到了100%的成功率,而且光照条件发生完全偏移时,需要人工介入的比例只有1.32%,不到旧方法的十分之一。

既然光照变化是最容易让机器人翻车的因素之一,RoHIL索性把世界模型重新打光,让机器人不管碰到什么样的光照条件,都能维持稳定的判断,跨光照条件部署的成功率做到了100%。

但产线上会变的不只是光照,工位换了、任务变了,同样会让训练好的模型失灵。

靠人工离线重新标注数据、停线重训来应付,成本又太高。

所以这时候,需要机器人拥有自我进化的能力,EvoHIL就是干这个的。

它给奖励模型、动作生成器、视觉感知都装上自适应能力,让模型自己判断动作做得好不好,不用人工离线重新标注数据、停线重训,就能适应新工位、新光照,自己生成新的动作方案去试。

真机测试结果表明,有了EvoHIL,机器人在6类典型工业任务中,成功率大幅提升。

训练、迁移、奖励设计这三块成本叠加起来,同等规模部署下,整体成本能降低80%左右。

但这里其实还没到执行层,真正落到「动作」这一步的,是世界动作模型AnuVerse-0.5。

它采用视频专家预测画面、动作专家输出动作的MoT架构,基于14B参数的Helios开发。其推理速度做到百毫秒级,一张桌面级显卡就能跑起来,速度和部署成本都处于产线边缘能承受的水平。

这套体系走到这一步,其实已经能看……

查看原文

(本文转载自量子位,仅作资讯分享)
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

网站介绍
AI 学习社区(subo.qd.je)—— 一个专注 AI 学习、技术交流与资讯分享的社区平台。欢迎每一位 AI 爱好者!
快捷访问
我的帖子
我的收藏
我的好友
我的关注
附加功能
任务大厅
勋章中心
每日签到
排行榜
关于我们
举报
手机版
站点统计
注册账号

AI 学习社区

GMT+8, 2026-9-13 18:06 , Processed in 0.087005 second(s), 19 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表