刚刚,销量第一的机器狗,长出了人形!

浏览18次 点赞0次 收藏0次

谁能想到,有人靠遛机器狗,硬生生甩掉了5公斤。

网友「青苹果的猜想」每天带着机器狗暴走至少5公里。两个多月下来,里程表刷到了262公里,体重秤上的数字跟着一路往下掉。


十岁的男孩Daniel收到了爸爸送的机器狗,从此彻底迷上了出门「遛狗」。

有一次机器狗踩了一脚泥。他嘴里嘟囔着抱怨,身体却诚实地打了一盆水,乖乖蹲在地上给狗洗脚。

他爸爸感慨,这是第一次在儿子身上看到真切的责任感。

就是这样一只冷冰冰的机器狗,把一个慵懒的成年人从沙发上生生拽了起来,也把一个沉迷屏幕的小孩拉回了现实。

相似的剧情,正在数千个家庭里同步上演。



这只机器狗叫Vbot「大头」,售价12988元,首销订单6540台,两周用户留存率高达86%,目前是消费级具身智能销量第一。

在展区里,它自带吸睛体质,吸引了许多人驻足围观,就连歪果仁忍不住为它点赞。



但四条腿跑出来的成绩,只是一个开局。

在2026 WRC现场,Vbot维他动力首次亮相人形机器人Vbot ATOM,并发布「Vbot Embodied Genome|具身基因组」。

为此,我们采访了Vbot维他动力联创兼技术副总裁秦海龙,聊了聊真实终端数据如何反哺模型,以及四足机器人积累的能力,如何成为人形机器人继续进化的起点。


秦海龙在物理AI领域深耕十余年,历任蔚来自动驾驶高级总监、千里智驾首席科学家,主导多模态基础模型和端到端技术在智驾上的工程落地,致力于让机器在真实世界里完成感知、决策和安全执行。

在他的框架里,自动驾驶和具身智能考的根本就是同一张卷子,换掉的只是身体。

汽车是一种身体,四足机器狗是另一种身体,人形又是第三种。既然底层逻辑相通,四足上已经跑通的感知、规划和运动控制,就不必推倒重来,可以直接继承给人形。

这套能够跨身体继承智能的方法,就是「具身基因组」。

整个体系由三条闭环撑起来——

OmniDuplex负责让系统持续交互与思考,WorldModel负责让策略在行动前推演未来,EvoMorph负责让共享的智能落进不同身体,并接受真实物理反馈的检验。


给机器人换个身体

智能还能留下多少?

目前,行业主流的通用化实现,往往只能做到数据层面的共享。可一旦任务结构、身体运动学或者执行器发生改变,整套能力就得重新搭一遍。

Vbot的野心要大得多。他们要让机器人理解世界、规划任务,甚至从真实跌倒中吸取教训的能力,也能像遗传密码一样「继承」下去。


拿生物学类比就好懂了。生物基因编码的是长出心肝脾肺肾的方法,「具身基因组」编码的是生成运动能力的核心逻辑。

一只四足机器狗在办公室里学会了找水杯。当它的灵魂被注入人形躯体时,找水杯的策略思路会被完整继承。唯一需要重新练的,只是换成两条腿走路的姿势。

三条闭环,从人机之间的第一句对话开始。


第一条,IRE(Interaction-Reasoning-Evolution)。

所谓IRE,就是交互、推理、进化。

即,机器人一边跟用户对话,一边在后台不停地想,每一次真实互动都在暗中沉淀,变成新的训练数据和刁钻的困难场景。

它的实现依靠的是秦海龙提出的多模态流式全双工模型——Vbot-OmniDuplex。

在这个Thinker-Talker架构里,Talker负责说话,Thinker扛理解和推理,遇到烧脑的复杂任务,直接委派给更深层的Thinking Layer。


240毫秒一个切片。音频、视频、文本、触发事件,全都被压进这个窗口里往前推。一边开口说话,一边脑子疯狂运转。遇到复杂问题,Thinker把任务抛给后台Agent,结果再无缝传回前台。


第二条,GEO(Generation-Evaluation-Optimization)。

GEO则是一整套策略进化的机制,「生成、评估、优化」不停循环。

首先,策略模型会丢出一批候选动作。然后世界模型接手,逐一预测每条路走下去会发生什么,给出评估信号。策略拿到信号更新自己,下一轮生成更好的候选。

这个循环里最关键的角色是Vbot-WorldModel,动作条件导航世界模型。它负责回答一个具体问题:如果执行这个动作,未来会是什么样。

和那些生成一段好看视频的「世界模型」不同,Vbot-WorldModel拿到的输入是当前画面加一组9D相机动作(旋转、平移共九个维度),而它的输出则是对应的未来画面,也就是给策略提供可信的判断依据。


同样,它的训练也分两步。

在SFT阶段,模型学的是「动作会带来怎样的未来」。输入当前画面和相机动作,生成对应的未来场景。

在DPO阶段,模型学的是「哪个未来更靠谱」。同一条件下生成多个候选,按动作一致性、几何稳定性和视觉合理性构造偏好对,再优化。


实际效果来看,同一帧画面下,仅改变相机动作,模型就能预测出直行、左转、右转三条完全不同的未来分支,并保持可恢复的三维轨迹。

这套系统到底吃进去了多少数据?

77万条以上真实导航片段。从马路到小区到办公室,超3000小时视频,5000公里轨迹,全是真机一步一步跑出来的。


这个数据量扔在行业里相当炸裂。

Waymo和NVIDIA也在用世界模型给策略当裁判,但它们吃的数据全部来自汽车。Vbot的片段百分之百来源于消费终端在生活空间里的真实轨迹。两者面对的场景特性截然不同。

在秦海龙看来,世界模型光能生成未来画面远远不够。命门在于,结果必须可控、可信,能被真机执行。

去年VLA和世界模型的路线之争炒得沸沸扬扬。但本质上,两者只是不同的建模方式。

VLA擅长跨模态对齐,World Model擅长连续空间预测。Vbot死磕世界模型,目的就一个,让策略在执行前看清未来,拿来评估。

第三条,RSR(Real-Sim-Real)。

四足、轮足、人形,底盘、关节、执行器天差地别。多本体运动控制模型Vbot-EvoMorph要攻克的难题,是怎么让同一套动作意图,在截然不同的躯体上各自落地。

秦海龙的解释很形象。不同本体执行同一个任务,向前走、绕障碍、靠近目标,这些高层意图是共通的。唯一不同的,是最底层的关节该怎么扭。


方案分为两层。

共享层把视觉、本体感知、任务指令和形态信息一股脑塞进多模态编码器,输出一组Action Tokens,只管动作意图,跟具体关节无关。

每种躯体再各配一个Body Adapter,把意图翻译成自己能执行的指令。四足翻译出步态,轮足翻译出轮速,人形翻译出关节角度。


同样是「走到桌子旁边」。四足用四条腿轻盈迈过去,人形靠两条腿稳稳走过去,再丝滑地完成重心转移。

RSR底层还藏着一个跟整个行业反着来的训练怪招。

目前的主流做法是Sim-to-Real,在仿真环境里把策略训得炉火纯青,再移植到真机上。


NVIDIA的Cosmos、Google的Gemini Robotics,底层仿真能力确实越来越强。但残酷的现实是,任务越复杂,仿真和现实的鸿沟就越深。操作类任务尤其明显,演示动画看着天神下凡,一上真机立刻拉胯。

对此秦海龙的选择是,反过来把现实差距强行前置。先用真机跑出来的数据回流,再把仿真环境一比一抠到逼真,最后把模型扔进去特训。


具体来说,真实运行日志先经过系统辨识,估计出质量、惯量、摩擦力等物理参数。再用回流数据做三维重建,给每个物体贴上语义和属性。哪张桌子能绕,哪个杯子能抓,在仿真里标得清清楚楚。

发布会演示的仿真环境,就是这条反叛思路最硬的印证。

Vbot采集了北京国泰办公室及周边的真实场景,一比一重建成带完整语义标注的数字资产。同一场景里疯狂切换视角、更换本体、随机改变起始位置,排列组合着拉练。


四条腿跑出23,700公里

直接灌进人形大脑

今年5月交付以来,系统推了4次OTA大版本,塞进31项新功能,打磨了66项体验细节。


发布会现场,Vbot维他动力创始人兼CEO 余轶南在回顾大头从「探路」到「跟随」、再到「伴随」的功能演进时,讲了一个产品被真实用户不断改写的故事。

刚开始SOP时,大头提供的是户外探路功能,用户需要一直牵着信令装置。用户很快反馈,这种方式不够方便,希望机器狗能够自主跟随。

5月28日,户外跟随功能正式推送,用户只需把小型信令装置放进口袋,大头就会跟在身后行走。

余轶南坦言,自己起初更喜欢让机器狗在前方探路,没想到两个多月的真实数据给出了相反答案:约70%的用户选择了跟随模式。

不过,新的问题也随之出现。大头一直跟在身后,用户难免频繁回头确认位置,资深用户甚至会通过机械脚步声判断它的距离和状态。

8月15日,Vbot通过OTA 1.5向公测用户推出户外伴随功能。大头无需牵绳,也不再始终落在身后,而是自主调整身位、保持在用户视线范围内,让户外同行更自然,也让用户更踏实。

截至发布会当天,大头跟用户聊了126万次天,陪着走了23700公里,陪伴时长突破131500小时。


照这个速度,预计10月总里程就能绕地球一圈。

用户遛出的每一步都在回流。交互对话、导航片段、仿真重建的素材,全从这里来。

四条腿跑出来的公里数,就这样成了人形机器人学会走路的第一桶数据。

Vbot ATOM

走进「生活空间」

ATOM的身高,是被无数个真实的中国客厅倒推出来的。

团队拿着卷尺量遍了橱柜台面、走廊通道,最后定下了1.6米的身高、1.8米的臂展、以及31个自由度。

这样一来,ATOM不仅能拥有全尺寸的灵活性,够到家里常见的台面和立面,而且站在边上还不会有压迫感。


而让它真正和展台上那些钢铁骨架拉开差距的,是几个看起来非常「温柔」的选择。

金属躯体上包裹了大面积织物,脚底沿用大头的静音设计。

一台要走进人类家庭的机器人,不仅要能干活,你还得让人从心底里愿意和它在一个屋檐下待着。

发布会亮相的还只是ATOM初代机,预计年底交付,分个人版、企业版和开发者版。

场景跟大头跑过的地方一样,家里、店里、办公室里。只不过整理桌面、搬运货架、拧门把手这些动作,需要一个站着的身体。

四足产品线这边,大头EDU-W轮足版同步上市。

它不仅可以达到最高2.5m/s(约9km/h)的速度,而且还搭载了自研「地面悬停增稳」算法,可以主动补偿路面起伏,让上层载荷和感知设备尽量不晃。

只见,它背着一台Insta360相机在斜坡上行进,机身居然稳如泰山,几乎纹丝不动,这防抖性能真的绝了!


放弃花哨后空翻

一头扎进真实世界

Vbot在发布会上给自己贴了个新标签。一家死磕生活空间的具身智能终端公司。

公司刚成立那会儿,也走过秀场路线。后空翻、叠衣服、让机器人成群结队跳舞,全干过。冲着顶会论文、行业榜单和极客演示视频去的。

但这套玩法搞了一段时间,团队觉得味道不对。这些酷炫的技术秀,始终缺少一些真正能直面市场、刺痛用户痛点的东西。

痛定思痛,整个团队调转船头。

人形机器人赛道早就卷成了修罗场。展会上动辄上百台人形同台斗艳。但行业至今面临的共同难题是,产品到底卖给谁,在什么场景落地。

ATOM的出现打破了这个局面。它把落地场景、物理构型、定价、交付时间表和OTA方案,全部放在了台面上。

Vbot的创始团队清一色脱胎于汽车和自动驾驶——创始人兼CEO余轶南,以及三位联合创始人——研发副总裁秦海龙、产品总裁赵哲伦、工程与系统团队负责人宋巍。

他们深知,做汽车最要命的就是,安全,安全,还是安全。

这条底线搬到机器人身上,一模一样。

电子电气架构、机械关节、AI大脑,三层不确定性死死叠在一起,一旦失控,安全风险比造车还难预料。

这就是Vbot当年咬死从四足开始做的根本原因。体型小,重量轻,对人的伤害风险低得多。

先把这只小狗扔进市场里,在真实使用中摸边界、攒数据,然后才敢往人形上扑。


千万不要冒进。

采访结束时,我们把这个终极问题抛给秦海龙:如果机器人换了一副身体,此前积累的智能,究竟还能留下多少?


秦海龙说:「实时交互、用户意图理解,以及基于意图对未来进行推理,能够跨任务、跨本体继承;不同本体则需要在真实世界中持续探索和回流数据,形成适合自身的身体表达。具身基因组正是连接这两类能力的同源智能体系。」

这也正是ATOM亮相更深层意义:它不是Vbot换一副身体重新开始,而是让每一台进入真实世界的机器人,都成为下一台机器人继续进化的起点。

对于Vbot而言,当智能可以跨本体继承、在真实反馈中持续生长,人形机器人走进生活空间,就不再只是一场关于未来的想象,而是一条正在被终端、数据与用户共同铺就的现实路径。

编辑:摩西 桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯