
2026年上半年,具身智能赛道超935亿元融资,322起融资事件将行业推上风口。
和融资热潮一起到来的,是另一个同样高频出现的词汇——“全球第一”。据不完全统计,目前活跃于行业的各类榜单已超过20个,几乎每周都有新的“第一”诞生。
星动纪元、智元、跨维、千寻智能、极佳视界、鹿明……各家企业的战报里,动辄便是登顶某国际榜单的捷报。RoboChallenge Table30的榜首半年内换了四次,World Arena在同一时期冒出了两个“第一”。
更耐人寻味的是,“第一” 的生产速度甚至跑赢了机器人技术的迭代速度。一款模型从发布到登顶榜单,往往只需要一周;榜单更新的频率,甚至比企业产品迭代周期还快。
这种现象并不令人意外。资本在追逐标的,标的在争夺注意力,而注意力需要一个简单粗暴的锚点,“第一名”恰好满足了这种需求。
但问题是,当前具身智能行业尚缺乏一套公认的技术评价体系,具身智能又是个技术路线分散的赛道,一个好的具身智能究竟是什么样的,行业还在探索中。
在一片混沌中,大量评测榜单粉墨登场。公众和资本不禁要问,这些第一究竟有多少含金量?又是谁在批量制造这些第一?当榜单狂欢盖过技术本身,具身智能这条被寄予厚望的前沿赛道,正在经历一场从泡沫到务实的成人礼。
文章中,千寻智能自研的具身基座模型Spirit v1.6在RoboArena榜单上综合得分全球第一,力压英伟达Cosmos3和Physical Intelligence的Pi0.5,“打破硅谷九游体育平台霸榜魔咒”,而RoboArena更是千寻智能口中“具身智能奥林匹克”“世界级权威主榜单”。
技术登顶与融资落地的时间点重合,一切看起来都是具身智能赛道的标准叙事,一家创业公司凭借技术突破获得资本认可。
殊不知,仅仅几天后,这场“胜利”被戳破。有业内人士梳理RoboArena公开的310条评测记录后发现,其中72%的分数仅来自两个注册账号,ECUST Robot Lab与Robotics Lab,前者对Spirit v1.6评测了179次,给出的胜率高达 97%;后者评测45次,胜率86.7%。
形成鲜明对比的是,英伟达官方用同款模型测试21次,胜率为0%。更蹊跷的是,这两个高频评测账号均在5月底集中注册,此后Spirit v1.6的评测记录便爆发式增长,其中ECUST Robot Lab累计276次评测里,超过六成的评测对象都是千寻智能的模型。
事件最终以RoboArena官方回溯调查、移除可疑数据、Spirit v1.6从主榜消失收场。但这起事件更像一扇窗口,照出了具身智能榜单的水分。
过去半年,具身智能模型评测堪称“铁打的榜单,流水的第一”,几乎每隔几天就有一家企业宣布“登顶全球榜首”“力压国际巨头”“斩获赛道第一”。
今年2月,原力灵机DM0宣称在RoboChallenge真机评测中获得单任务与多任务双项第一;
这期间,World Arena榜单上还出现了星动纪元Ctrl-World拿“具身任务能力全球第一”、北京人形Pelican-Unify成双冠王的局面。
每个“第一”都有榜单背书,每个榜单都有自己的赛道划分。当“第一”成为流水线上的标准件,我们需要追问的是:谁在拼命要这个第一,又是谁在帮他们制造?
对创业公司而言,榜单第一从来不是荣誉勋章,而是商业工具。本质上,具身智能仍是典型的故事驱动型赛道,技术路线未定型、商业化未跑通,投资人判断企业价值缺乏硬指标,榜单排名便成了最直观的估值锚点。
一个“第一”的头衔,往往能直接拉动估值上浮数亿元,更是下一轮融资的敲门砖。
千寻智能和星动纪元都是在登顶榜单后,同步宣布的融资消息。榜单发布与融资官宣的高度同步,早已是行业公开的操作惯例,先拿榜单造势,再用热度抬估值,最后完成融资交割,榜单甚至成为资本叙事里的标准配置。
除了融资,榜单也是企业市场宣传的核心卖点。面向政府、产业客户与公众,“全球第一”是成本最低、穿透力最强的营销话术。
当行业里每家公司都在讲模型能力、讲泛化能力,但又缺乏一把公认的尺子时,榜单第一就成了最容易被外界理解、最方便传播的信号。
需求旺盛的地方,自然会催生供给。如今的具身智能赛道,榜单早已不是第三方中立评测,而是一门成熟的生意。
目前市面上的具身智能榜单大致可分为三类,考察机器人真干活的能力的VLA操作综合榜、考察对物理世界的推演能力的世界模型榜、考察极端场景下的单点能力的专项基准榜。
问题在于,部分榜单本身就是商业产品。标准不透明、规则可干预,与商务合作深度绑定。在6月举办的智源大会上,智源研究院院长王仲远直言,现阶段“榜单并不完全可信,各种各样的榜单令人眼花缭乱。”
即便是看似中立的技术评测榜单,也存在大量可操作空间。RoboArena事件暴露的就是分布式评测机制的漏洞。根据官网介绍,RoboArena是一个分布式评测框架,发起者来自加州大学伯克利分校、斯坦福大学、华盛顿大学、英伟达等高校和科技巨头,兼具顶尖学术机构、头部科技公司背书。
在RoboArena上,任何机构都可以成为评测者,相当于考生自己可以注册账号当考官给自己打分。
而更多封闭式评测榜单,则存在“针对榜单专项优化”的情况。2026年自变量算法举办的具身智能黑客松赛事,南京邮电大学的参赛队伍在公开A榜的 “按指令分类水果”任务中,针对固定的水果品类、标准摆放位置反复微调模型,将单任务成功率拉至赛事上游。但在进入完全未知的盲测B榜后,赛事方新增了未训练过的水果种类、加入干扰物体并调整了桌面布局,这套专为A榜打磨的模型效果大不如前。
这显然是一场具身智能赛道的“应试教育”。把固定考题练到娴熟,自然能交出亮眼答卷,可一旦脱离预设环境,性能便会立刻现形,而这种定向优化换来的高分,与具身智能追求的、适配真实复杂物理世界的泛化能力,完全背道而驰。
当需求与供给就位,刷榜就成了一场心照不宣的集体狂欢。企业需要第一来融资,资本需要第一来讲故事,唯一被忽略的,是具身智能本该扎根的技术与线具身智能狂奔,行业需要一把价值标尺
如果说刷榜乱象是表象,那其根源则在于一个更深层次的困境,整个具身智能行业,正处于一场没有统一参照系的蒙眼狂奔之中。
技术路线分散之外,具身智能赛道迭代速度堪称你追我赶。这两年,无论是WAIC等展会的比拼,还是玩家们产品的路线年行业比拼机器人自由度、静态行走稳定性;2025年竞争焦点转向VLA视觉语言动作模型的基础操作成功率;迈入2026年,赛道重心转移至世界模型预测能力、无遥操连续作业、异常场景自主恢复等指标。
宇树科技一年之内接连迭代G1人形机器人硬件版本,先后开源UnifoLM-WMA-0、UnifoLM-VLA-0两代UnifoLM系列具身模型;云深处科技机器人产品线迭代节奏迅速,人形产品从DR01原型机升级至面向工业场景的DR02全天候人形机器人,同时持续更新绝影系列四足机器人;智元机器人持续更新AGIBOT人形本体与GE-Sim仿真世界模型,迭代仿真数据集与真机作业策略;星动纪元在不到一年时间内连续迭代多代具身智能算法,持续演进ERA系列VLA基础模型,并推出Ctrl-World可控生成式世界模型,搭建策略模型与世界模型协同训练体系。
IT桔子数据显示,上半年国内具身智能赛道融资总金额达935亿元,较 2025 年同期提升5倍;融资事件322笔,同比增长137%。此外,百亿估值独角兽企业至少已有22家,而2025年时仅有3家。
WAIC 2026无疑是个可参考的风向标。相比于过去展会比拼“谁会倒水”“谁的手指更灵活”,今年的具身智能展区,展台变成了微型工位。一些玩家把酒店洗衣房、咖啡馆、便利店完整搬进展馆,人形机器人全场零遥操、纯自主运行,完成洗衣、叠衣、制作咖啡、商品拣选等全流程作业,所有场景均来自真实合作品牌的运营需求。
所有的泡沫终会退去,所有的虚名终会落地,具身智能的终极考场,永远是真实的物理世界。机器人会不会走路、模型跑分高不高,最终都要回答一个问题,它能不能在工厂里替代人工、能不能在家庭里提供服务、能不能在真实场景里创造价值。

