热门搜索:  财经郎眼

千方百计爱上你

1.5B开源通用VLA模型,冲进具身智能第一梯队_我的网站

冰与火之歌第一季

A |     金磊 发自 上海          量子位 | 公众号 QbitAI          一个新的国产VLA模型诞生了,而且只有1.5B。

B |          Size这么小,能好用吗?          来,话不多说,我们直接看效果:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          在上面这个真机演示里,两只机械臂围着桌面开始做三明治。    马拉松凉了。它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。

C |          再来看下另一段演示:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。         从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。                   不是因为大家不爱跑步了,而是因为有些地方办赛办得有点“走火入魔”。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。

D |          更关键的是,这套能力直接跑在机器狗本地!          电梯和地下停车场往往是网络信号比较差的地方。

E | 即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。

F |                    这个十月份,全国各地的马拉松跟拉了个“摆烂群”似的,集体停摆。                   山西临汾,不跑了;山东多个县市,审批权直接上收,不跟你多BB;广东翁源,直接停办;连河北蠡县这种以往凑热闹也要搞个“欢乐跑”的小地方,今年也彻底哑火。

G |          而在这两段Demo背后,则是面壁智能在WAIC期间正式发布并开源的MiniCPM-Robot系列模型。                   大家公告写得那叫一个冠冕堂皇,不是“天气原因”就是“出于安全考量”,听着特别为你好是吧?                    但实际上呢?                    是这场蒙眼狂奔了十年的“马拉松大跃进”,终于被现实抡圆了膀子,结结实实踩下了一脚急刹车。         目前包含两个模型:          MiniCPM-RobotManip:也就是开头控制机械臂做三明治的通用VLA模型,参数量只有1.5B。

H |                    我们看看马拉松这个事前几年是什么光景?                    是个城市就想搞“马”,好像不办个马拉松,你都不好意思说自己是现代化都市。         MiniCPM-RobotTrack:主要负责机器人的跟踪与导航,让机器人能够根据自然语言指令,在动态环境里持续跟住指定目标。              和它们一起出现的,还有开源具身智能推理框架PhyAI,负责让这些模型更快地适配硬件、跑到真实机器人上。有那么一段时间,“某马”成了城市最光鲜的烫金名片,朋友圈里不发个定位和奖牌,你都不好意思说自己是中产。                   但狂欢的背后,是市民被堵在路上的骂娘,是财政钱包被掏空的心疼,是安全风险悬在头顶的达摩克利斯之剑。                   所以,这脚刹车,它不是不让你跑步,不是要扼杀全民健身的热情。         简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。                   是让你别瞎跑!                    是让那些把马拉松当“万能解药”的地方清醒清醒;是让那些不顾民生、不计成本、不管风险的“盲目跟风赛”、“赔本赚吆喝赛”、“非洲选手定向扶贫赛”,统统歇菜!                    2                    你以为马拉松是全民健身?                    醒醒吧,在不少城市,它早就变异了,变成了妥妥的“民生压力测试仪”——而且是硬考、考崩了还不认账那种。                   怎么个“压力测试”呢?                    搞马拉松肯定要封路,虽然很多地方并不知道封路了会怎样,但为了搞马拉松只能硬着头皮封,看半座城会不会瘫。         面壁这次端出来的,已经是一套逐渐成形的具身智能组合。

I |          跻身第一梯队,延迟接近一半          先来看MiniCPM-RobotManip。         虽然参数量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA评测里,它的整体表现已经进入第一梯队,与π0.5等模型处在相近水平。         真正把差距拉开的,是对机器人记忆力的考验。                   公交改道,司机懵了;商铺关门,老板哭了;如果你正好赶通勤上班,自求多福吧。         很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。         比如让机器人点击画面里的第二个按钮5次。                             曾有某地方的一个区,为了搞马拉松,一天收过1300条投诉。                   你这边跑得热血沸腾,朋友圈发得风光无限,那边市民群里骂声一片:“又封路?”“我上班迟到谁给我扣钱?”“我家门口卖煎饼的大爷今天又白出了摊。

J |          如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。         MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。它知道任务已经进行到哪一步,也知道什么时候应该停下来。”                    更夸张的是,有些赛事一封就是68小时。         在专门考察上下文记忆的RMBench中,π0.5的成绩约为10分,接近随机水平,MiniCPM-RobotManip则达到约53分。                   68小时啊朋友们!这不是封路,这是给城市做“节流手术”——把干道血管掐了,看城市还能不能喘气。         这项能力对真实机器人很重要。                   结果呢?城市的正常运转说崩就崩,市民的日常生活说乱就乱。                   这哪是办体育赛事啊?这分明是拿整座城市做一场大型“瘫痪实验”,而实验的代价,是每一个普通人的时间、生计与耐心。         叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。

K | 机器人只看眼前,很容易做到一半便“失忆”;能记住此前的状态,才有机会把长任务完整做完。                   所以别怪大家吐槽:你办的是“马拉松”,市民承受的是“马拉松式堵车”“马拉松式绕路”“马拉松式生气”。         除了记得住,机器人还得反应快。                   3                    再说钱。                   你以为办一场马拉松很便宜?兄弟,你那是对“烧钱速度”一无所知。         面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。                   来,我们掰开揉碎了算算这笔账:                    安保,要人墙吧?医疗,要救护车、AED、冰桶吧?志愿者,要管吃喝发服装吧?                    这还没算上计时系统、舞台搭建、物料运输等等乱七八糟的东西……                    业内测算过,万人规模的马拉松赛事的人均办赛成本高达300-500元,半马赛事中标金额普遍在100万至300万元,全马更是400万至600万元。         这里的“成本减半”,主要是体现在推理延迟和计算量上。         聊天模型多想一秒,用户通常还能等。                   对于一个年预算没多少的小县城来说,一场马拉松,很可能直接干掉它全年文体经费的三分之一。                   三分之一啊!够修多少个社区篮球场?够给公园换多少套健身器材?够办多少场老百姓真正能参与、真能笑得出来的广场舞比赛和乒乓球赛?                    但你猜怎么着?就这么砸钱,回报呢?                    现在的普通跑者都开始“精打细算”。

L | 机械臂每做一步都停顿一秒,动作马上就会变得僵硬,整个任务的完成时间也会被拉长。         对VLA来说,能不能在有限算力下快速输出下一步动作,和榜单分数一样重要。本地参赛者大多数是自己人,买装备买服务不够凤毛麟角,钱包根本没打开。         MiniCPM-RobotTrack也走了类似的小尺寸模型路线。                   外地跑友来了,大多是体面地溜一圈就走了,连带周边消费都没带动起来。         它以MiniCPM4-0.5B为基础,整体参数规模为0.9B,主要测试三种真实场景。人均消费利润可能还达不到办赛成本。         第一种是单目标跟踪。给它一句明确指令,机器狗持续跟着指定的人。         第二种是多人干扰。                   你这边花几百万搭台,别人过来就是拍个照、领块奖牌、发个朋友圈,扭头就走。留下你,对着空空如也的钱包和一堆待付的账单。                   所以这哪是办赛事啊?                    这分明是“自残式慈善”——还是专门针对外地选手和非洲兄弟的“定向扶贫慈善”!                    你烧着本就不宽裕的财政,堵着本地市民的路,惹着老百姓的骂,最后就为了成全少数人的奔跑梦想和朋友圈九宫格?                    这不是情怀,这是算不清账。                   这不是发展体育,这是高级败家。周围几个人同时移动、交叉甚至交换位置,模型依然要认准最初的目标。                   4                    而且中国的马拉松,现在被调侃成“非洲兄弟定向扶贫项目”一点不冤。         第三种更难,指令本身可能比较模糊。

M |                    你别不服,看看大部分领奖台就知道了——冠军、亚军、季军,清一色的黑人兄弟,不知道的还以为是非洲高原分原。                   而且这背后,可不是什么单纯的体育交流,而是一条被跑通了的、高度成熟的“马拉松淘金产业链”。比如只说“跟着穿黑衣服的人”,现场又恰好有多个穿着相近的人,模型需要结合画面理解人类到底指的是谁。                   从埃塞俄比亚坑坑洼洼的黄土训练场,到中国崭新平整的塑胶赛道,黑哥们远渡重洋而来,目标明确:跑步,拿奖,盖房,走上人生巅峰。                   甚至有的黑哥们儿,在一些赛事上穿着凉鞋都能夺冠。

N |                    这不是魔幻故事,是现实。         在没有进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类任务上的追踪率分别达到89.8%、73.4%和80.4%,均取得开源方案中的最优结果。                   这也不是励志故事,这是对咱赛事水平的一种无声嘲讽。                   我们呢?我们出了钱,出了力,出了赛道,出了骂声,承担了所有的封路成本和民生抱怨。         相比OpenTrackVLA,三项追踪率分别提高7.0、14.6和6.5个百分点。

o |                    最后,站在聚光灯下的、捧着支票合影的,没一个自己人。

p |          在相同的单视角、纯SFT设定下,与闭源模型TrackVLA++相比,它在单目标跟踪和模糊目标跟踪上的追踪率分别高出8.8和17.0个百分点,模糊目标跟踪的成功率达到58.0%。         参数小,表现却没有明显掉队。                   我们本土的跑者,辛辛苦苦训练,吭哧吭哧交报名费,好不容易中个签,最大的荣誉可能就是一块“完赛奖牌”,和朋友圈的几个赞。         机器人模型的竞争,也开始从单纯拼规模,转向拼单位算力到底能换来多少能力。                   你说这是“国际化”?                    拉倒吧!这顶多算“国际化韭菜”——我们负责当土壤、浇水、施肥,最后成熟的果子,都被别人摘走了。                   主办方赚了个“国际赛事”的名头,经纪人赚了丰厚的佣金,黑哥们赚了改变命运的奖金。                   只有目的地,沉浸在一种“我们办了大比赛”的虚假繁荣里,回头一算账,啥也没落下。         把机器人看到的世界压缩一下          MiniCPM-RobotManip能把尺寸压到1.5B,背后离不开面壁过去在多模态模型上的积累。                   这不是体育精神的胜利,这是算数没学好的悲剧。         它基于MiniCPM-V 4.6训练而来(开源不到2个月,下载量已突破200万)。                   5                    而且更关键的是马拉松赛事风险并不低。

q |                    这年头,办马拉松就像在雷区里开演唱会,听着热闹,但指不定哪步就炸了。

r |                    最直接的就是天气,这玩意儿完全不跟你讲武德。                   你这边舞台搭好了,广告位卖出去了,几千号选手从全国各地飞过来了,领导也请来准备剪彩了——结果一场暴雨/高温/大风预警突然拍脸上。                   几百万的投入,瞬间归零。                   不是打折,是清零!这哪是办赛事啊,这简直是和老天爷玩“概率轮盘赌”,赌注是地方财政的真金白银。                   但比天气更可怕的,是选手安全。

s |          面壁的MiniCPM-V/O系列已经持续迭代两年多,开源总下载量超过2500万。

t |                    赛道旁ICU床位够吗?急救人员配齐了吗?AED设备能覆盖全程吗?                    之前某县半马选手猝死的悲剧,就是最血淋淋的警告。过去积累的图像理解、视频理解和多模态信息处理能力,如今被进一步搬到了机器人身上。一旦出事,就不是钱的问题,是头条新闻。                   所以,政策这只“看得见的手”终于重重按下来了。                   广东明确:C类赛事,省体育局来终审,别自己想办就办。         机器人执行一次动作,需要处理的信息其实很多。

u |          一台双臂机器人通常会同时接收三个摄像头的画面,包括两个腕部相机和一个主视角相机,再加上一段文字指令,最后输出一个可以执行的动作。         而且,这个过程一秒要重复好几次。                   山东出手:县级?别瞎折腾了,审批权直接上收。         如果每一张图片都被转换成大量视觉Token,机器人运行得越久,需要处理的历史信息就越多,计算量很快就会堆起来。

v |                    浙江表态:明年开始,严控数量,别搞那么密。

w |                    这可不是打压体育产业,恰恰相反,这是在“兜底”,是在“拆弹”。                   再放任某些地方这么蒙眼狂奔下去,迟早要出大事。

x |          MiniCPM-RobotManip采用的办法,是尽量压缩视觉Token。现在收紧,不是不让跑,是告诉你:“没那个金刚钻,别揽那瓷器活。安全底线守不住,一切都白给。         桌面纹理、墙面图案等和当前任务关系不大的信息,不必占用太多Token。模型用更短的数据表示保留关键内容,单次推理需要处理的信息量也随之下降。

y | ”                    政策的口子一紧,很多原本头脑发热的地方,瞬间就冷静了。                   毕竟,谁也不想成为下一个因为一场比赛而上热搜的负面典型。         信息少了,推理自然更快。                   6                    所以叫停不是坏事。                   恰恰相反,这叫理性回归,是发烧四十度后终于吃下的那片退烧药。

z | 对应到机械臂上,就是等待时间更短,动作衔接更顺。

|          视觉Token压缩还有一个更大的用处,可以帮助机器人以更低成本保留历史记忆。

|                    马拉松不是不能办,是不能瞎办。         常规方法每获得一张新画面,都要把此前的历史重新计算一遍。任务越长,计算量增长得越快。                   不是所有城市都配叫“马拉松之城”,就像不是所有会煮泡面的人都叫厨神。         MiniCPM-RobotManip采用流式计算,前面已经处理过的信息可以继续复用,新画面进来后,只需要接着往下计算。         这就有点像看连续剧的感觉了。         普通做法每更新一集,都要从第一集重新看起;流式计算则会记住之前的剧情,直接从最新一集接着看。         机器人因此可以带着更长的历史继续执行任务,同时避免计算量一路暴涨。                   你小县城总共就两条主干道,一封路全城血压升高;你ICU床位加起来不到十张,却敢接万人规模的赛事——这不叫勇气,这叫莽。

|          1.5B的尺寸,也和机器人的实际运行需求有关。         面壁在将约200毫秒视为机器人操作体验的一道临界线。

| 再慢下去,机械臂和机器狗的卡顿感就会明显增加。                   也不是所有比赛都必须请黑人选手来撑场面。         当前多数VLA基础模型都控制在4B以内。模型继续做大能带来多少真实操作收益,行业仍在验证。          作者声明:该图片由AI生成          到了MiniCPM-RobotTrack这里,轻量化的思路又换了一种实现方式。                   “国际化”不是“非洲化”,更不是“奖金外流化”。         它把视觉画面、自然语言指令和机器人的控制决策放进同一个模型里统一处理。

|          用户说一句“跟着前面穿黑衣服的人”,模型会直接结合摄像头画面理解指令,再把判断转换成机器狗的运动控制。         整个过程不需要额外安装一套目标检测模块、一套识别模块,再接一套跟踪系统。你把几十万美金塞给外国选手,回头财政喊穷、市民骂街,这哪是提升城市形象?这是主动申请被吐槽“人傻钱多速来”。也不用外接开发板,只靠宇树Go2 Edu原装摄像头和本地算力,就能完成单目标跟踪、多人干扰跟踪和模糊目标跟踪。         不过,真实世界总会出现训练集里很少见的情况。         目标可能突然从镜头前横穿过去,也可能快速转弯,被其他人短暂挡住。几个人同时交叉走动时,机器狗还要避免跟错人。                   那我们该干嘛?                    简单啊,把原先砸给一场“面子马拉松”的钱,拆开来用:                    修它十几条社区健身路径,办它几十场老百姓真能参与的“迷你跑+非遗展”。再不济,多办几届广场舞大赛、小区篮球赛,它不香吗?                    这些才是真正让市民动起来、笑出来的“体育实事”。         这类场景数量少,却最容易让模型翻车。所以,面壁为此搭建了一套自进化数据管线。         团队先对原始数据进行检查和清洗,把异常轨迹、错误动作和无效交互剔除掉。                   不比封半座城、扰几万人,就为搞一场朋友圈限定版“精英秀场”强?                    说到底,这场急刹车刹的不是全民健身的热情,刹的是那些脱离民生、脱离实际、脱离常识的“功绩冲动”。

| 随后让模型进入仿真和真实机器人环境,在持续运行中主动暴露自己的薄弱环节。                   城市治理不是搞行为艺术,不能你爽了,市民惨了。                   体育精神也不是砸钱就能买来的,不是你请几个国际选手、搞几个无人机航拍,就真成了“体育强市”了。                   当一场奔跑不再是为了健康与快乐,而是为了流量、为了面子,那它注定跑不远,也跑不久。                   所以,停,不是终点。

|          系统再把这些容易出错的场景集中收集起来,通过专家策略进行纠偏,放回下一轮训练。

|          说得通俗一点,这就像给机器狗准备了一本会自动更新的错题本。                   停,是为了更好地跑。

|          经过一轮轮闭环训练,目标横穿、快速转向、短时遮挡、多人交叉这些长尾问题,也能不断得到加强。         模型训好了,装到真机上仍然有一道关。         摄像头采集、画面编码、模型推理、动作生成、指令传输,任何一个环节慢下来,最终都会反映在机器狗的动作上。                   停下来,想一想:                    我们到底为什么而跑?为谁而跑?是为市民的健康而跑,是为城市的活力而跑,还是为那份“别人有我也要有”的虚荣而跑?                    想明白了,再出发。         面壁围绕宇树Go2的完整运行链路做了系统级优化。目前MiniCPM-RobotTrack在机器狗原生本地算力上可以稳定达到5Hz以上,端到端响应延迟约180毫秒。         这次开源的内容也不只有模型权重,还包括环境安装、模型加载、摄像头接入、文本指令输入、控制接口和一键启动脚本。                   那时候的马拉松,才不再是一场“烧钱式巡游”,而是真正扎根于城市土壤、生长于市民心中的——                    “全民的马拉松”。                   图片来源于摄图网和网络截图。         准备一台Go2 Edu,就能按照开源流程把模型部署起来。         本地部署的好处,在电梯和停车场的演示里体现得很直接。         机器人不用等待画面上传云端,也不用等远程服务器返回结果。摄像头数据和用户指令留在本地,网络信号变差后,完整功能依然可以继续运行。         直接拔掉网卡,机器狗照样能根据摄像头画面和文字指令,完成目标识别、持续跟踪和运动控制。

|          除了MiniCPM-Robot系列之外,这次还有一项容易被忽略的发布——PhyAI。

|          它是一款面向Physical AI的开源推理框架,由明体科技联合北京邮电大学、北京大学研发。

|          具身模型想从实验室跑到真实机器人上,中间还要经过硬件适配、量化、算子优化和部署。         不同VLA、世界模型的结构差异很大。每发布一个新模型,再从头适配一次,时间和工程成本都不低。

|          PhyAI想做的,就是把这段路缩短。         在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型官方仓库分别实现约2.85倍、1.82倍和2.28倍加速。         适配MiniCPMRobot系列模型时,PhyAI先通过CUDA Graph把推理帧率从10.12Hz提高到33.28Hz,再加入为模型定制的融合算子,在NVIDIA H20上进一步提高到36.77Hz。         前面是模型效果,这里解决的是工程效率。

|          模型能干活,还得尽快跑上硬件,跑得足够快,才能真正进入更多机器人。         机器人需要又好又便宜的大脑          具身智能行业从来不缺精彩Demo。真正难的是离开展台之后,机器人还能不能稳定工作。         清华大学人工智能学院助理教授、面壁智能多模态首席科学家姚远在访谈中也提到:          现阶段不少机器人Demo会围绕单一任务采集大量数据,再进行针对性优化,展示效果并不能完全代表基础模型的真实进度。

| 面壁更看重模型的基础性、泛化性和通用性,希望先把数据、Infra和工程链路打磨好,让基础能力提升后自然覆盖更多场景。沿着大语言模型的发展经验,具身智能最终也要走向“先通后专”,先理解物理世界的基本常识,再成为做饭、叠衣服或仓储作业等具体领域的专家。         展馆、园区和工厂里,网络信号不会一直满格。

| 机器人还要面对隐私、数据合规、任务失败和异常恢复等一连串现实问题。

|          榜单分数再高,走到地下停车场便停摆,落地空间依然有限。

|          这也是面壁把端侧能力放在重要位置的原因。         在与乐聚机器人的合作中,面壁把端侧多模态大模型、夸父机器人本体和导航系统组合到了一起,推出展厅导览Agent和园区巡检Agent。         展厅导览机器人在无网环境下,也能基于本地知识库完成离线讲解和自由问答。它可以理解展厅环境和人的指令,规划导览路线,同时完成避障。         园区巡检机器人则可以识别车辆违停、路面异常和公共设施问题。

| 敏感画面直接在本地处理,数据留在客户侧。         与吉利汽车的合作,则进一步走进了生产仓储场景。         面壁和吉利共同训练VLA模型,再通过RoboHarness把VLM、VLA、机器人本体和导航系统接到一起,让机器人执行仓储中的长程任务。         RoboHarness可以理解成物理世界里的Agent执行框架。         上层VLM负责规划任务,VLA和导航系统作为可以调用的工具。框架还会管理长任务的上下文和记忆,遇到失败时进行重试和恢复。         机器人每完成一次任务,运行数据还会进入可治理的数据闭环,继续帮助模型进化。          作者声明:该图片由AI生成          到这里,面壁此次在WAIC带来的具身智能路线已经比较清楚了。         MiniCPM-RobotManip负责操作,让机械臂理解任务、记住过程,再把事情做完。

|          MiniCPM-RobotTrack负责跟踪导航,让机器狗在复杂环境里认准目标,断网也能继续走。         PhyAI负责把模型更快地部署到真实硬件上。              再往外,乐聚和吉利的合作开始把模型、本体、导航和具体业务流程接起来。         大语言模型时代,人们习惯用参数量判断能力。但机器人真正走进物理世界后,参数只是其中一个数字。

|          它还得反应够快、记得住、断网能跑,数据留得下来,遇到意外能够恢复,成本也要控制在企业愿意长期使用的范围内。         从这个角度看,1.5B和0.9B的意义,也就不止是“小”。

| 它们更像是在回答一个很现实的问题:          当AI真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。         GitHub链接:          https://github.com/OpenBMB/MiniCPM-Robot          HuggingFace链接:          https://huggingface.co/openbmb/MiniCPM-RobotManip          https://huggingface.co/openbmb/MiniCPM-RobotTrack。

Current article:http://f95g2k.guizhuanguchuanluanzhoudi.shop/list_ol82tz/mca.html

Published on:19:50:30