四层模型铺出的路:人形机器人从能走到能干的设计底层
阅读:8
更新时间:2026-08-27 15:19:00
如果把人形机器人比作一个人,过去几年前大家比拼的是谁的骨架更结实、谁的关节更灵活,现在竞争的焦点在硬件本体。这几年风向变了,比拼的重心逐渐从骨头转向了脑子。同样一个机器人能不能干活、能不能适应新任务、能不能处理意外情况,这些问题越来越指向同一个核心——模型能力。
小米机器人的模型演进路径,很能说明这个趋势。从二零二五年十一月发布的MiMo-Embodied,到二零二六年二月的Xiaomi-Robotics-0,再到当年七月的Xiaomi-Robotics-1,最后是同一年七月发布的世界模型Xiaomi-Robotics-U0。不到一年时间里,连续发布四代模型,每一代解决的问题都不一样,一层一层地往上叠加,最终构成了一个相对完整的模型体系。
从系统设计的角度看,这种分层演进的思路非常清晰。它不是一步到位做一个万能模型搞定所有问题,而是从底层到上层依次推进,每一层解决一类问题,层与层之间相互配合、相互支撑。这种架构设计的思路,在工业设计领域其实非常常见。一个复杂的产品系统,从来不是单一部件的简单堆砌,而是多个子系统的协同工作。每个子系统有自己明确的功能边界,子系统之间有清晰的接口定义,整个系统通过分层协作实现最终的功能目标。
我们来具体看这四层模型分别解决什么问题。
第一层是MiMo-Embodied,解决的是环境理解的问题。说白了就是让机器人搞清楚自己面前有什么东西、东西在什么位置、该用什么方式去抓。这个能力听起来简单,却是所有动作的基础。你连面前的物体都认不出来、位置都判断不准,后面的动作再流畅也没用。这就像人一样,眼睛看不见东西,手再灵活也白搭。
这一层模型还有个值得注意的细节,小米在里面联合训练了自动驾驶和机器人的数据,并且验证了两类物理世界数据能够相互促进。这个点非常关键。它说明不同领域的模型,只要面对的都是物理世界,底层的感知能力就有共通性。自动驾驶练出来的视觉识别能力、空间判断能力,可以迁移到机器人上反过来也成立。
从产品设计的角度看,这种跨领域的技术复用,是大企业做多元化业务的重要优势。你在一个业务领域积累的技术能力,可以低成本地迁移到另一个业务领域,形成协同效应。这也是为什么卢伟冰在财报会上强调,机器人业务不是独立业务,而是与主业深度协同。汽车业务积累的感知、规划和运动控制能力,手机与AI业务沉淀的交互和模型能力,都可以在机器人上得到应用。
第二层是Xiaomi-Robotics-0,解决的是从感知到动作的端到端转化问题。有了环境理解的基础,下一步就是把视觉信息、语言指令和机器人自身的状态,直接转化为具体的动作输出。这个转化环节过去通常被称为端到端,意思是输入端直接接输出端,中间不需要人为拆分成很多步骤。
端到端的好处是能力更强,因为它能学到很多人工设计的规则覆盖不到的细节。坏处是对数据量的要求更高,模型的可解释性更差。但从发展趋势来看,端到端是方向。人的运动控制方式,和大模型端到端了很多问题,才能真正实现通用能力。
从设计方法论的角度看,这其实就是从模块化设计走向一体化设计的演进。早期的机器人控制,就像早期的产品设计,都是模块化的思路——感知是感知模块,规划是规划模块,控制是控制模块,模块之间靠人工定义的接口连接。这种方式的好处是可控、可解释、出了问题知道哪块出了问题。坏处是灵活性有限,很难处理复杂的、开放的、不确定的场景。端到端的模型,就像一体化设计,把整个系统当作一个整体来优化,虽然调试起来更难,但上限也更高。
创品千乘在做系统设计时,经常会遇到模块化和一体化的权衡。模块化便于维护、便于分工、出了问题好定位,但性能上限受限于模块之间的接口。一体化性能好、整体性强,但设计难度大、出了问题难排查。不同的产品阶段,选择不一样的设计策略。早期探索阶段,模块化更合适,因为它更快、更稳妥。到了一定阶段之后,要追求更高的性能,就必须走向一体化。
人形机器人现在就处在这个转折点上。过去靠模块化的方法,已经能做出很多演示级别的功能。但要真正走向通用、走向复杂场景的开放环境下的可靠运行,必须靠端到端的大模型来突破。这也是为什么近两年具身智能这个概念突然火了,因为大模型的出现,给端到端的机器人控制提供了可能。
第三层是Xiaomi-Robotics-1,解决的是任务之间的迁移能力问题。学会了做A任务,能不能很快学会做B任务。这个能力之所以重要,是因为真实世界的任务太多了,你不可能每个任务都单独训练,都单独训练的话,数据量和训练成本根本受不了。
迁移能力强不强,直接决定了机器人的通用程度。一个机器人如果只会做一个任务,那它和专用设备没什么区别。如果学会一个新任务学的越快,说明它的通用能力就越强,适用场景就越多,价值就越大。人的优势就在这里——它不是天生就具备很强的迁移能力,学会了做很多事情。
从工业设计的角度,迁移能力对应的其实就是产品的通用性与专用性的平衡。专用设备效率高、成本低、可靠性好,但只能干一件事。通用设备什么都能干,效率可能不如专用设备,但灵活性强、适用面广、长期价值大。人形机器人的终极目标,显然是通用型的。但现阶段,它还处在从专用向通用过渡的阶段。每提升一分迁移能力,就是往通用方向迈进一步。
第四层是Xiaomi-Robotics-U0,也就是世界模型,解决的是数据瓶颈的问题。前面三层模型,越往上走,对数据的需求量越大。但真实机器人采集数据,成本高、速度慢,而且很难覆盖光照变化、物体移动和突发干扰等长尾情况。你总不能为了训练模型,让机器人在真实世界里把所有可能遇到的情况都试一遍吧?那样成本太高了,时间也不允许。
世界模型的作用,就像一座数据工厂。一条昂贵的真实操作轨迹,可以被扩展成不同背景、光照、物体位置和干扰条件下的大量训练样本。真实数据负责提供可靠的基础,生成数据负责扩大覆盖范围,两者共同提高机器人的泛化能力。
这个思路非常巧妙。它不是直接提升模型本身,而是提升训练数据的生产效率。用仿真数据,本质上就是在解决数据供给侧的供给问题。问题。数据量越大,模型能力越强。模型能力越强,能处理的任务越多。能处理的任务越多,进入的场景越多。进入的场景越多,采集的数据越多。这就形成了一个正向循环。
从系统论的视角看,这个循环是增长飞轮效应。当数据和模型相互促进、相互推动,越转越快。很多科技产品的竞争力,很大程度上取决于你能不能启动这个正向循环,以及循环的速度有多快。
小米的优势在于,它有自己的工厂场景,可以让机器人在真实生产环境里持续采集数据、持续迭代。工厂是一个稳定的内循环,比什么都重要。很多创业公司缺的不是模型能力,而是场景和数据。你模型可以靠算法团队做出来,但数据必须从哪里来?没有真实场景,就没有真实数据;没有真实数据,模型再强,也都是空中楼阁。
创品千乘在服务客户时,也经常强调系统思维。一个好的产品设计,不能只看产品本身,还要看产品背后的生态和闭环。你卖出去只是一个孤立的产品,再优秀,生命周期也是有限的。但如果产品能接入一个更大的系统,有持续的数据反馈、有持续的迭代优化,那它的价值就会不断增长。这种系统竞争力,往往比单点的技术突破,更有长期价值。
四层模型叠在一起,就构成了一个完整的技术体系。从环境感知到动作生成,从任务迁移到数据扩充,每一层都不可或缺,每一层都在为上一层的基础上,共同支撑起机器人的整体能力。这种分层设计的思路,既保证了每一层都可以独立迭代,又保证了层与层之间可以协同进化。
这种架构能力,在工业设计里叫系统架构设计的架构设计能力,是一个复杂产品的核心竞争力。很多人以为产品设计就是外观设计,其实外观只是最表层的东西。真正决定一个产品技术高度和竞争力的,是底层的系统架构设计能力。你怎么把这么多子系统整合在一起,怎么定义每个子系统的功能边界,怎么设计子系统之间的接口,怎么让整个系统在有限的资源约束下实现最优的整体性能,这些才是真正考验设计水平的地方。
人形机器人的系统复杂度,远超一般的消费电子产品。它涉及机械结构、运动控制、感知系统、算法模型、能源系统、软件系统等一大堆子系统。任何一个子系统掉链子,整个机器人都没法正常工作。要把这么多子系统整合在一起,让它们协同工作,并且在各种复杂环境下稳定运行,需要极强的系统工程能力。
小米在这方面的积累,其实是被很多人低估的。做手机、做电视、做家电、做汽车,每做一个新的品类,都是在锻炼系统整合能力。手机是最复杂的消费电子系统之一,汽车的系统复杂度比手机更高。经过这些产品的历练,小米的系统工程能力已经达到了相当高的水平。做机器人的时候,这些积累,就可以直接复用。
这也是为什么很多人说机器人行业真正的竞争,最后比拼的不只是机器人技术本身,更是整个公司的系统工程能力和供应链整合能力。因为到了量产阶段,这些能力比的,反而是那些看起来不那么核心的东西,决定了产品能不能做出来、能不能卖多少钱、能不能稳定交付。
从四层模型的演进路径,我们可以看到一个清晰的逻辑:从感知到动作,从单任务到多任务,从真实数据到仿真数据,每一步都是在解决前一步留下的问题,每一步也都在为下一步打基础。这种层层递进、环环相扣的演进方式,非常符合系统设计的基本规律。它不是拍脑袋想出来的,而是在实际问题的过程中逐步探索出来的。
创品千乘在多年的项目实践中,也总结出类似的经验。好的系统设计,从来不是一开始就把所有事情都规划得清清楚楚的,都是在实践中不断调整、不断优化的。你先做出一个最小系统,跑起来,发现问题,然后改进,再跑,再改进,循环往复。每一次循环,系统都更完善一点。过程中,系统架构也慢慢清晰了。
人形机器人的模型体系,现在也处在这个进化过程中。四层模型只是一个开始,未来肯定还会有第五层、第六层。每增加一层,机器人的能力边界就往外扩展一圈。等到模型体系完善到一定程度,人形机器人的通用能力就会迎来一个质的飞跃。到那个时候,它就不只是工厂里的专用设备,而是真正能够进入更广泛场景的场景。
这个过程不会太快。系统越复杂,进化需要的时间就越长。但方向是确定的,路径是清晰的。只要沿着这条路走,一步一个脚印地往前走,人形机器人的智能化程度会越来越强,能做的事情会越来越多,创造的价值也会越来越大。
从设计的角度看,这是一个非常激动人心的时代。因为我们正在见证一个全新的产品品类,从无到有、从简单到复杂、从专用到通用的完整进化过程。这个过程中会有无数的设计挑战,也会诞生无数的创新机会。能参与到这个过程中的设计师,是幸运的。