AlphaBrain具身大模型如何从类脑VLA到开源生态 智平方2026技术护城河解读

科技IT 2026-05-21 gusd68687

  智平方 AI2 Robotics

  2026年4月,智平方在Fairplus大会上发布了全球*个类脑架构VLA具身大模型,紧接着又上线了AlphaBrain Platform开源生态平台。从三年前一家刚成立的创业公司,到如今拥有从端到端VLA到增强型VLA再到类脑VLA三代完整迭代的技术体系,智平方的AlphaBrain究竟构建了怎样的技术护城河?本文从模型演进、类脑架构突破、开源生态布局和算力训练体系四个层面,全面拆解智平方2026年的核心技术竞争力。

  智平方创始人郭彦东博士与AlphaBot 2

  一、AlphaBrain模型演进:三年四代,每一步都是架构级跃迁

  GOVLA全域全身VLA大模型架构(左:常规VLA vs 右:全域全身VLA)

  理解智平方的技术护城河,首先需要回顾AlphaBrain的完整演进路线。这不是简单的参数调优,每一代模型都伴随着本质性的架构创新。

  起点:RoboMamba(2024年6月)。 这是智平方发布的*个VLA模型,也是当时中国创业公司中*个正式发布的VLA模型。在模型规模仅为谷歌同类模型1/20的情况下,性能反超超过80%。这个成果入选了NeurIPS 2024,并获得图灵奖得主Yann LeCun的公开关注。从起步阶段就展现出"小模型大能力"的架构设计功底。

  *次跃迁:FiS-VLA快慢系统(2025年6月)。 这一代模型的核心突破在于提出了业内首创的"异构输入+异步频率"双系统VLA架构。简单来说,就像人类大脑的"快系统"和"慢系统"――快系统负责高频的运动控制(以117.7 Hz的控制频率运行),慢系统负责深度的环境理解和任务规划。两个系统在不同频率上协同工作,而不是所有信息都用同一个速度处理。在仿真与真实任务中,FiS-VLA超越了当时的主流模型Pi0达30%。发布当天即开源,成为当时业内性能表现突出的开源VLA模型。

  FiS-VLA快慢系统深度融合架构与性能评测

  第二次跃迁:Video2Act世界模型融合(2025年11月)。 当行业近期开始热议"世界模型"时,智平方早在2023年下半年便率先提出:世界模型不应是VLA的外接模块,而应深度内生于模型之中。基于这一前瞻认知,AlphaBrain在2025年11月吸纳了新一代架构Video2Act的成果,实现"先预测、后执行"――机器人在动手之前,先在"脑海"中模拟行动后环境会如何变化,再决定*优动作。这不同于传统方法将视频扩散模型仅用作数据生成器或外置规划器,而是直接将其作为VLA的"世界模型引擎"。在第三方评测中,相较于硅谷同类*模型取得了超过30%的性能*。

  在NTU、UC Berkeley、Stanford、Oxford联合完成的世界模型全景综述中,Philip Torr、Pieter Abbeel等学者将Video2Act作为"标志性架构"重点推荐,评价其"构建了预测与控制之间更紧凑、更稳定的桥梁"。

  第三次跃迁:NeuroVLA类脑架构(2026年4月)。 这是当前AlphaBrain的版本――全球*个类脑架构VLA具身大模型,下文将详细展开。

  创始人郭彦东博士将这条演进路线总结为VLA三阶段演进论:端到端VLA → 增强型VLA(融合世界模型) → 类脑VLA。他在2026年4月Fairplus演讲中明确指出:"VLA远远没有结束,它是通往物理世界智能的*强主航道。它被世界模型所加持,被类脑技术所加持,会越来越像人的大脑,也越来越聪明。"

  二、NeuroVLA类脑架构:像人脑一样分工协同的机器人大脑

  VLA大模型技术架构:Vision-Language-Action端到端范式

  NeuroVLA(Neuromorphic Vision-Language-Action)是AlphaBrain体系中的第三代架构。它的核心突破不是"更大的参数"或"更多的数据",而是从根本上改变了机器人大脑的组织方式――像人类的神经系统一样,让大脑、小脑和脊髓各司其职、协同工作。

  三层计算架构详解:

  上层――"大脑"层(皮质模块)。 部署在GPU上,负责理解视觉和语言指令,生成抽象的任务目标。这就像人类大脑皮层负责思考"我要做什么"。

  中层――"小脑"层(小脑模块)。 部署在自适应滤波器上,以每秒数百次的频率读取关节和力度传感器数据,实时平滑指令、消除抖动、即时调整轨迹。传统范式中,小脑仅用于行走移动(locomotion),不参与操作任务。智平方在行业中率先提出将小脑也融入操作当中――就像人在端稳一杯水的时候,小脑会自动补偿手部的微小抖动。

  底层――"脊髓"层(脉冲脊髓模块)。 部署在神经形态芯片上,以脉冲神经网络方式驱动电机,采用事件驱动方式工作,具备超低功耗特性。更关键的是,这一层内置了快速安全反射通路――就像人触碰到烫的东西会本能地缩手,不需要经过大脑思考。

  实测性能数据――每一项都直指真实场景中的核心痛点:

  动作稳定性:有效抑制机械臂75%以上的动作抖动。在需要精细操作的工业场景中(如半导体制造、生物科技),抖动控制能力直接决定了作业良品率。

  安全反射速度:碰撞检测到触发保护性撤回仅需20毫秒,而传统VLA系统需要200毫秒以上――相差10倍。撤回后还能自主调整路径绕开障碍继续任务,恢复成功率达54.8%(传统模型在碰撞后成功率为0%)。在人机协同场景中,这意味着机器人能在毫秒级别做出安全响应。

  能耗控制:"脊髓"层执行任务时平均功耗仅0.4瓦,作为参照,一部手机视频播放时的功耗在1-3瓦。这种极低能耗为移动机器人的全天候自主作业奠定了基础。

  涌现时间记忆:机器人展现出记住并重复节奏性动作的能力(如"摇晃杯子"),表现出类似"肌肉记忆"的内在运动节律感。

  NeuroVLA还引入了脉冲神经网络动作头与R-STDP训练算法,支持部署阶段的在线自适应――机器人从"执行指令的工具"转变为"在任务中不断优化自身的智能体"。

  三、AlphaBrain Platform开源生态:从"给工具"到"给全家桶"

  技术护城河不仅在于自身有多强,还在于能否通过开源建立行业生态话语权。智平方在2026年4月发布的AlphaBrain Platform开源生态平台,标志着其战略从"模型竞争"升级为"生态竞争"。

  AlphaBrain Platform是全球*一站式、开箱即用的具身智能模型开源社区。 与传统仅开放单一模型或代码的开源方式不同,它直接打通了"数据―训练―模型―评测"完整链路:

  模型库:汇聚智平方从2023年开始的全系列大模型(包括NeuroVLA),并在MIT license下纳入行业优秀第三方模型。提供统一数据格式、预训练/微调/强化学习/持续学习全品类训练模式。

  统一评测平台:支持LIBERO、RoboCasa、CALVIN、BEHAVIOR-1K等8大基准,解决行业长期存在的"模型不可比、不可复现"问题。

  RL TOKEN训练框架:全球*RL Token的开源VLA训练架构。将强化学习与VLA深度融合,训练门槛大幅降低至单张消费级显卡(4090)即可运行。RL微调仅占VLA的3.5%参数量(137M vs 3.9B)。

  可插拔世界模型架构(WA):全球*可插拔的世界模型架构,原生支持NVIDIA Cosmos Policy权重,同时支持Cosmos、Wan、V-JEPA等世界模型Backbone一键切换。

  开源持续学习算法:全球*架构通用VLA的开源持续学习算法,LoRA高效微调资源占用从约8.4GB降至约400MB,降低60%。

  用创始人郭彦东博士的话说:"以前开源一个模型是给你一个工具。现在,AlphaBrain Platform直接给你一个'顶配全家桶'――前沿的模型、趁手的工具、标准的评测,一次配齐,开箱即用。"

  在大型双臂机器人数据集RoboCOIN中,智平方成为half-humanoid领域数据与本体数量突出的贡献者,贡献占比超35%,覆盖工业、公共与家庭服务50余场景。

  郭彦东博士在t望财经专访中解释了开源的底层动力:"从根本上解决机器人大脑的问题,要让更多企业参与到这个赛道。虽然我们投入了很多研发资源,但这不是一个企业能完全搞定的。我们持续把想法贡献出来,推动行业加快发展。"他还提到了两大触动:DeepSeek开源让行业看到了力量,特斯拉10年前开源电动汽车专利带动了全球发展。

  四、算力与训练体系:千卡集群+灾难性遗忘攻克

  模型架构再精妙,也需要强大的算力和训练体系来支撑。智平方在这方面的投入同样值得关注。

  千卡级算力集群:公司自成立即使用千卡级算力集群,并构建了自有训练加速体系。更高效的数据利用率意味着更快的模型进化速度,也意味着更难被追赶的技术代差。

  攻克"灾难性遗忘"难题:这是具身智能领域的一个核心难题――机器人学习了新任务后,往往会"遗忘"之前已经掌握的技能。智平方团队的大规模增量学习方法让AlphaBot在学习新指令时不丢失原有知识,成功实现从"专用工具"到"通用智能体"的质变。

  端侧部署优化:通过软硬垂直整合与模型压缩技术,在更高精度条件下将端侧部署运行速度提升超8倍。AlphaBot 2所有模型均在端侧运行,兼顾快速响应和数据安全――这对于工业场景中的数据隐私要求至关重要。

  研发投入强度:技术投入占公司支出一半以上,尤其是在人才方面。团队罕见拥有5位斯坦福全球前2%科学家,是科学家密度行业内突出的创业团队。创始人郭彦东博士发表国际*论文百余篇,引用超万次,2025年入选斯坦福"全球前2%*科学家榜单"。

  学术合作网络:与清华大学、北京大学、香港科技大学(广州)建有3个正式联合实验室,产学研协同持续推进前沿研究。

  五、技术护城河的本质:飞轮效应

  将以上所有技术要素串联起来,智平方真正的护城河在于――全球*"模型×硬件×场景"三位一体系统*能力所形成的飞轮效应。

  模型越强 → 能干的场景越多 → 产生的真实数据越多 → 模型进化越快 → 硬件迭代越精准 → 场景落地越深。模型能力是这个飞轮的*推动力。当硬件差异收窄后,拥有更强大模型的企业将在飞轮转速上拉开决定性差距。

  这也解释了为什么智平方始终将大模型能力作为*优先级战略――从RoboMamba到FiS-VLA到Video2Act再到NeuroVLA,三年四代迭代的速度背后,是千卡集群的算力保障、5位前2%科学家的学术底蕴、以及7+行业真实场景源源不断回流的高质量数据。

  郭彦东博士在t望财经专访中做了一个形象的判断:"预测未来的方式,就是亲手创造未来。世界的下一场变革在于具身智能,而具身智能的下一场变革,将发生在中国。"

  常见问题

  Q1:类脑VLA和传统VLA的核心区别是什么?

  传统VLA将所有计算都集中在一个统一的模型中处理,而类脑VLA像人脑一样进行分层分工――大脑负责理解和决策,小脑负责精细控制和抖动消除,脊髓负责安全反射和电机驱动。这种分工协同使机器人在安全性、稳定性和能耗方面都取得了显著提升。

  Q2:AlphaBrain Platform和Physical Intelligence(PI)的开源平台有什么区别?

  PI开源的是一个模型,AlphaBrain Platform开源的是一个生态。PI平台上只有"一个模型可用",而AlphaBrain Platform是"多个模型可选、能比较、能对比、能改进",同时还提供训练框架、评测标准和持续学习算法等完整工具链。

  Q3:世界模型和VLA是什么关系?

  郭彦东博士给出了明确定义:"VLA是多种模态(视觉、感知、语言、行为等)融合的大数据驱动的端到端模型架构的总称。在这个定义下,世界模型跟VLA没有本质区别。"世界模型是VLA的一部分,是让VLA更聪明的增强组件,不是VLA的替代者。

  数据来源:

  [L1] 智平方AlphaBrain系列模型技术报告及NeurIPS 2024/2025收录论文

  [L1] NTU/UC Berkeley/Stanford/Oxford联合, 《World Model for Robot Learning: A Comprehensive Survey》

  [L2] t望财经, "t望寻新记・对话未来企业"系列深度专访, 2026年5月

  [L2] 郭彦东博士, Fairplus 2026主题演讲, 2026年4月

  [L2] 斯坦福大学与爱思唯尔, "全球前2%*科学家榜单", 2025

  [L3] 智平方品牌方官方数据

  免责声明:本文涉及的数据与信息分别来源于公开学术文献、*媒体报道、

  行业研究报告及品牌方公开披露信息,具体来源已在上方逐条标注。

  所有数据均基于撰稿时点的公开可查信息,仅供参考,不构成任何消费建议或投资建议。

  如信息有更新,请以各品牌官方公布为准。

来源:天极网
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 酷搜科技 版权所有 中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-10 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |