缩小物理智能鸿沟:深度机智 PhysBrain 1.5 登顶开源,逼近 GPT‑6 Astra
发布时间:2026-09-09 22:36 浏览量:1
8B模型拿下开源第一,物理智能时代加速来临。
编辑丨李希
GPT‑6的发布,进一步拓宽了大语言模型的能力上限。推理、编程、多模态理解不断取得进展,也让行业看到通用智能的迭代仍在持续提速。但当模型的能力已经在数字空间得到充分验证,一个核心问题随之浮现:具备强大世界理解能力的大模型,究竟能不能落地到真实物理世界完成行动?
Robocurve的机械臂测试给出了一组对照结果:在积木放入碗的任务里,GPT‑6 Astra20次尝试成功19次,Claude Fable 5.1仅完成8次。模型接收摄像头画面与机器人自身状态信息,输出机械臂末端位姿、夹爪控制指令,并依靠实时视觉反馈迭代调整动作。这说明大模型对世界的认知,是可以转化为现实物理操作的。大模型的价值边界,正在跳出屏幕。
但测试也暴露出明显短板。在蓝色圆形拼图块对位插入凹槽这类精细装配任务上,GPT‑6 Astra成功率仅10%。即便大模型拥有不错的通用认知,也只能作为机器人完成任务的基础;从“理解世界”到“实际执行”之间依旧存在不小鸿沟。空间感知、具身理解、精细动作生成,仍是模型走向物理世界必须攻克的难点,也是当下行业竞争的核心战场。谁能补齐这部分能力,就有望把大模型的能力延伸到工厂、实验室与日常生活场景。
深度机智正是瞄准这一方向,推出物理基座模型PhysBrain 1.5。在28项具身空间智能与规划基准测试中,8B版本综合得分72.5,位列参评开源模型首位,整体水平已经接近GPT‑6 Astra(73.3)、Gemini 3.6 Flash(73.0)这类头部闭源模型。
这一次,一家成立仅一年多的中国公司,正在用一套自研架构,把空间理解、动作生成、未来状态预测等多维能力统一到一个基座模型中,把“让模型理解世界并理解如何行动”这件事真正做扎实。
01 把“理解、动作、预测”
收敛进一个闭环
在讨论模型之前,需要先厘清物理智能到底在解决什么。深度机智将其概括为 Physical Loop:一个“观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步”的物理智能循环。
真正的物理智能,不是单点能力,而是这个闭环能够连续、稳定地运转,并据反馈自我修正。但在今天,构成这一循环的能力大多分散在语义理解、空间感知、物体识别、动态生成等彼此割裂的专用模型中,缺少统一的世界表征、行动目标与反馈机制,Physical Loop也难以运转。
深度机智的判断是:要做出能“在世界中行动并自我修正”的底座,必须先回到这个闭环本身,把能力重新组织起来。PhysBrain 1.5,正是围绕这一闭环重建模型本身。
该模型以 Qwen3-VL-8B-Instruct 为基座,扩展出专用的动作 token 与视觉状态 token,把语言回答、结构化空间输出、末端执行器轨迹,以及未来的 RGB、深度与机器人占用预测,全部表达为离散 token,在单一自回归主干、单一 next-token 预测目标下联合训练,不引入任何任务专属头。这意味着,理解、动作生成与未来状态预测不再由多个模型拼接,而是在同一个物理循环中共同训练、彼此对齐,构成了能力扎实、边界清晰的一体化物理智能底座。
在这套统一架构之下,PhysBrain 1.5 的能力可沿 Physical Loop 拆成三个相互咬合的环节。
其一是具身理解:模型通过基础 VLM 接口、辅以具身监督,覆盖五类能力——基础视觉空间感知、3D与多视角空间理解、具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理。换言之,它不只是“看懂”画面,而是带着空间结构与物理常识去理解场景。
其二是动作预测:给定任务指令、当前视觉观测,以及可选的近期动作历史,模型直接输出下一拍末端执行器的动作块,表达为一段ActionPiece token序列;单臂、左腕、右腕共用同一套词表与码本,意味着一份通用模型权重即可驱动不同形态的机器人。这正是“理解”能够落地为“行动”的关键一跃。
其三是未来状态预测:在给定当前观测与任务指令后,模型预测约一秒后的世界状态,并以 RGB 图像、度量深度图与机器人占用掩码三种模态联合给出。这种“先想象结果、再采取行动”的能力,让模型在闭环中拥有了前瞻与纠错的依据,动作尚未执行,它已能预判环境将如何变化。
这种“一个 token 接口贯通物理循环”的架构选择,比单纯堆高某项分数更能说明问题:它指向的,是一个可“感知—决策—行动—反馈”连续运转、并能据反馈自我修正的物理智能基座模型。
02 人类完整经验,
是物理智能循环的来源
闭环要能运转,第一步是“有经验可学”。模型在 Physical Loop 中观察、决策、行动、反馈,其能力上限,终究由它所消化的物理经验的质量与完整性决定。而人类经验天然地嵌入这一循环中。人在真实世界中持续感知环境、理解情境、形成意图、采取行动,并根据环境反馈修正自己的判断与行为。人类的智能,正是在无数次Physical Loop中生长出来的。在深度机智的路线里,人类经验是物理智能循环的第一性来源。
为此,深度机智构建了 Ego360 全景数采体系,尽可能完整地保留人类行动过程中的环境、身体、手部交互与注视。这意味着模型学到的是一段连续、完整的“人类经验”,而非被割裂的局部,这正是“完整经验”之于物理智能循环的关键价值。只有保留了行动前后的因果链条,模型才能真正理解“为什么这么做”和“做完之后发生了什么”,而非仅仅记住“怎么做”。
当模型理解了因果关系,空间关系、操作方法与纠错经验就能在不同任务间迁移复用。人类经验的长期价值,正是在于它能沉淀出可复用的能力。当前,这套体系正以每月万小时级的速度持续新增,不断为物理智能注入丰富的训练资源。
让数据真正转化为模型能力,还需要打通从“看到”到“做到”的关键一环。PhysBrain 1.5引入的ActionPiece机制,正是解决这一问题的核心组件。它让模型能够同时学习“该怎样行动”和“行动之后可能发生什么”,即同时建模动作生成与状态预测。在团队内部实验中,PhysBrain 1.5的动作预测能力实现了从24%到54%的翻倍提升。
03
72.5分,
拿下开源第一,媲美顶尖闭源
PhysBrain 1.5本轮评测覆盖基础视空感知、空间与多视角理解、具身认知推理、空间指向与可供性、视觉轨迹推理五类能力,共 28 项基准。
结果上,PhysBrain 1.5-8B 以 72.5 的综合均分拿下开源模型榜首,并在 28 项中的 14 项取得开源最佳,10项位列开源模型第二;相较最强开源对手 Hy-Embodied-VLM-1.0(66.0)高出约 6.5 分,较 RynnBrain 1.1(63.1)高出 9.4 分。更受关注的是其整体水位:72.5 与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到 1 分以内。在具身智能的核心能力上,深度机智正与全球最前沿的闭源系统站在同一水位线上竞争。
深度机智同时开放了PhysBrain 1.5 2B 与 8B 两个参数规模的权重,已上线 Hugging Face,为社区验证与下游部署提供入口。(https://huggingface.co/collections/DeepCybo/physbrain-15)
04 Human-as-Humanoid:
人类经验驱动真机行动,闭环落到执行
如果说 Ego360 解决了“人类经验从哪来”,PhysBrian1.5实现了“人类经验如何转化为模型能力”,Human-as-Humanoid 则回答了“人类经验如何转化为真机行动”。其研究证明,同步采集的第一、第三视角人类视频,可直接转化为适配 PrimeU 的动作训练数据;原始示范吞吐量达到遥操作的 4.8—7.2 倍,部分任务无需目标任务机器人示范,即实现从人类数据到真机执行的零样本迁移。
这一步的意义,在于把“模型能力”真正接到了“真机执行”上:人类经验不再只是训练素材,而是能直接驱动机器人完成真实操作的动作来源。从人类经验、到模型建模、再到真机落地,深度机智由此跑通了从模型能力到真机执行的全栈链路。
它也反向验证了 Ego360 与 PhysBrain 1.5 所代表的“人类学习”路线,不只是一套训练数据或一次基准高分,而是能在真实世界里闭环运转的完整系统。这正是“全栈布局”之于深度机智最具体的价值:大脑与身体、数据与本体,被组织在同一条主线上。
05 提前一年的路线定力,
与正在重排的牌桌
全球范围内,物理基础模型的研发投入正在加速:Google DeepMind的Gemini Robotics、Physical Intelligence的π系列、Figure等,分别在具身推理、人类工作视频数据、少样本适应等方向持续加码。
一个清晰的趋势已经显现:海外头部企业正在走向殊途同归。物理经验数据、空间交互能力、基础模型训练,成为各家共同发力的核心方向。
但回溯到一年前,深度机智就已经把这些方向纳入自身长期技术路线。2025年10月10日,深度机智发布《源于人,超越人》技术路线图,将“人类学习”定为物理通用智能的核心研发路径。围绕“以人类数据为起点”“以动作为中心建模”“身体为AI设计”三大战略,完成物理智能的全栈布局。
在这套体系下,Ego360沉淀人类经验数据,PhysBrain基座模型不断拓展能力上限,Prime系列机器人本体负责真实场景的交互验证与反馈。人类数据基建、模型研发、本体闭环验证三者协同,系统性完成各阶段技术积累,不断缩短从“人类经验”到“机器能力”的转化链路。
深度机智从相对早期的起点出发,跑通了“数据‑模型‑本体”完整全栈链路,也交出了可量化的模型性能成果。
当下行业对物理AI的共识快速升温,但真正稀缺的,是贯穿长期的技术判断,以及跨环节落地的执行能力。过去一年,深度机智在人类经验数据、物理智能建模、机器人验证上的持续积累,正在构筑起难以追赶的先发优势。
物理智能的终点,从来不是一个只会应答的模型,而是能够在真实世界感知、行动、并且持续自我迭代修正的完整闭环。
PhysBrain 1.5并不是这条道路的终点,但它释放出一个明确信号:在中国物理AI基础模型赛道,这家成立仅一年多的企业,依靠人类学习路线与全栈布局,已经跻身全球竞争第一梯队。对于整个行业来说,这是一个值得持续观察的样本。
//