转载自公众号:敢敢AUTOHUB
1. 简介
2026 年 4 月 2 日,Generalist AI 发布《GEN-1: Scaling Embodied Foundation Models to Mastery》,给出的核心结论非常直接:在若干“简单但高价值”的物理任务上,GEN-1 把平均成功率从上一代可对比模型的 64% 拉升到 99%,把执行速度提升到此前最优结果的大约 3 倍,并且把每个任务的机器人适配数据压缩到约 1 小时。[1] 如果这些数字成立,那么它代表的不是一次普通的模型迭代,而是具身基础模型第一次开始逼近“生产可用”的门槛。机器人领域过去最大的问题,从来不是做不出炫目的 demo,而是 demo 和真正部署之间隔着一条漫长、昂贵且脆弱的工程鸿沟。GEN-1 的价值,恰恰在于它公开声称自己跨过的就是这条鸿沟。
更重要的是,GEN-1 不是靠一项单独技巧赢下来的。官方描述里反复强调,它更准确地说是一个系统,而不是一组权重。[1] 这句话很关键,因为它意味着 Generalist AI 对具身智能的理解已经不再停留于“把视觉和语言接上动作输出”这一层,而是把预训练数据引擎、后训练、强化学习、推理时延迟控制、控制器平滑化、多模态人类指导和对齐机制,全部视为能力跃迁的一部分。换句话说,GEN-1 的技术意义,不只是“一个模型更强了”,而是“具身基础模型的全栈方法论开始成形了”。
2. 理解 GEN-1,必须先看它站在什么历史脉络上
如果把 2023 年之后的具身智能路线大致梳理一遍,会发现行业里至少存在几条相互交织的主线。第一条是 PaLM-E、RT-2 代表的“把语言模型和视觉模型直接扩展到机器人控制”路线:它们证明了互联网语义知识、视觉语义理解和机器人任务可以被放进一个统一的模型框架中,尤其 RT-2 还展示了互联网知识可以迁移到动作选择上,比如理解“把东西放到正确数字上”“挑出最小物体”“找一个能当锤子的替代物”等语义推理能力。[5][6] 第二条是 Video Language Planning 这样的路线:把视觉规划、视频生成和长时程任务拆解整合起来,让系统先在视频空间里“想清楚”,再映射到真实动作。[7] 第三条是 UMI、pi0 这类更贴近物理操作本身的路线:它们更重视人类示范的数据接口、硬件无关的动作表示、低延迟执行和跨机器人泛化。[8][9][10]
GEN-1 的特殊性在于,它并没有简单站在这些路线的某一端,而是试图把它们向**“真实物理交互的规模化预训练”这个方向重新组织。Generalist AI 在 GEN-0 时代最重要的贡献,并不是证明机器人能用大模型,而是提出机器人领域也存在类似语言模型的 scaling laws**:模型尺寸、预训练数据和计算量增加时,下游任务性能会以可预测方式提升。[2] 这件事的意义非常大。因为只要 scaling law 成立,机器人能力增长就不再主要依赖人工规则与任务脚本,而开始转向“数据和算力驱动的普适增长”。GEN-1 则是这个论断第一次在商业上更敏感的指标上给出结果:不是验证损失,而是成功率、速度和恢复能力。
图 2:GEN-0 是理解 GEN-1 的前提。GEN-0 的核心贡献是把机器人学习推进到“预训练时代”,并给出面向具身任务的 scaling laws 证据。
3. GEN-1 真正重新定义的,是“精通”而不是“会做”
Generalist AI 把 GEN-1 的目标定义为 mastery,也就是“精通”,而不是传统 demo 语境中的“完成任务”。[1] 这个定义由三部分构成:可靠性、速度和即兴智能。可靠性很好理解,意思是模型不只是偶尔成功,而是能够在长时间、连续、多次执行中稳定成功。速度也不只是电机快不快,而是从真正接触目标到完成任务总耗时是否足够短。即兴智能则是三者里最重要、也最容易被忽略的一项,它要求机器人在意外出现时,不依赖预写死的脚本,而是能基于当前物理状态做出合乎常识的临场应对,比如重新摆放零件、借助外部接触面重新抓取、换一只手协助、在柔性物体形态异常时先整形再继续操作。[1][3]
这三个维度必须同时成立,才接近真实部署的要求。工业机器人几十年来在结构化环境里一直有高可靠性和高速度,但那靠的是环境强约束和流程固化,不是通用智能。相反,许多具身大模型 demo 看起来“像会了”,但常常速度过慢、失误率过高,或者只能在预设分布内表现正常。GEN-1 所谓的突破,就是把这三个指标绑在一起讨论,并且加入第四个隐含变量:数据效率。官方特别强调,每一个结果都只用了约 1 小时机器人数据。[1] 这意味着它想证明的不是“只要多收数据总能做出来”,而是“预训练模型本身已经学到了足够多可迁移的物理先验,所以新任务适配成本开始下降”。
下表把官方公开的几个核心数字简化整理如下:
| 指标 | GEN-0/基线 | GEN-1 | 含义 |
|---|---|---|---|
| 平均成功率 | 64%(已微调 GEN-0) | 99% | 从可演示走向可连续运行 |
| 从零训练平均成功率 | 19% | 不适用 | 说明预训练本身贡献巨大 |
| 纸箱折叠耗时 | 约 34 秒 | 约 12.1 秒 | 速度提升约 2.8 倍 |
| 手机装箱耗时 | GEN-0 明显更慢 | 约 15.5 秒 | 达到上一代约 2.8 倍 |
| 单任务机器人数据 | 更高 | 约 1 小时 | 适配成本明显下降 |
| 预训练数据规模 | 27 万小时以上 | 50 万小时以上 | 数据底座继续扩张 |
表 1:根据 Generalist AI 博客整理。部分基线来自官方对齐比较,未必对应所有外部系统在完全相同条件下的独立复现结果,因此阅读时应把它当作“公司公开 benchmark”,而不是统一第三方基准。[1][2]
4. 从数据引擎看,GEN-1 的底层逻辑是什么
GEN-1 最值得重视的一点,不是它又用了多少机器人数据,而是它在公开表述里强调:基础模型的预训练不使用机器人数据,而是来自佩戴低成本设备的人类日常活动数据。[1] 这和传统遥操作大数据路线差别很大。传统路线的问题在于,机器人示范数据极贵、极慢、接口受限,而且容易因为时延、视角、缺乏触觉反馈等问题,天然生成较慢、较僵硬的人类控制轨迹。Generalist AI 在《Physical Commonsense》一文里明确指出,很多遥操作实际上破坏了传感到动作的闭环,让操作者从快速的、直觉式的“System 1”反应,退化成慢速、刻意思考的“System 2”控制,最后收集到的轨迹就不再像真实身体技能,而更像艰难的远程指挥。[3]
这就解释了为什么 Generalist 会反复强调低成本可穿戴设备和人类自然动作。UMI 论文同样证明了一个接近的命题:如果数据接口足够自然、信息密度足够高,并在策略学习时补上延迟匹配与相对轨迹动作表示,那么“人在真实环境中的双手操作”可以以较低成本迁移成可部署的机器人策略。[8] 严格说,Generalist 没有公开表示 GEN-1 直接采用 UMI 的具体实现,但它的公开叙述与 UMI 所证明的范式高度一致:先用更自然的人类交互收集大规模物理数据,再用少量机器人数据做 embodiment 和任务层的对齐。对于具身基础模型而言,这种路线的意义在于,它绕开了“必须先拥有海量机器人演示,才能开始预训练”的数据瓶颈。
图 3:UMI 展示了“低成本人类示范接口 + 相对动作表示 + 延迟匹配”可以为机器人学习提供高质量数据底座。GEN-1 没有公开复现 UMI 的全部细节,但在数据哲学上两者明显同向。
图 4:GEN-0 公开展示了机器人预训练中的“规模阈值”现象,小模型在高数据区间更容易出现吸收新信息变差的 ossification,而 7B 以上模型继续受益。这是 GEN-1 能继续扩展的关键前提。
5. GEN-1 的技术栈应该怎么拆
如果把官方已经披露的信息和同类具身系统公开做法拼起来,GEN-1 大致可以被理解成五层:第一层是多模态传感输入,包括图像、语言、可能的本体状态以及时间序列上下文;第二层是物理预训练层,用超大规模人类真实交互数据学习动作先验和物理常识;第三层是任务后训练层,包括监督微调、从经验中学习的强化学习、多模态人类指导;第四层是实时推理层,也就是 Generalist 反复提到的 Harmonic Reasoning 和新的 paged attention 变体;第五层则是控制执行与对齐层,负责把高层动作意图转换为连续、平滑、稳定的低层控制,并限制不希望出现的行为。[1][2] 这里最关键的判断是:GEN-1 的能力不是某个“神奇架构模块”单点产生的,而是多层系统共同压缩延迟、提升泛化、改善恢复能力之后的结果。
在 GEN-0 的公开介绍里,Harmonic Reasoning 被描述为一种“让思考与行动同时发生”的训练与推理思路,它处理的是异步、连续时间的感知流和动作流,而不是先完整感知、再完整思考、最后统一执行的离散流水线。[2] 这点非常重要。语言模型可以多想几秒再回答,但机器人如果多想几秒,杯子已经滑落、纸箱已经变形、目标物已经错位。GEN-1 又进一步提到自己引入了新的 paged attention 形式,以支持实时推理。[1] 因此,合理的工程理解是:它在 runtime 上做了专门面向机器人时延的改造,使大模型不至于因为上下文增长、缓存开销和远端推理延迟而错过最佳动作时机。
下面给出一个“GEN-1 风格系统”的简化实现流程图。请注意,这不是官方代码,而是根据公开信息做出的结构化还原:
人类真实世界交互数据多模态编码与时间对齐物理预训练基础模型少量机器人任务数据适配后训练: SFT + RL + 人类指导实时推理: Harmonic Reasoning + 缓存/分页注意力连续动作输出与平滑控制真实执行反馈
6. 用伪代码理解它的训练与部署逻辑
第一段对应的是“先学物理,再学机器人”的预训练思路。它的核心不是把每个任务做成一个离散标签分类问题,而是把连续的观察、动作和时间关系建模成统一序列,使模型直接学习“在这个物理状态下,下一步合理动作应该怎样变化”。从 Generalist 对 scaling law 的描述看,预训练的目标并不局限于单任务成功率,而更看重随着数据量增长,下游 next-action error 和最终任务表现能否稳定改善。[2]
def pretrain_foundation_model(human_dataset, model):
for traj in human_dataset:
obs_tokens = encode_multimodal_observation(
images=traj.images,
proprio=traj.proprio,
language=traj.language,
time_index=traj.time_index,
)
act_tokens = encode_relative_actions(traj.actions)
pred = model(obs_tokens, act_tokens[:-1])
loss_action = next_action_loss(pred, act_tokens[1:])
loss_time = temporal_consistency_loss(pred)
loss_align = multimodal_alignment_loss(pred, obs_tokens)
loss = loss_action + 0.2 * loss_time + 0.1 * loss_align
update(model, loss)
return model
第二段对应“1 小时机器人数据适配”的思路。这里真正被压缩的,不只是采集时间,还有后训练步数和探索空间。因为如果基础模型已经掌握了抓取、重抓、放置、调整姿态、利用接触面辅助操作等一般物理技能,那么新任务就不需要从头学“什么是灵巧操作”,而只需要把已有能力重新对齐到新机器人和新流程上。Generalist 在 GEN-1 博客中明确表示,某些测试里 GEN-1 用比 GEN-0 少 10 倍的任务数据和微调步数,就能达到相当性能。[1]
def adapt_to_new_robot(base_model, robot_data):
model = load(base_model)
freeze_low_level_world_knowledge(model)
open_embodiment_adapter(model)
open_task_head(model)
for batch in robot_data:
obs = encode_robot_observation(batch)
act = encode_robot_action(batch)
pred = model(obs)
loss_bc = behavior_cloning_loss(pred, act)
loss_safety = action_smoothness_penalty(pred)
loss = loss_bc + 0.05 * loss_safety
update(model, loss)
return model
第三段对应实时执行逻辑。这里最值得注意的是“异步”:机器人不能在每个控制周期都停下来等待完整推理结束,因此必须边执行旧动作、边吸收新观测、边更新后续动作序列。Physical Intelligence 在实时 action chunking 的研究中也强调过同样问题:大模型在机器人场景里必须以异步方式思考未来动作,否则推理时延会直接伤害控制性能。[10] GEN-1 的 Harmonic Reasoning 很可能就在承担这类角色,只不过官方把它表述为更深地嵌入到训练和推理范式之中,而不只是一个外部补丁。
def realtime_control_loop(model, robot):
action_buffer = []
kv_cache = init_paged_attention_cache()
while robot.is_running():
obs = robot.read_observation()
if len(action_buffer) < MIN_BUFFER:
future_actions, kv_cache = model.harmonic_reason(
obs=obs,
cache=kv_cache,
horizon=H,
asynchronous=True,
)
action_buffer.extend(future_actions)
action = action_buffer.pop(0)
action = smooth_and_clip(action)
robot.execute(action)
if detect_slip_or_failure(obs):
action_buffer.clear()
机器人“更快”通常有两种假快和一种真快。第一种是假快是视频倍速;第二种是假快是机械臂运动很猛,但任务完成时间并没有真正缩短,或者缩短后成功率迅速下降。GEN-1 的公开主张是第三种真快:任务完成时间本身下降,而且是在高成功率下完成的。[1] 例如纸箱折叠从大约 34 秒缩短到 12.1 秒,手机装箱达到 15.5 秒级别,这意味着系统不只是敢动得更快,还能在更高动态条件下保持动作精度、接触稳定性和错误恢复能力。
| 路线 | 核心思想 | 主要长处 | 主要短板 | 与 GEN-1 的关系 |
|---|---|---|---|---|
| PaLM-E | 连续感知嵌入到 LLM | 多模态统一理解 | 物理控制不是主战场 | 提供“语言模型具身化”的早期范式 |
| RT-2 | 将动作 token 化并联合互联网语义训练 | 语义泛化强,指令理解好 | 低层灵巧与实时性不是重点 | 说明语义知识可迁移到动作 |
| VLP | 先在视频空间规划,再执行 | 长时程规划强 | 闭环接触控制链条更长 | 提供“规划层”的上游能力 |
| UMI | 自然人类示范 + 可部署策略接口 | 数据成本低,跨平台强 | 仍偏任务级策略学习 | 为 GEN-1 式数据引擎提供范式支撑 |
| pi0 | 通用机器人策略,直接输出低层动作 | 跨机器人、跨任务、动作直接 | 实时推理时延仍是核心挑战 | 与 GEN-1 形成最直接的系统级对照 |
| GEN-1 | 物理预训练 + 后训练 + 实时推理 + 控制一体化 | 可靠性、速度、恢复三项一起推进 | 公开细节仍有限,缺少独立复现 | 代表“面向部署”的具身系统化路线 |
7. 结论
如果只记住一个数字,那么 GEN-1 会被误读成“又一个刷指标的机器人模型”。但如果把所有公开材料放在一起看,更准确的结论应该是:**它正在把具身智能从“语义很强、动作很弱”的阶段,推进到“物理经验成为第一等公民”的阶段。**它靠的不是单一模型结构,而是一套围绕真实物理世界重新组织的数据、训练、推理与控制系统。[1][2][3] 它是否已经真正跨过商业门槛,还需要更多外部验证;但它确实清楚地告诉我们,下一代机器人基础模型的竞争,不会只比谁更会看图说话,而会比谁更能在真实时间里感知、行动、纠错并长期稳定工作。
参考资料与延伸阅读
• [1] Generalist AI Team, GEN-1: Scaling Embodied Foundation Models to Mastery, 2026-04-02. https://generalistai.com/blog/apr-02-2026-GEN-1
• [2] Generalist AI Team, GEN-0: Embodied Foundation Models That Scale with Physical Interaction, 2025-11-04. https://generalistai.com/blog/nov-04-2025-GEN-0
• [3] Andy Zeng and Generalist AI Team, The Dark Matter of Robotics: Physical Commonsense, 2026-01-29. https://generalistai.com/blog/jan-29-2026-physical-commonsense
• [4] Generalist AI Team, The Real Breakthrough Behind Our GTC Demo, 2026-03-24. https://generalistai.com/blog/mar-24-2026-gtc-demo
• [5] Driess et al., PaLM-E: An Embodied Multimodal Language Model, project page. https://palm-e.github.io/
• [6] Brohan et al., RT-2: Vision-Language-Action Models, project page. https://robotics-transformer2.github.io/
• [7] Du et al., Video Language Planning, project page. https://video-language-planning.github.io/
• [8] Chi et al., Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots, RSS 2024 project page. https://umi-gripper.github.io/
• [9] Physical Intelligence, π0: Our First Generalist Policy, 2024-10-31. https://physicalintelligence.company/blog/pi0
• [10] Black et al., Real-Time Action Chunking with Large Models, 2025-06-09.https://physicalintelligence.company/research/real_time_chunking
351