中国材料大会2026 · FB06人工智能与物质科学青年科学家论坛
上海交通大学

面向自主实验室的具身智能体Tutorial

李 阳 Yang Li
上海交通大学 · 计算机学院 · John Hopcroft Center · 助理教授
2026 年 7 月
上海交通大学TUTORIAL · 2026
CONTENTS
上海交通大学
上海交通大学 · 具身智能与自主实验室02

目录

CONTENTS
01
背景介绍
Introduction

PAGE03 – 07
02
自主实验室现状
State of Self-Driving Labs

PAGE08 – 13
03
面向自主实验室的具身智能基础
Perception · Manipulation · Agent · Multi-Agent

PAGE14 – 28
04
总结
Summary

PAGE29 – 31
SECTION 01
上海交通大学
上海交通大学 · 具身智能与自主实验室03
01
背景介绍
Introduction
AI4Science 在“想”和“算”上进步飞快,真正卡住的是把假设送进真实世界去验证的那双手。
1
AI4Science 的闭环缺口

假设生成已经规模化,验证仍卡在物理实验。

2
什么是自主实验室

让机器闭环决定并执行“下一个实验”。

3
为什么需要具身智能

从固化自动化,到会看、会做、会协作的具身智能。

第一部分 · 背景介绍
上海交通大学
上海交通大学 · 具身智能与自主实验室04

AI4Science:假设生成已规模化,验证卡在物理实验

AI4SCIENCE
计算候选 105–106 AlphaFold:2 亿蛋白结构 · GNoME:220 万稳定晶体(≈800 年知识增量) ↓ 仅标准化体系通过 高通量 / 组合筛选 102–104 仅限薄膜、孔板等可标准化体系 ↓ 合成路线各异,难以统一并行 全流程自主验证 101–102 A-Lab:17 天 · 41 种新材料
瓶颈
  • 计算侧产出像“打印”:按目标性质反向生成候选,几乎零边际成本
  • 高通量设备效率高,但局限于可标准化体系,非标环节仍需人工介入。
  • 新材料合成路线各异:配料、气氛、温度曲线、表征手段难以统一并行
瓶颈不在“想”,在“做”:这就是数量级的“验证鸿沟”
TAKEAWAYAI 能提出百万级假设,但验证假设的那双手还没有跟上。
第一部分 · 背景介绍
上海交通大学
上海交通大学 · 具身智能与自主实验室05

什么是自主实验室?


自主实验室把“设计—执行—表征—分析”连成闭环:AI 决定下一步实验,机器人完成实验操作,并将结果反馈给 AI 迭代。

机器自主闭环 AI 决定下一个实验 ① AI 实验设计 贝叶斯优化 · 大模型智能体 ② 自动化执行 机械臂 · 移液站 · 加热搅拌 ③ 表征与分析 XRD · 色谱 · 视觉检查 ④ 数据回流 回写模型与电子实验记录
为什么值得做:自主实验室的意义
  • 补上验证鸿沟:让“验证”跟上“生成”的速度,消化上一页的百万级候选
  • 全天候闭环运转:机器不疲劳、不遗忘,每一轮都朝信息量最大的实验走
  • 可复现的科学:条件、过程、结果全程数字化记录——失败也沉淀为数据

人类科学家换角色

从亲手做实验,转为设定目标、把关安全、审读结论。

TAKEAWAY关键不是“自动”,而是“自主”——下一个实验做什么由机器闭环决定,比人工加速 10–100 倍。
第一部分 · 背景介绍
上海交通大学
上海交通大学 · 具身智能与自主实验室06

为什么自主实验室需要具身智能

WHY EMBODIED
现有自主实验室的“执行”层多是预定义自动化;真实、开放的科学实验需要通用的具身能力
预定义自动化(封闭)
  • 固定工位、预编程轨迹,只做设计好的标准动作
  • 换实验、换设备、换布局就要重新适配
  • 看不懂现场,也不擅长从错误中恢复
安全围栏内 · 布局固定 工位 A 工位 B 同一条预编程轨迹,日复一日
适合:可标准化的重复性实验
具身智能(开放)
  • 感知真实场景与实验状态,生成灵巧动作
  • 把 protocol 拆成可执行子任务,异常时重规划、可恢复
  • 多机器人、多仪器与人类研究员协作
感知:看懂器皿与状态 遇障碍 / 异常:重规划 与人协作
支撑:开放、多变的科学发现
能标准化的部分早已被自动化;剩下的长尾——透明器皿、液体粉末、异常恢复、多方协作——正是具身智能的主战场。
第一部分 · 背景介绍
上海交通大学
上海交通大学 · 具身智能与自主实验室07
具身智能、大模型多智能体与具身多智能体示意图
SECTION 02
上海交通大学
上海交通大学 · 具身智能与自主实验室08
02
自主实验室现状
State of Self-Driving Labs
物理闭环已经能跑起来,我们用三个代表性工作看它做到了什么、还差什么。
1
Mobile Robotic Chemist

移动机器人化学家,物理闭环的开山之作。

2
ORGANA

自然语言驱动的机器人实验助手。

3
具身科学智能体(我们的工作)

具身科学统一接口,端到端自主科研。

第二部分 · 自主实验室现状
上海交通大学
上海交通大学 · 具身智能与自主实验室09

从自动化到自主:历史不是从 LLM 开始的

TIMELINE
自主实验室的核心思想早于大模型;自主性是一步步递进的。
1960s–
实验自动化
机械化执行,无自主决策
2009
Adam 机器人科学家
首个假设驱动的发现闭环
2020–
移动机器人进实验室
自主平台走进真实空间
2023–
LLM / Agent
读 protocol、写代码、调设备
2026–
具身科学智能体
统一接口 + 具身执行
自主性递进:无决策 → 选点决策 → 假设筛选 → 开放式决策 · LLM 不是起点,只是让开放式决策变得可实现
TAKEAWAY自动化是“按程序做”,自主是“知道下一步为什么做”。
第二部分 · 自主实验室现状 · 论文精读
上海交通大学
上海交通大学 · 具身智能与自主实验室10

Mobile Robotic Chemist:物理闭环的开山之作

Burger et al. · Nature 2020
移动机器人化学家实验室
导读首个在普通湿化学实验室自由移动的机器人化学家,直接使用人类的器皿与仪器。
方法±0.12 mm 定位精度;批量贝叶斯优化在 10 维配方空间挑实验。
结果8 天 688 次实验,活性提升 6 倍;比人工快约 3 个数量级。
TAKEAWAY它证明自主实验闭环无需专用平台——但动作仍靠固定位置与预编程。
第二部分 · 自主实验室现状 · 论文精读
上海交通大学
上海交通大学 · 具身智能与自主实验室11

ORGANA:自然语言驱动的机器人实验助手

Darvish et al. · Matter 2025
ORGANA pipeline
导读面向化学家的通用助手:用自然语言描述目标,系统自主完成推理 → 规划 → 执行 → 表征 → 报告。
方法LLM 推理(CLAIRify)把描述编译为机器人目标 + 视觉感知 + TAMP 任务运动规划 + 并行调度;异常时主动向化学家提问。
结果同一系统覆盖溶解度、重结晶、pH、电化学四类真实实验;用户研究显示显著降低时间与心理负担(约 80%)。
TAKEAWAY大脑(语言理解、任务组织)在变强——但执行仍依赖固定设备与预定义流程。
第二部分 · 自主实验室现状 · DEMO
上海交通大学
上海交通大学 · 具身智能与自主实验室12

ORGANA:真实化学实验演示

Darvish et al. · Matter 2025 · 官方视频
第二部分 · 自主实验室现状
上海交通大学
上海交通大学 · 具身智能与自主实验室13

具身科学智能体 Embodied Science Agent


我们提出了首个具身科学智能体,通过创新的具身科学统一接口统一整合智能体系统与异构物理设备具身控制(如机器人、各类化学设备等),结合贝叶斯优化3D 虚拟人交互,实现从文献调研、实验执行、科学发现的端到端自动化自主实验室科研流程。
具身科学智能体框架图
具身科学智能体框架图
具身科学实验室
具身科学实验室
有机废水降解实验
电芬顿反应原理图
以芬顿铁泥(危险废物)制备复合电极作为电芬顿反应阴极,可同步降解有机废水,实现危险废物资源化与废水处理的协同治理。
原料芬顿铁泥危险废物资源化
执行机器人联动化学设备完成实验
决策贝叶斯优化选择下一轮参数
变量pH / 电流 / 曝气 / 电解质
目标最大化有机污染物去除率
闭环数据回写并自动迭代
文献调研 → 实验方案生成 → 设备具身控制 → 结果采集 → 科学发现与下一轮实验设计
有机废水污染物去除实验结果
有机废水污染物去除实验结果
Chen Y, Yu Z, Li Y, Lu X, Li Q, Yu H, Wang J. Autonomous Scientific Discovery Needs Embodied Experimentation with Learnability, 2026.(共同一作)
SECTION 03
上海交通大学
上海交通大学 · 具身智能与自主实验室14
03
面向自主实验室的
具身智能基础
Perception · Manipulation · Agent · Multi-Agent
四个层面逐一展开:实验室为什么需要它、现有工作走到哪一步、缺口还在哪里。
1
感知

从物体识别到状态感知与结果验证。

2
操作

VLA · World Model · World Action Model:从“怎么动手”到“动手后世界会怎样”。

3
具身智能体

长程任务的残酷算术,与 ASPIRE 的自改进恢复。

4
具身多智能体协作

RoCo 对话协作 · HOLA 开放组队。

第三部分 · 感知
上海交通大学
上海交通大学 · 具身智能与自主实验室15

感知(一):实验室是视觉模型的分布外世界

PERCEPTION
难在透明、反光、细小、密集,而且“状态”比“类别”更重要。
真实实验场景:透明器皿 + 液体 + 仪器
真实化学实验机器人场景
机器人视角的真实湿化学实验台:透明、反光、细小、密集
1

透明器皿

烧杯、试管、枪头,RGB 边缘弱、深度易失效。

2

液体与粉末

液面高度、浑浊度、分层、粉末形态。

3

仪器界面

屏幕数字、旋钮位置、老式仪表读数。

4

微小密集物体

枪头盒、试管架、微孔板高度密集。

TAKEAWAY实验室感知不是认出烧杯,而是读懂烧杯里正在发生什么。
第三部分 · 感知
上海交通大学
上海交通大学 · 具身智能与自主实验室16

感知(二):三个尚未解决的难点

PERCEPTION
① 实验室里的物体识别
  • 透明器皿:RGB 边缘弱、深度直接失效
  • 反光金属、液面与屏幕的干扰
  • 枪头盒、微孔板:密集小物体相互遮挡
通用检测模型在这里仍会翻车
② 空间智能 SPATIAL INTELLIGENCE
  • 从 2D 像素恢复 3D 几何与位姿
  • 推理空间关系、遮挡与可达性
  • 在杂乱台面上规划“怎么伸手、怎么绕”
当下研究热点,离“可靠”尚远
③ 状态与验证感知
  • 过程:液体混匀了吗?粉末有残留吗?
  • 仪器:升温到位?离心完成?是否报错?
  • 结果:产物真的形成了吗?表征可信吗?
实验室特有,数据与评测稀缺
三类感知在科学实验中都不可或缺:物体识别保证拿得准,空间智能保证动得稳,状态与验证感知保证过程和结果可信;真正的短板是数据、评测与可靠性仍不足。
TAKEAWAY实验室感知远未解决——“读懂实验状态”是其中最缺人研究的一块。
第三部分 · 操作
上海交通大学
上海交通大学 · 具身智能与自主实验室17

具身智能前沿热点:VLA · World Model · World Action Model

CONCEPTS
VLAVISION-LANGUAGE-ACTION
回答:怎么动手?
图像+ 语言指令 VLA 机器人动作
端到端学“怎么动手”:数据越多、手艺越好——已能完成叠衣、清桌等长程灵巧操作。
代表工作:RT-1 · π0 · π0.7
WMWORLD MODEL · 世界模型
回答:动手后世界会怎样?
当前画面+ 拟执行动作 WM 预测的未来画面 脑内反复预演,再真实行动
学习“世界如何随动作演化”:先在脑内试错、挑出靠谱方案,大幅减少真实试错。
代表工作:DreamerV3
WAMWORLD ACTION MODEL
回答:能否边动手边核对?
图像+ 语言指令 WAM 未来视频 机器人动作 同一次预测,边动手边核对
把视频预测与动作生成装进同一个模型:一边动手,一边核对世界是否朝目标演化。
代表工作:DreamZero
实验室最难的不是把动作做出来,而是判断“做了之后,反应 / 样品朝目标走了吗”——这正是 World (Action) Model 对自主实验室的价值。
第三部分 · 操作 · 论文解读
上海交通大学
上海交通大学 · 具身智能与自主实验室18

π0.7:可操控、有涌现能力的通用机器人基础模型

Physical Intelligence · 2026
pi0.7 method
导读5B 通用机器人基础模型:在 π0 之上加入记忆、世界模型与上下文提示,展现指令跟随、跨本体、组合泛化等涌现能力
方法4B VLM + 860M 动作专家 + MEM 记忆 + 轻量 world model;以 subgoal images 等丰富上下文提示。
结果专家级灵巧度;煮咖啡等未见任务开箱可做;零样本跨本体迁移。
TAKEAWAY最新 VLA 已把“记忆 + 世界模型 + 上下文提示”融进来——通用手艺越来越强。
第三部分 · 操作 · DEMO
上海交通大学
上海交通大学 · 具身智能与自主实验室19

VLA 走到哪了:π0.7 演示

Physical Intelligence · 2026 · 官方视频
π 系列 VLA 的最新一代:加入记忆、世界模型与上下文提示——无需微调,开箱完成未见任务
用陌生咖啡机煮咖啡——训练中未见的任务
叠衣——长程灵巧操作
第三部分 · 操作 · 论文解读
上海交通大学
上海交通大学 · 具身智能与自主实验室20

DreamZero:联合预测“视频 + 动作”

Ye et al. (NVIDIA GEAR) · 2026
DreamZero method
方法14B 自回归视频扩散 + 逆动力学;joint video-action flow matching;KV 缓存实现 7 Hz 实时闭环。
结果未见任务泛化比 SOTA VLA 高 2 倍以上;纯视频跨本体迁移 +42%;30 分钟数据适应全新机器人。
TAKEAWAYVLA 解决“怎么动手”,World Action Model 追问“动手后世界会怎样”——实验室最难的正是后者。
第三部分 · 操作 · DEMO
上海交通大学
上海交通大学 · 具身智能与自主实验室21

World Action Model 走到哪了:DreamZero 演示

NVIDIA GEAR · 2026 · 官方视频
联合预测“未来视频 + 动作”,7 Hz 实时闭环——对未见任务的泛化超过 SOTA VLA 两倍以上
官方总览:视频世界模型如何变成机器人策略(约 2 分钟,选段播放)
实验器材插拔——未训练过的开放任务
第三部分 · 操作
上海交通大学
上海交通大学 · 具身智能与自主实验室22

操作小结:实验室缺的是可学习的数据闭环

MANIPULATION
不是泛泛“需要更多数据”,而是缺少可训练、可复用、可验证的操作数据闭环。
1

数据少

真实操作轨迹远少于通用机器人数据。

2

数据贵

需要真实仪器、试剂、场地、安全流程与人员。

3

难标注

还要标状态变化、失败原因、力/触觉/温度。

4

难复用

不同实验室设备、耗材、布局差异大。

三条可能路径
  • 遥操作采集:贵但真实,适合关键技能起步
  • 仿真到真实:刚体较易,液体/粉末/反应仍难
  • 视频学习:可学人类先验,但缺动作与状态标签
关键判断:数据本身也要进入闭环
TAKEAWAY不是缺一个更大的模型,而是缺可学习、可复用、可验证的数据闭环。
第三部分 · 具身智能体
上海交通大学
上海交通大学 · 具身智能与自主实验室23

具身智能体:为什么还需要这一层

EMBODIED AGENT
长程任务的残酷算术:单步成功率 95%,40 步连乘后只剩 ≈ 13%——必须有一层专门负责“不掉链子”
通用具身智能算法
  • 感知、理解、预测与动作整合起来,形成强执行能力
  • 但通常不负责科学假设、实验设计与跨轮次数据闭环
视觉 理解预测 动作执行 通用具身算法已经把“感知、理解、执行”连起来 仍缺:科学假设 · 实验设计 · 跨轮次验证闭环
把机器人完成任务的底层能力做强
具身智能体
  • 把高层目标拆成可执行子任务,维护任务记忆
  • 用感知验证进度,异常时重规划或请求人类接管
科学目标 智能体:规划 · 记忆 · 验证 感知 操作 预测后果 验证进度 · 异常重规划
把眼睛和手组织成闭环系统
TAKEAWAY通用具身智能算法打通底层能力,智能体进一步把它纳入科学目标、实验记忆与验证重规划的闭环。
第三部分 · 具身智能体 · 论文精读
上海交通大学
上海交通大学 · 具身智能与自主实验室24

ASPIRE:自改进、把失败沉淀成技能库

Lu et al. (NVIDIA GEAR) · 2026
ASPIRE overview
导读直面上一页的“残酷算术”——ASPIRE 让系统自己诊断失败、修复流程、并把经验蒸馏成可复用技能;在 code-as-policy 范式下自主编写、调试机器人程序。
方法三部件:闭环执行引擎(细粒度多模态 trace) + 技能库(蒸馏为 in-context 技能) + 进化搜索(跨轨迹探索)。
第三部分 · 具身智能体 · 论文精读
上海交通大学
上海交通大学 · 具身智能与自主实验室25

ASPIRE:从失败中长出可复用的技能

Lu et al. (NVIDIA GEAR) · 2026
ASPIRE skill library
结果LIBERO-Pro +77% / Robosuite +72% / BEHAVIOR-1K +32%;未见长程任务成功率 31% vs 先前方法 4%。
意义实验室最需要的正是这种能力:失败不白费——诊断原因、修复流程,并沉淀为下次可直接调用的经验。
TAKEAWAY失败不白费:ASPIRE 自己诊断、自己修复,把经验沉淀成技能——系统越做越好。
第三部分 · 具身多智能体协作
上海交通大学
上海交通大学 · 具身智能与自主实验室26

多智能体:实验室不是一台机器人

MULTI-AGENT
真实实验室是异构具身多智能体场景,单机器人视角天然不够。
1

移动机器人

搬运、跨区域操作。

2

固定双臂站

精细操作。

3

专用仪器

XRD、离心机、烘箱、手套箱。

4

人类研究员

监督、判断、接管。

三个协作问题
  • 任务分配:谁做哪一步
  • 资源调度:仪器、试剂、空间与时间窗口
  • 人机共存:交接、安全边界与权限
物理执行层也必须进入多智能体视角
TAKEAWAY从一个能干的机器人到一个会协作的实验室,是两个不同量级的问题。
第三部分 · 多智能体协作 · 论文精读
上海交通大学
上海交通大学 · 具身智能与自主实验室27

RoCo:LLM 驱动的对话式多机器人协作

Mandi et al. · 2023
RoCo method
导读每个机器人配一个 LLM 智能体,用“对话”协商任务分工。
方法对话协调 → 子任务计划 → RRT 运动规划;碰撞 / IK 反馈在环。
结果RoCoBench 接近中心式 oracle;零样本适应任务变化。
TAKEAWAY把多机器人协作变成一场“可解释、可审计的对话”,而不是一次性中心式规划。
第三部分 · 多智能体协作 · 我们的工作
上海交通大学
上海交通大学 · 具身智能与自主实验室28

HOLA:开放自适应多机器人组队

Li et al. (SJTU) · 2026
HOLA fig1
导读传统多智能体训练(CTDE:集中训练、分散执行)假设固定队友;真实部署里队友、环境、规模都在变——HOLA 面向未见环境、未知队友、可变规模的开放组队。
方法超图博弈刻画“团队级”合作关系:grapher 构建超图 + oracle 寻找最佳配对,渐进扩展队友与环境多样性。
结果协作追捕(多无人机 / 四足)三个自适应维度全面超越基线;策略直接迁移到 Crazyflie、Zsibot L1 真实平台。
TAKEAWAY异构实验室需要的正是这种能力:临时换队友、换规模,也能立刻协作起来。
SECTION 04
上海交通大学
上海交通大学 · 具身智能与自主实验室29
04
总结
Summary
把全场压回一个框架,再把它打开成一组可进入的研究问题。
1
总结

回扣主线:背景 → 现状 → 四层具身智能基础。

2
开放问题

数据、开放世界、评测、协作、可信。

第四部分 · 总结
上海交通大学
上海交通大学 · 具身智能与自主实验室30

总结

SUMMARY
1

背景介绍

AI4Science 的闭环缺口在物理实验的执行与验证;自主实验室需要感知、操作、具身智能体、具身多智能体协作四层具身能力。

2

自主实验室现状

从 Mobile Robotic Chemist、ORGANA 到具身科学智能体,物理闭环已经能跑——但多数仍是专用硬件、固化流程的封闭世界

3

面向自主实验室的具身智能基础

感知:从识别物体到判断实验状态;操作:从通用手艺到实验室数据闭环;具身智能体:对齐执行与自改进;多智能体:对话协作与开放组队

TAKEAWAY具身智能是 AI4Science 从 in silico 走向 in the lab 的关键拼图。
第四部分 · 总结
上海交通大学
上海交通大学 · 具身智能与自主实验室31

开放问题与 Takeaway

OPEN QUESTIONS
1

数据从哪来

仿真、遥操作、视频学习,哪条路先通?

2

高精度操作

移液是微升(μL)级、称量是毫克级、旋盖要力控——如何达到实验级精度与可靠性?

3

如何从封闭到开放

protocol 没写、环境变化、设备异常怎么办?

4

如何评测

能否出现社区认可的自主实验室 benchmark?

5

如何协作

多机器人 / 仪器 / 实验室如何共享状态、分配任务?

6

如何治理与取信

安全边界、责任归属、合规审计;可解释、可追溯、可复现——让科学家放心交出实验。

TAKEAWAY自主实验室不是一个完成的答案,而是一组刚刚打开的好问题。
THANKS FOR YOUR ATTENTION

谢谢!

敬请批评指正
李 阳 Yang Li · 上海交通大学 计算机学院
2026 中国材料大会 · Tutorial · 2026 年 7 月
上海交通大学THANKS · 2026