在世界模型中强化学习
先在物理仿真器中训练基座策略,再采集数据、学习世界模型,并在模型中微调或从零训练 PPO。
在仿真器中训练强化学习基座
在随机推块场景中训练策略,通过下面三条曲线观察学习效果。
Checkpoint
内置最佳 · 无需导入已随页面提供最佳策略,打开即可体验。
Checkpoint
内置最佳 · 无需导入已随页面提供最佳策略,打开即可体验。
内置策略和本地 JSON 都在你的浏览器中回放,无需上传文件。
实验配置
实验配置
基座训练曲线
回合回报 · 成功率 · 平均单步 reward
基座训练曲线
回合回报 · 成功率 · 平均单步 reward
回合回报
一个回合中 reward 的总和成功率
训练与验证回合中到达目标的比例平均单步 reward
原始 reward 总和 ÷ 动作决策次数训练世界模型
用基座策略采集仿真轨迹,学习状态变化,并检查预测误差。
数据采集与模型训练
采集数据 → 训练状态预测模型
数据采集与模型训练
采集数据 → 训练状态预测模型
采集仿真轨迹
40% 原策略、50% 加噪策略、10% 随机动作。按完整回合拆分 80% / 10% / 10%。
训练状态世界模型
3 个 MLP 预测下一步状态变化,以模型间分歧估计不确定性。完整状态与 policy 的 observation 勾选独立。
世界模型预测误差
预测误差 · 仿真场景对比
左侧回放原仿真状态,右侧回放世界模型预测;共享相同的机械臂、方块和目标样式。
完成后进入 03,在这个学到的世界模型中训练策略。完成的数据和模型自动保存在此浏览器。
世界模型训练曲线
实时更新 · 完成后随实验保存在浏览器中
世界模型训练曲线
实时更新 · 完成后随实验保存在浏览器中
状态预测损失
标准化状态变化的均方误差 · 越低越好实线:训练集 · 虚线:验证集
在世界模型中微调强化学习
在预测出的短轨迹中微调 PPO,再回到原物理仿真器验证效果。
策略微调与验证
先在 02 完成世界模型训练
策略微调与验证
先在 02 完成世界模型训练
PPO 微调
从采集状态出发,短轨迹 + 不确定性限制;保留真实验证中表现更好的策略。
回到原仿真器验证
实验运行在浏览器 Worker 中,完成的结果自动保存。刷新会停止未完成的阶段。
模型内强化学习曲线
实时更新 · 完成后随实验保存在浏览器中
模型内强化学习曲线
实时更新 · 完成后随实验保存在浏览器中
模型内 PPO 回报
每次更新的平均想象短轨迹回报含不确定性惩罚;不等于完整回合回报
原仿真验证成功率
每轮更新后,在原物理仿真器中验证虚线:微调前基线 · 独立测试不参与选优
在世界模型中冷启动强化学习训练
随机初始化 actor 和 critic,在 02 的世界模型中学习,再回原仿真器验证。
从零训练 PPO 与验证
先在 02 完成世界模型训练
从零训练 PPO 与验证
先在 02 完成世界模型训练
PPO 冷启动
不继承基座网络权重。复用 02 的数据和任务配置;从初始状态与采集状态各半采样,生成短轨迹训练。
回到原仿真器验证
实验运行在浏览器 Worker 中,完成的结果自动保存。刷新会停止未完成的阶段。
冷启动强化学习曲线
实时更新 · 完成后随实验保存在浏览器中
冷启动强化学习曲线
实时更新 · 完成后随实验保存在浏览器中
冷启动 PPO 回报
每次更新的平均想象短轨迹回报含不确定性惩罚;不等于完整回合回报
原仿真验证成功率
每 10 轮及最后一轮,在原仿真器中验证虚线:随机初始化基线 · 独立测试不参与选优