Apps /PUSH LAB你的 CPU · 浏览器训练
WORLD MODEL · REINFORCEMENT LEARNING

在世界模型中强化学习

先在物理仿真器中训练基座策略,再采集数据、学习世界模型,并在模型中微调或从零训练 PPO。

Apple Silicon正在读取设备

在仿真器中训练强化学习基座

在随机推块场景中训练策略,通过下面三条曲线观察学习效果。

训练进度
环境步数 / 秒
后台最佳策略 · 验证成功率
独立测试 · 100 个初始状态
随机场景 · 固定底座
布局预览
距目标 仿真时间 0.0 s回合 1
拖动画面移动末端 · 参考控制器已验证可解

Checkpoint

内置最佳 · 无需导入

已随页面提供最佳策略,打开即可体验。

暂无可回放的 checkpoint

内置策略和本地 JSON 都在你的浏览器中回放,无需上传文件。

实验配置

应用于下一次训练
Observation 16 维

勾选后参与训练;取消后直接移除该项输入维度。方块和目标位置以固定底座为原点,单位为米。

Reward

回报是每回合 reward 的累加。以下系数用于每次动作决策。

选择策略能看到的状态,调整它学到什么。设置随模型保存 · 训练期间锁定

基座训练曲线

回合回报 · 成功率 · 平均单步 reward

回合回报

一个回合中 reward 的总和
训练平均最佳验证

成功率

训练与验证回合中到达目标的比例
训练本轮验证历史最佳

平均单步 reward

原始 reward 总和 ÷ 动作决策次数
训练平均最佳验证

训练世界模型

用基座策略采集仿真轨迹,学习状态变化,并检查预测误差。

采集进度等待采集
转移数据量状态 + 动作 → 下一步状态
世界模型训练进度等待训练
当前模型 · 验证损失标准化均方误差 · 越低越好

数据采集与模型训练

采集数据 → 训练状态预测模型

就绪

采集仿真轨迹

40% 原策略、50% 加噪策略、10% 随机动作。按完整回合拆分 80% / 10% / 10%。

训练状态世界模型

3 个 MLP 预测下一步状态变化,以模型间分歧估计不确定性。完整状态与 policy 的 observation 勾选独立。

世界模型预测误差

完成后进入 03,在这个学到的世界模型中训练策略。完成的数据和模型自动保存在此浏览器。

世界模型训练曲线

实时更新 · 完成后随实验保存在浏览器中

状态预测损失

标准化状态变化的均方误差 · 越低越好

实线:训练集 · 虚线:验证集

在世界模型中微调强化学习

在预测出的短轨迹中微调 PPO,再回到原物理仿真器验证效果。

策略微调与验证

先在 02 完成世界模型训练

就绪

PPO 微调

从采集状态出发,短轨迹 + 不确定性限制;保留真实验证中表现更好的策略。

回到原仿真器验证

实验运行在浏览器 Worker 中,完成的结果自动保存。刷新会停止未完成的阶段。

模型内强化学习曲线

实时更新 · 完成后随实验保存在浏览器中

模型内 PPO 回报

每次更新的平均想象短轨迹回报
模型预测轨迹

含不确定性惩罚;不等于完整回合回报

原仿真验证成功率

每轮更新后,在原物理仿真器中验证
本轮历史最佳原策略

虚线:微调前基线 · 独立测试不参与选优

在世界模型中冷启动强化学习训练

随机初始化 actor 和 critic,在 02 的世界模型中学习,再回原仿真器验证。

从零训练 PPO 与验证

先在 02 完成世界模型训练

就绪

PPO 冷启动

不继承基座网络权重。复用 02 的数据和任务配置;从初始状态与采集状态各半采样,生成短轨迹训练。

回到原仿真器验证

实验运行在浏览器 Worker 中,完成的结果自动保存。刷新会停止未完成的阶段。

冷启动强化学习曲线

实时更新 · 完成后随实验保存在浏览器中

冷启动 PPO 回报

每次更新的平均想象短轨迹回报
模型预测轨迹

含不确定性惩罚;不等于完整回合回报

原仿真验证成功率

每 10 轮及最后一轮,在原仿真器中验证
本轮历史最佳随机初始策略

虚线:随机初始化基线 · 独立测试不参与选优