news 2026/5/1 10:39:06

WorldModel_M000_Concept

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
WorldModel_M000_Concept

RSSM的世界模型 loss 本质是 ELBO:观测重建(+奖励预测)项,减去一个把后验拉向先验的 KL 正则项。

策略:从状态到动作(或动作分布)的映射。

重建是h,z->o,r和o,r的差

KL是h,a,o -> z和 h,a -> z的差

critic(值函数)是在 world model 里、沿着当前策略(actor)生成的想象轨迹,回归“想象回报目标(λ-return)”的神经网络

创新点在于不改环境奖励,只改策略学习时的“风险调整回报目标”,让 value/advantage 自动把高不确定/高风险区域判成“低价值”,从而把 actor 推向更保守的行为。

强化学习是让智能体在环境里试错互动:根据状态选动作,环境给奖励并转移到下一状态。目标最大化长期累计回报。通常要么学价值函数评估动作好坏,或直接学策略并处理探索和利用的权衡。

世界模型就是一个学出来的环境近似:输入当前隐状态(由当前观测+历史记忆编码得到)和动作,预测下一步隐状态以及奖励。它的意义是:用少量真实交互把模型校准后,可以在模型里快速 rollout 多步,来做规划或训练策略/值函数,让每一步真实数据更值钱、更省样本。

隐状态是世界模型和真实观测之间的桥:观测历史压缩成一个内部状态st=(ht,zt)s_t=(h_t,z_t)st=(ht,zt),其中hth_tht负责记忆历史,ztz_tzt负责表达不确定性。真实交互时用观测把隐状态校正成后验,想象时只用(隐状态+动作)推进到下一步并预测奖励。

隐状态和世界模型让离散的s,a->r映射建模为了一套可导的函数,从而把昂贵、不可反传的真实交互,替换成模型里低成本的多步 rollout(想象/模拟经验);并且因为这条计算链是可导的,‘长期回报/价值’的优化信号可以在模型内反向传播到要学习的函数(策略/值函数)参数上——所以同样一段真实数据能被反复利用、触发更多次更新,显著提高样本效率。

真实交互昂贵指“数据获取成本”(慢/危险/难并行/有预算),世界模型用可并行算力在模型内生成多步想象经验,从而减少所需真实交互步数,提高样本效率。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/5/1 7:11:48

ReTerraForged终极指南:3步快速打造震撼Minecraft世界

ReTerraForged终极指南:3步快速打造震撼Minecraft世界 【免费下载链接】ReTerraForged a 1.19 port of https://github.com/TerraForged/TerraForged 项目地址: https://gitcode.com/gh_mirrors/re/ReTerraForged ReTerraForged是TerraForged项目在Minecraft…

作者头像 李华
网站建设 2026/5/1 7:54:14

ReTerraForged技术指南:5个关键步骤打造专业级Minecraft地形

ReTerraForged技术指南:5个关键步骤打造专业级Minecraft地形 【免费下载链接】ReTerraForged a 1.19 port of https://github.com/TerraForged/TerraForged 项目地址: https://gitcode.com/gh_mirrors/re/ReTerraForged ReTerraForged作为TerraForged项目在1…

作者头像 李华
网站建设 2026/5/1 9:41:30

Windows字体显示终极优化:MacType完全配置攻略

Windows字体显示终极优化:MacType完全配置攻略 【免费下载链接】mactype Better font rendering for Windows. 项目地址: https://gitcode.com/gh_mirrors/ma/mactype 还在为Windows系统下文字显示效果模糊、阅读体验不佳而困扰吗?MacType作为一款…

作者头像 李华
网站建设 2026/5/1 8:30:20

如何快速掌握Steam成就管理器:游戏数据控制的完整指南

如何快速掌握Steam成就管理器:游戏数据控制的完整指南 【免费下载链接】SteamAchievementManager A manager for game achievements in Steam. 项目地址: https://gitcode.com/gh_mirrors/st/SteamAchievementManager 还在为那些看似永远无法达成的Steam游戏…

作者头像 李华
网站建设 2026/5/1 9:53:47

Sunshine游戏串流服务器:5步搭建你的专属云游戏平台

Sunshine游戏串流服务器:5步搭建你的专属云游戏平台 【免费下载链接】Sunshine Sunshine: Sunshine是一个自托管的游戏流媒体服务器,支持通过Moonlight在各种设备上进行低延迟的游戏串流。 项目地址: https://gitcode.com/GitHub_Trending/su/Sunshine…

作者头像 李华
网站建设 2026/4/7 10:37:35

Qwen3-Embedding-0.6B与BAAI/bge-base对比:中文语义匹配部署评测

Qwen3-Embedding-0.6B与BAAI/bge-base对比:中文语义匹配部署评测 1. Qwen3-Embedding-0.6B 模型特性解析 1.1 多功能嵌入模型的全新进展 Qwen3 Embedding 系列是通义千问家族中专为文本嵌入和排序任务打造的新一代模型,基于强大的 Qwen3 密集基础模型…

作者头像 李华