当前位置：首页 > news >正文

做网站的技术路线网站页面怎么优化

news 2026/4/8 4:41:02

做网站的技术路线,网站页面怎么优化,做包装盒子的厂家哪个网站,如何开发一个app建设一个网站on-policy的定义：behavior policy和target-policy相同的是on-policy，不同的是off-policy。 behavior policy：采样数据的策略，影响的是采样出来s,a的分布。 target policy：就是被不断迭代修改的策略。如果是基于深度…

on-policy的定义：behavior policy和target-policy相同的是on-policy，不同的是off-policy。

behavior policy：采样数据的策略，影响的是采样出来s,a的分布。
target policy：就是被不断迭代修改的策略。

如果是基于深度的算法，那么非常好分辨：目标函数里面一定有s和a的期望，而计算梯度的时候使用了SGD，把一个采样作为了期望的值。但是这里面还有一个隐含的限制就是采样遵循的分布必须是s,a的分布。

因此分辨是否是on-policy的，只需要看目标函数。如果目标函数中s,a的分布和策略相关的，那么一定是on-policy的，如果是策略无关的，那么一定是off-policy的。

比如DQN的目标函数：在这里插入图片描述
这里一个(s,a)对看成一个随机变量，服从均匀分布，因此分布和策略无关（至于为什么s,a是均匀分布，那个是算法自己假设的），因此采样的时候需要用到experience replay，使得不管什么策略采样得到的reward，都变成均匀分布的。

因此用了experice replay之后，随便什么策略采样，虽然采样出来s,a服从那个策略的分布，但是经过experice replay之后还是变成了均匀分布。

比如PG:
在这里插入图片描述

这里面的随机变量是s, 而s是服从stationary distribution，就是agent出现在这个state的次数形成的分布。而这个分布和策略pi是相关的，因此是on-policy的(改变策略之后，agent出现的概率也改变了)

比如DPG:

在这里插入图片描述
这里面的分布d是一个常数(这是为了计算梯度方便)，因此DPG中s,a的采样和策略无关，是off-policy的。

比如PPO:

在这里插入图片描述
就是一个期望+一个类似正则项的东西，而非常明显看出来，这个期望是服从策略theta’的，也就是说s,a分布和策略相关，因此是on-policy的。

简单说下PPO：PPO用两个网络表示策略，一个是theta’一个是theta，用theta’网络的策略采样reward，得到的reward给theta的网络梯度下降。看起来怎么用了两个策略? 其实两个策略最后慢慢收敛到一起的，是一个策略。如果是off-policy是完全和策略无关的。

http://www.hkea.cn/news/757857/

相关文章：

百度抓取不到网站百度识图搜索图片来源

企业网站栏目规划的重要性网络营销的概述

公司网站建设找谁做免费发布推广信息网站

虚拟币网站开发seo百度关键字优化

网站建设都包括哪些淄博网站制作

自己做装修网站南宁百度推广seo

品牌建设浅谈seo网络营销外包

昆山网站建设兼职千锋教育的官网

cm域名做网站盘古百晋广告营销是干嘛

网站栏目策划企业网络营销方案

网站自动采集指标sem广告投放是做什么的

想做一个个人网站怎么做培训学校

网站开发ipv6升级如何创建自己的小程序

做网站需要备案吗外贸网站推广与优化

独立网站建设流程b站视频推广网站动漫

泰安诚信的网站建设b站推广入口2023年

高校网站建设资料库东莞seo推广公司

电子印章手机在线制作软件四川seo整站优化费用

个人风采网站制作外贸网站平台哪个好

沈阳企业建站谷歌推广和seo

.la域名做的网站如何快速推广app

广州优化网站建设怎么用手机制作网站

做微网站的第三方学网络营销

湖南做网站的公司有哪些搜索引擎是什么

flash网站管理系统seo优化排名易下拉用法

永年网站建设友链互换平台推荐

企业网站的设计公司网络广告营销的典型案例

高校思政主题网站建设的意义关键词歌词任然

哪里做网站比较快2345网址导航下载桌面

广州建设委员会官方网站凡科建站下载