专利名称:基于生成对抗机制的强化学习探索方法及装置专利类型:发明专利
发明人:杨君,袁凯钊,马骁腾,芦维宁,陈章,梁斌申请号:CN202010720742.7申请日:20200724公开号:CN112052936A公开日:20201208
摘要:本发明公开了一种基于生成对抗机制的强化学习探索方法及装置,其中,该方法包括:构建第一动作价值网络、第二动作价值网络、状态价值网络、目标状态价值网络、策略网络、密度模型网络和鉴别网络;基于生成对抗机制和离线强化学习算法的学习过程,对第一动作价值网络、第二动作价值网络、状态价值网络、目标状态价值网络、策略网络、密度模型网络和鉴别网络进行更新;根据更新的多个网络生成更新后的策略模型,对策略模型进行测试。该方法设计出一种利用探索过程中的正确决策加速和稳定强化学习训练过程的探索算法。
申请人:清华大学
地址:100084 北京市海淀区清华园
国籍:CN
代理机构:北京清亦华知识产权代理事务所(普通合伙)
代理人:石茵汀
更多信息请下载全文后查看
因篇幅问题不能全部显示,请点此查看更多更全内容