一种动态强化学习决策训练系统,包括强化学习模型、训练环境模块、强化学习模型与训练环境模块之间的数据接口;训练环境模块由环境执行引擎模块、观测构建模块、回报计算模块三个功能模块构成;环境执行引擎模块,用于维护一个底层状态数据结构,输出包含所有状态信息的底层状态数据;观测构建模块,用于负责将底层状态数据转换为适应不同算法需求的状态信息形式,在训练过程中训练环境模块通过回调或动态加载机制调用对应观测构建模块将底层状态数据重构生成状态信息;回报计算模块,用于针对多种回报生成条件设置回报检查点,训练环境模块执行步长中计算检查点回报值并输出;强化学习模型与训练环境模块之间的数据接口包括:状态信息发送接口、动作接收接口、回报发送接口;极大增强算法普适性,降低接口设计难度,同时减小环境对算法形态的限制。
声明:
“动态强化学习决策训练系统” 该技术专利(论文)所有权利归属于技术(论文)所有人。仅供学习研究,如用于商业用途,请联系该技术所有人。
我是此专利(论文)的发明人(作者)