陕西专业技术人员-在人工智能领域,以下关于强化学习中的策略梯度算法,说法错误的是?

['A.直接对策略网络的参数进行优化', 'B.不需要环境反馈', 'C.可以用于解决连续动作空间的问题', 'D.基于策略梯度定理进行优化']


配图

📖 相关文章