国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:刘晓雪, 姜春茂
单位:1. 哈尔滨师范大学 计算机科学与信息工程学院,哈尔滨 1500252. 福建理工大学 计算机科学与数学学院,福州 350118
关键词:三支决策,改变三支决策,强化学习,策略选择,效用度量
三支决策的“分、治、效”(TAO)模型包括构建三分、施加策略、结果评估三个部分。目前,关于结果评估的研究旨在衡量策略施加后结果的前后变化,还无法预测施加哪个策略能达到最大效果。为了解决这一问题,对TAO模型的“治”和“效”进行了研究,提出一种基于强化学习的三支改变模型的策略选择与有效性预测的方法。首先将改变三支决策TAO模型中的改变三分状态和策略分别作为强化学习中的状态和动作,并将每次施加策略得到新的改变三分状态的过程看作一个周期,利用累积前景理论计算每个周期产生的奖励,将智能体与环境的交互过程用马尔可夫决策过程来表示;其次设置一个目标奖励,将各个周期的累计奖励达到目标奖励时的状态作为马尔可夫决策过程的终止状态;然后用Q-learning算法迭代出一个最短周期内达到目标奖励的策略序列,同时利用该策略序列预测当前改变三分状态的未来效用。最后使用一个实例体现出该方法实用性和有效性。
来源:2024年第2期
《计算机科学与探索》期刊编辑部