2026b

# 智能体


强化学习中的智能体是一个自主决策的实体,它通过与环境互动来学习和改进其行为,各种算法的实现也是基于构造与训练特定的智能体来实现的。

# 智能体选项

构造智能体选项

智能体选项

函数名 简介
rlQLAgentOptions QL(Q-learning)智能体选项
rlSARSAAgentOptions SARSA(State-Action-Reward-State-Action)智能体选项
rlDQNAgentOptions DQN(Deep Q-Network)智能体选项
rldoubleDQNAgentOptions Double DQN(Double Deep Q-Network)智能体选项
rlPGAgentOptions PG(Policy Gradient)智能体选项
rlACAgentOptions AC(Actor-Critic)智能体选项
rlDDPGAgentOptions DDPG(Deep Deterministic Policy Gradient)智能体选项
rlPGWithBaseLineAgentOptions PGWithBaseLine 智能体选项
rlduelingDQNAgentOptions duelingDQN 智能体选项
rlD3QNAgentOptions D3QN(Dueling Double DQN)智能体选项
rlTD3AgentOptions TD3(Twin Delayed Deep Deterministic policy gradient )智能体选项
rlPPOAgentOptions PPO(Proximal Policy Optimization)智能体选项
rlSQLAgentOptions SQL(Soft Q-Learning)智能体选项
rlSACAgentOptions SAC(Soft Actor-Critic)智能体选项
rlTRPOAgentOptions TRPO(Trust Region Policy Optimization)智能体选项

# 智能体模型

构造智能体的策略函数与值函数及其优化器,通常为表格或神经网络形式。

智能体模型

函数名 简介
rlQLModels QL(Q-learning)智能体模型
rlSARSAModels SARSA(State-Action-Reward-State-Action)智能体模型
rlDQNModels DQN(Deep Q-Network)智能体模型
rldoubleDQNModels Double DQN(Double Deep Q-Network)智能体模型
rlPGModels PG(Policy Gradient)智能体模型
rlACModels AC(Actor-Critic)智能体模型
rlDDPGModels DDPG(Deep Deterministic Policy Gradient)智能体模型
rlPGWithBaseLineModels PGWithBaseLine 智能体模型
rlduelingDQNModels duelingDQN 智能体模型
rlD3QNModels D3QN(Dueling Double DQN)智能体模型
rlTD3Models TD3(Twin Delayed Deep Deterministic policy gradient )智能体模型
rlPPOModels PPO(Proximal Policy Optimization)智能体模型
rlSQLModels SQL(Soft Q-Learning)智能体模型
rlSACModels SAC(Soft Actor-Critic)智能体模型
rlTRPOModels TRPO(Trust Region Policy Optimization)智能体模型

# 智能体对象

构造不同算法的智能体对象。

智能体对象

函数名 简介
rlQLAgent QL(Q-learning)智能体对象
rlSARSAAgent SARSA(State-Action-Reward-State-Action)智能体对象
rlDQNAgent DQN(Deep Q-Network)智能体对象
rldoubleDQNAgent Double DQN(Double Deep Q-Network)智能体对象
rlPGAgent PG(Policy Gradient)智能体对象
rlACAgent AC(Actor-Critic)智能体对象
rlDDPGAgent DDPG(Deep Deterministic Policy Gradient)智能体对象
rlPGWithBaseLineAgent PGWithBaseLine 智能体对象
rlduelingDQNAgent duelingDQN 智能体对象
rlD3QNAgent D3QN(Dueling Double DQN)智能体对象
rlTD3Agent TD3(Twin Delayed Deep Deterministic policy gradient )智能体对象
rlPPOAgent PPO(Proximal Policy Optimization)智能体对象
rlSQLAgent SQL(Soft Q-Learning)智能体对象
rlSACAgent SAC(Soft Actor-Critic)智能体对象
rlTRPOAgent TRPO(Trust Region Policy Optimization)智能体对象

# 获取动作

获取动作

获取动作

函数名 简介
get_action 获取动作

# 回放经验

回放经验

回放经验

函数名 简介
rlReplayMemory 经验回放储存区
memoryAppend 经验增加
memorySample 经验抽样
memoryDelete 经验删除
validateExperience 经验验证