2026b
# 智能体
强化学习中的智能体是一个自主决策的实体,它通过与环境互动来学习和改进其行为,各种算法的实现也是基于构造与训练特定的智能体来实现的。
# 智能体选项
构造智能体选项
智能体选项
| 函数名 | 简介 |
|---|---|
| rlQLAgentOptions | QL(Q-learning)智能体选项 |
| rlSARSAAgentOptions | SARSA(State-Action-Reward-State-Action)智能体选项 |
| rlDQNAgentOptions | DQN(Deep Q-Network)智能体选项 |
| rldoubleDQNAgentOptions | Double DQN(Double Deep Q-Network)智能体选项 |
| rlPGAgentOptions | PG(Policy Gradient)智能体选项 |
| rlACAgentOptions | AC(Actor-Critic)智能体选项 |
| rlDDPGAgentOptions | DDPG(Deep Deterministic Policy Gradient)智能体选项 |
| rlPGWithBaseLineAgentOptions | PGWithBaseLine 智能体选项 |
| rlduelingDQNAgentOptions | duelingDQN 智能体选项 |
| rlD3QNAgentOptions | D3QN(Dueling Double DQN)智能体选项 |
| rlTD3AgentOptions | TD3(Twin Delayed Deep Deterministic policy gradient )智能体选项 |
| rlPPOAgentOptions | PPO(Proximal Policy Optimization)智能体选项 |
| rlSQLAgentOptions | SQL(Soft Q-Learning)智能体选项 |
| rlSACAgentOptions | SAC(Soft Actor-Critic)智能体选项 |
| rlTRPOAgentOptions | TRPO(Trust Region Policy Optimization)智能体选项 |
# 智能体模型
构造智能体的策略函数与值函数及其优化器,通常为表格或神经网络形式。
智能体模型
| 函数名 | 简介 |
|---|---|
| rlQLModels | QL(Q-learning)智能体模型 |
| rlSARSAModels | SARSA(State-Action-Reward-State-Action)智能体模型 |
| rlDQNModels | DQN(Deep Q-Network)智能体模型 |
| rldoubleDQNModels | Double DQN(Double Deep Q-Network)智能体模型 |
| rlPGModels | PG(Policy Gradient)智能体模型 |
| rlACModels | AC(Actor-Critic)智能体模型 |
| rlDDPGModels | DDPG(Deep Deterministic Policy Gradient)智能体模型 |
| rlPGWithBaseLineModels | PGWithBaseLine 智能体模型 |
| rlduelingDQNModels | duelingDQN 智能体模型 |
| rlD3QNModels | D3QN(Dueling Double DQN)智能体模型 |
| rlTD3Models | TD3(Twin Delayed Deep Deterministic policy gradient )智能体模型 |
| rlPPOModels | PPO(Proximal Policy Optimization)智能体模型 |
| rlSQLModels | SQL(Soft Q-Learning)智能体模型 |
| rlSACModels | SAC(Soft Actor-Critic)智能体模型 |
| rlTRPOModels | TRPO(Trust Region Policy Optimization)智能体模型 |
# 智能体对象
构造不同算法的智能体对象。
智能体对象
| 函数名 | 简介 |
|---|---|
| rlQLAgent | QL(Q-learning)智能体对象 |
| rlSARSAAgent | SARSA(State-Action-Reward-State-Action)智能体对象 |
| rlDQNAgent | DQN(Deep Q-Network)智能体对象 |
| rldoubleDQNAgent | Double DQN(Double Deep Q-Network)智能体对象 |
| rlPGAgent | PG(Policy Gradient)智能体对象 |
| rlACAgent | AC(Actor-Critic)智能体对象 |
| rlDDPGAgent | DDPG(Deep Deterministic Policy Gradient)智能体对象 |
| rlPGWithBaseLineAgent | PGWithBaseLine 智能体对象 |
| rlduelingDQNAgent | duelingDQN 智能体对象 |
| rlD3QNAgent | D3QN(Dueling Double DQN)智能体对象 |
| rlTD3Agent | TD3(Twin Delayed Deep Deterministic policy gradient )智能体对象 |
| rlPPOAgent | PPO(Proximal Policy Optimization)智能体对象 |
| rlSQLAgent | SQL(Soft Q-Learning)智能体对象 |
| rlSACAgent | SAC(Soft Actor-Critic)智能体对象 |
| rlTRPOAgent | TRPO(Trust Region Policy Optimization)智能体对象 |
# 获取动作
获取动作
获取动作
| 函数名 | 简介 |
|---|---|
| get_action | 获取动作 |
# 回放经验
回放经验
回放经验
| 函数名 | 简介 |
|---|---|
| rlReplayMemory | 经验回放储存区 |
| memoryAppend | 经验增加 |
| memorySample | 经验抽样 |
| memoryDelete | 经验删除 |
| validateExperience | 经验验证 |