强化学习算法合集(DQN、DDPG、SAC、TD3、MADDPG、QMIX等等)内涵20+强化学习经典算法代码。对应使用教程什么的参考博客: 多智能体(前沿算法+原理) https://blog.csdn.net/sinat_39620217/article/details/115299073?spm=1001.2014.3001.5502 强化学习基础篇(单智能体算法) https://blog.csdn.net/sinat_39620217/category_10940146.html
2023-05-15 19:40:13 17.37MB 强化学习 人工智能 MADDPG TD3
1
马普里 这是一个多代理项目(commnet ) pytorch用于多代理粒子环境“ simple_spread”( ) 推理: 通讯网: Bicnet: Maddpg: 训练曲线: 如何使用 点安装-r requirements.txt cd MAProj /算法 python ma_main.py --algo maddpg --mode火车 待办事项清单 受过更多地图训练 修复图形内存泄漏 博客链接 https://zhuanlan.zhihu.com/p/143776727
1
基于深度强化学习的编队控制使用MADDPG算法
2022-01-18 14:59:03 11KB 编队控制学习 MADDPG 编队控制 编队
1
多智能体强化学习 学习环境env
1
这是论文《Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments》的pytorch复现,直接使用其开源环境Multi-Agent Particle Environment,运行main.py即可进行运行程序
multiagent-particle-envs-master.zip
2021-09-24 12:02:17 61KB maddpg
1
可读,可重用,可扩展 Machin是为pytorch设计的增强库。 支持的型号 任何事物,包括循环网络。 支持的算法 当前,Machin已实现以下算法,该列表仍在增长: 单代理算法: 多主体算法: 大规模并行算法: 增强功能: 支持的算法: 进化策略 基于模型的方法 特征 1.可读 与其他强化学习库(例如著名的 , 和。 Machin尝试仅提供RL算法的简单明了的实现。 Machin中的所有算法均以最小的抽象设计,并具有非常详细的文档以及各种有用的教程。 2.可重复使用 Machin采用与pytorch类似的方法,将算法和数据结构封装在自己的类中。 用户无需设置一系列data collectors , trainers , runners , samplers ...即可使用它们,只需导入即可。 模型上的唯一限制是它们的输入/输出格式,但是,这些限制很小,可以轻松地使算法适
2021-09-17 19:09:16 1.54MB python reinforcement-learning deep-learning gae
1
Flight_maddpg MADDPG的实现 1引言 这是MADDPG的流实现,但是环境不同。 2依赖 张量流 matplotlib 修女 python == 3.6.1(建议使用anaconda / miniconda) 健身房 3次火车 python train_code.py 4结果 三大代理包括竞争与合作
2021-08-24 21:26:24 169KB Python
1
这是MADDPG算法的原始论文。MADDPG算法是一种非常优秀的多智能体强化学习算法,感兴趣的可以下载下来看看
2021-08-11 20:07:04 1.44MB 机器学习 强化学习 深度学习 MADDPG
1
项目3:合作与竞争 介绍 在这种环境下,两名特工控制球拍在球网上弹跳球。 如果探员将球击中网,则得到+0.1的奖励。 如果探员让一个球击中地面或越界将球击中,则其收益为-0.01。 因此,每个特工的目标是保持比赛中的球权。 观察空间由8个变量组成,分别对应于球和球拍的位置和速度。 每个代理都会收到自己的本地观察结果。 有两个连续的动作可用,分别对应于朝向(或远离)网络的运动和跳跃。 下图显示了最终的奖励进度。 环境在1820集中得到解决 算法: 为了解决此环境,我实现了Multi-DDPG算法。 实现的功能如下: 每个特工都有独立的演员和评论家 集中培训:每个代理的批评者不仅将自己的演员的行为和状态作为输入,而且还将所有其他代理的状态和行为作为输入。 由于在测试过程中仅使用参与者,并且参与者仅取决于相应参与者的状态,因此代理可以自由地学习自己的奖励结构。 下图[来源: :
2021-06-09 20:21:22 45.93MB reinforcement-learning robotics tennis agents
1