蚁群算法再优化：combine aco algorithm with Sarsa in RL

原创小白变怪兽

已于 2024-06-11 15:36:08 修改

阅读量1k

点赞数 3

CC 4.0 BY-SA版权

分类专栏：组合优化文章标签：人工智能组合优化元启发蚁群算法强化学习Sarsa

于 2023-03-03 20:20:20 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/wlfyok/article/details/129325205

组合优化专栏收录该内容

9 篇文章 ¥19.90 ¥99.00

订阅专栏

超级会员免费看

本文介绍了如何将蚁群算法与Sarsa强化学习算法结合，以优化旅行商问题（TSP）。首先，阐述了TSP问题和Sarsa算法的基本概念，接着详细说明了蚁群算法的改进过程，包括以一定概率选择最优路径和随机选择多个备选路径。通过数值实验，在公开测试集att48上进行验证，结果显示改进后的蚁群算法相比原算法有1%的提升，表明这种方法能扩大搜索空间，提高寻优效果。

蚁群算法再优化：combine aco algorithm with Sarsa in RL

蚁群算法、Sarsa介绍和TSP问题介绍
- TSP和Sarsa
- aco algorithm
具体的改进和代码
- 改进说明
- 部分代码
数值实验
- 结论分析
参考文献

蚁群算法、Sarsa介绍和TSP问题介绍

在进行蚁群算法优化介绍之前，笔者先将涉及到的算法等应用背景与大家说清楚。

TSP和Sarsa

TSP问题叫旅行商问题，即给定n个城市和他们的坐标，城市之间的距离表示为dij(i，j分别为不同城市的下标)，d的距离一般用欧式距离，且为对称问题(就是i->j 和 j->i的距离是相等的)，我们要寻找一个哈密顿回路，来使得回路的消耗最小，这就是我们的TSP问题的目标。
Sarsa算法是强化学习中智能体在未知空间学习策略的一种经典算法。其大致思路是智能体（agent）下一时刻采取的动作参考动作所带来的收益，且以ε的概率采取获得收益的最大动作，1-ε的概率随机选取剩下的动作进行寻优。
具体的相关的文章可以参看笔者之前的blog，强化学习的Sarsa与Q-Learning的Cliff-Walking对比实验.下面引用文章中Sarsa的伪代码。
在这里插入图片描述

aco algorithm

蚁群算法是

了解本专栏

超级会员免费看

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

原创小白变怪兽 帮助原创小白成为怪兽吧！

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。