CS294-112深度增强学习课程(加州大学伯克利分校 2017)NO.4 Learning policies by imitating optimal controllers...

轨迹优化与策略搜索
本文探讨了模型与现实不匹配及梯度爆炸等问题,并讨论了动力学系统的复杂性及其对反向传播的影响。文章还研究了如何将轨迹优化方法应用于策略优化中,特别是在涉及相机观测和关节速度的情况下。

 

 

 

 

 

 

 

There are some problems: mismatch of model and reality; gradient explosion

 

 

 

 

 

 

 

 

 

 

 

 

so, the dynamics can be quite messy, and backpropogating can be quite problematic.

 sudden change in velocity and so on. schochastic system. gradient descent can be tough.

 

 

 

 

can we apply this trajectory optimization method to optimize policy?

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

  

 

GPS: guided policy search

 

 

 

 

in this case, ot is from the camera and the joint velocity

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

                     

 

                       

 

                       

 

 

 

 

                 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

  

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

https://katefvision.github.io/katefSlides/imitate_controlers_katef.pdf

转载于:https://www.cnblogs.com/ecoflex/p/9078801.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值