强化学习

Sequential Decision Making

在这里插入图片描述
类似一个反馈系统
Agent 是执行机构如机器人
observation是agent的观察
Action 是Agent能够采取的动作反应
Reward是环境给出的反馈

Markov Assumption

State S t S_t St is Markov if and only if : p ( s t + 1 ∣ s t , a t ) = p ( s t + 1 ∣ h t , a t ) p(s_{t+1}|s_t,a_t) = p(s_{t+1}|h_t,a_t) p(st+1st,at)=p(st+1ht,at)
未来的状态只与当前时刻的状态 S t S_t St 有关, 而与过去的状态 { S 1 , . . . , S t − 1 } \{S1, ... , S_{t-1}\} {S1,...,St1} 无关

  • Full Observability : Markov Decision Process(MDP)
  • Partial Observability: Partially Observable Markov Decision Process(POMDP)

Sequential Decision Process

  • Deterministic(决定性)
  • Stochastic(概率性)
    在这里插入图片描述
    强化学习算法通常有:
  • Model:表示环境对agent的action如何反应
  • Policy: 将agent的状态映射到action的函数
  • Value function: 在某个确定的policy下,在当前state和action下未来的收益

model

transition / dynamic model预测agent下一个状态
p ( s t + 1 = s ′ ∣ s t = s , a t = a ) p(s_{t+1}=s^{'}|s_t=s,a_t=a) p(st+1=sst=s,at=a)
reward model预测immediate reward
r ( s t = s , a t = a ) = E [ r t ∣ s t = s , a t = a ] r(s_t=s,a_t=a) = E[r_t|s_t=s,a_t=a] r(st=s,at=a)=E[rtst=s,at=a]

policy

Policy π \pi π 决定了agent遵循何种规则,选择action

  • Deterministic policy(确定性的)
    π ( s ) = a \pi(s) = a π(s)=a
  • stochastic policy(概率性)
    π ( a ∣ s ) = P r ( a t = a ∣ s t = s ) \pi(a|s) = Pr(a_t=a|s_t=s) π(as)=Pr(at=ast=s)

value

  • value function V π V^{\pi} Vπ
    在某个具体的policy π \pi π下,未来reward的期望
    V π ( s t = s ) = E π [ r t + γ r t + 1 + γ 2 r t + 2 + γ 3 r t + 3 + . . . ∣ s t ] V^{\pi}(s_t = s) = E_{\pi}[r_t+\gamma r_{t+1}+\gamma^2r_{t+2}+\gamma^3r_{t+3}+...|s_t] Vπ(st=s)=Eπ[rt+γrt+1+γ2rt+2+γ3rt+3+...st]
  • γ \gamma γ衡量即刻的reward和未来的reward
  • 能够评价state和action的好坏
  • 通过比较不同的policy来决定如何act
    在这里插入图片描述
在本项目中,我们将采用C语言作为开发工具,借助树这种数据结构来构建一个家族谱管理系统。家族谱本质上是一个层次化的结构,非常适合用树来表示,其中每个节点代表家族中的一个成员,节点之间的关系则反映了家族成员之间的辈分和血缘联系。 系统需要具备以下功能: 增加成员:允许用户向家族谱中添加新的成员。用户需要输入新成员的相关信息,如姓名、性别、出生日期等,以及他与家族中已有成员的关系,比如是某人的子女、兄弟姐妹等。系统根据这些信息将新成员正确地插入到家族谱树的相应位置。 删除成员:当家族中有成员去世或其他原因需要从家族谱中移除时,用户可以使用此功能。用户输入要删除的成员的姓名或其他唯一标识信息,系统查找并删除该节点,并且要处理好由此带来的家族谱树结构的调整,确保树的完整性。 修改成员信息:家族成员的信息可能会发生变化,例如联系方式更新、婚姻状况改变等。用户可以通过输入成员的姓名找到对应的节点,然后修改其存储的信息内容,系统保存更新后的信息,使家族谱保持最新状态。 查询成员信息:用户可以输入成员的姓名等信息来查询其详细资料,系统快速定位到该成员节点,并展示其所有存储的信息,如姓名、性别、出生日期、家庭关系等;此外,还可以实现一些更复杂的查询功能,比如查询某个人的所有直系亲属、查询某一代的所有成员等,方便用户了解家族谱的结构和成员关系。 通过实现这个家族谱管理系统,可以深入理解树这种数据结构的构建、遍历、插入、删除等操作,同时也能锻炼C语言的编程能力,将理论知识应用到实际问题的解决中。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值