|
|
5仿真币
对这个算法最直观的理解是这样的:- e$ @* f, F& y* |6 U# Q4 y; Z5 t. c
/ v0 A. N) V1 g: y1 F8 y- q. v3 J一个agent在一天的开始时观察这个世界(获得information, 这个information是binary的,比如:天有没有下雨;家里的食物储备多不多),之后根据他获得的information,随机地选择一个action(比如:吃储备着的粮食)。在一天结束(即第二天开始)后,他计算了他的效用(就是满意度),如果效用较初始效用上升,他就会使选择这个action的概率上升一个单位。即整个算法是从information map到probability的一个过程。+ f8 h2 R! L X8 t# C7 I
- v- o5 d) D' ~" k& Y以下是对编程有用的具体的算法:
- R0 r0 l/ c9 Z/ Y/ }# D' ~% e! }2 a* D2 m0 _! U
假设现在有2个information, 所以列出所有的排列为[[0 0][0 1][1 0][1 1]]。
; S- I2 @% b1 ^! s% h. W7 w: C. d# z" {7 q
假设有4个actions: a1, a2, a3, a4。每个action所发生的概率分别为p1,p2,p3,p4。! X1 i5 c! `& y
- s2 X9 {; w4 o8 S( v7 b& g每一个information vector都对应actions的一个概率分布。初始状态下的对应关系是这样的:: y# u# ` y4 h& `9 A: c6 g3 @
$ H+ C ^! E' Y- ]9 L2 z
[ [0 0] -> [0.25 0.25 0.25 0.25]
* S. l% a1 Q6 F+ y3 F4 P [0 1] -> [0.25 0.25 0.25 0.25]( Z8 `1 G6 d- u$ q- c
[1 0] -> [0.25 0.25 0.25 0.25]! n# k8 O9 J' x2 Y/ p
[1 1] -> [0.25 0.25 0.25 0.25]* e8 e: R5 P" V, ?5 F0 K' c# M9 q' A/ P
]
, ~. W" q% i2 c- [: r0 @! j R8 u- N. C* J+ @: ~5 C
好,现在agent开始获得information,比如[0 0],这时,agent就用第一行的[0.25 0.25 0.25 0.25],来随机选择一个行为,假设他选择的是a2。在他做出了这个action之后,假设第二天他发现他的效用上升了,所以他就把a2发生的概率p2上调w,所以概率矩阵的第一行就变成[0.25-w/3 0.25+w 0.25-w/3 0.25-w/3]。
! B1 B& L) K. M; @0 O/ a4 _. b( ~- u( q5 G4 E
他在第二天的开始又获得information,如果还是[0 0],那么就用[0.25-w/3 0.25+w 0.25-w/3 0.25-w/3]来随机选择一个action。但如果是[0 1],那么就还是要用第二行的[0.25 0.25 0.25 0.25]来随机选择一个action。选择完action之后就比较前一天的效用,然后再调整概率。 ~0 G: ^) E6 R4 q% ?, Y, y
N- z$ }% H: r+ y
整个算法都在这里了,现在的问题是我根本就不知道从何下手,也不知道这个算法跟模型库中的哪些算法比较相似。2 J) C$ Z, i3 ^! ^7 m8 a
; K( P5 C, w) ]$ O* b7 O恳请高人教导! |
|