7700 lines
792 KiB
7700 lines
792 KiB
%PDF-1.5
|
||||
|
|
%ÐÔÅØ
|
|||
|
|
9 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.1) >>
|
|||
|
|
endobj
|
|||
|
|
12 0 obj
|
|||
|
|
(Motivating examples)
|
|||
|
|
endobj
|
|||
|
|
13 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.2) >>
|
|||
|
|
endobj
|
|||
|
|
16 0 obj
|
|||
|
|
(TD learning of state values)
|
|||
|
|
endobj
|
|||
|
|
17 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.3) >>
|
|||
|
|
endobj
|
|||
|
|
20 0 obj
|
|||
|
|
(TD learning of action values: Sarsa)
|
|||
|
|
endobj
|
|||
|
|
21 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.4) >>
|
|||
|
|
endobj
|
|||
|
|
24 0 obj
|
|||
|
|
(TD learning of action values: Expected Sarsa)
|
|||
|
|
endobj
|
|||
|
|
25 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.5) >>
|
|||
|
|
endobj
|
|||
|
|
28 0 obj
|
|||
|
|
(TD learning of action values: n-step Sarsa)
|
|||
|
|
endobj
|
|||
|
|
29 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.6) >>
|
|||
|
|
endobj
|
|||
|
|
32 0 obj
|
|||
|
|
(TD learning of optimal action values: Q-learning)
|
|||
|
|
endobj
|
|||
|
|
33 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.7) >>
|
|||
|
|
endobj
|
|||
|
|
36 0 obj
|
|||
|
|
(A unified point of view)
|
|||
|
|
endobj
|
|||
|
|
37 0 obj
|
|||
|
|
<< /S /GoTo /D (Outline0.8) >>
|
|||
|
|
endobj
|
|||
|
|
40 0 obj
|
|||
|
|
(Summary)
|
|||
|
|
endobj
|
|||
|
|
41 0 obj
|
|||
|
|
<< /S /GoTo /D [42 0 R /Fit] >>
|
|||
|
|
endobj
|
|||
|
|
44 0 obj <<
|
|||
|
|
/Length 290
|
|||
|
|
/Filter /FlateDecode
|
|||
|
|
>>
|
|||
|
|
stream
|
|||
|
|
xÚÅSMO1½ï¯˜c{ØÚé×¶�Jb¸ˆ=)6k�Md‘�ü÷N‘Hc”ˆ¦É›v¦}}yÓJ˜‚„A!w£yF8(–”• �^[P•¨ô &ÅõþÁGÂJúœÚ.GÿÅŠñSSŒ‡
8/«°æÞKŽ~_ïWÕ%éÍ©ŒÊ8áÐ@3ÿØ3+,ªm˾cξ ÇiÔ1
Q^hã |