ד.14 — שני פרויקטים שלמים: Reversi ו־Space Invaders

המצגות: Reversi · DDQN – Space Invaders

בקורס נבנו שני סוכנים שלמים מעבר לאיקס עיגול: סוכן DQN למשחק הלוח Reversi, וסוכן DDQN למשחק Space Invaders שנכתב ב־pygame. שני הפרויקטים משתמשים באותם רכיבים שלמדנו בפרקים ד.11–ד.13: רשת ראשית ורשת מטרה, מאגר דגימות, ε-greedy ולולאת אימון של דגימה ואימון. הספר אינו מסביר את המימושים; ההסבר המלא, המצגות והקוד נמצאים באתר הקורס ובגיטהב.

לוח Reversi בגודל שמונה על שמונה עם כלים לבנים ושחורים; משבצת ירוקה מסמנת את המהלך האחרון
Reversi — סוכן DQN הלומד מול סוכן אקראי, מול סוכן קבוע ובמשחק עצמי.
חלון משחק Space Invaders: חללית בתחתית המסך, שמונה עשר חלליות אויב ופסי כותרת כחולים
Space Invaders — סוכן DDQN במשחק pygame עם מצב של 88 מספרים וארבע פעולות.

בכך מסתיים חלק למידת החיזוק. עברנו מתכנון עם מודל מלא של הסביבה (Policy Iteration ו־Value Iteration), דרך למידה מדגימות בטבלאות (מונטה קרלו, SARSA ו־Q-learning), ועד להחלפת הטבלה ברשת נוירונים שיודעת להכליל (DQN ו־DDQN). אותם רעיונות, עם רשתות גדולות יותר ומשחקים מורכבים יותר, עומדים בבסיס הסוכנים שלומדים לשחק במשחקי מחשב ובמשחקי לוח ברמה גבוהה.