Udemy
    •  
    •  
    •  
    •  
    •  
    •  
    •  
    •  
Turn what you know into an opportunity and reach millions around the world.
Learn More
Your cart is empty.
Keep shopping
強化学習: AIでブロック崩しを学習させよう。Advantage Actor-Critic(A2C)で学ぶ応用編
Rating: 4.1 out of 5(53 ratings)
479 students

強化学習: AIでブロック崩しを学習させよう。Advantage Actor-Critic(A2C)で学ぶ応用編

Actor-Criticをゲームで学ぶ強化学習コースを体験してみよう。
Created by内山 充康
Last updated 9/2025
Japanese
Japanese [Auto],

What you'll learn

  • Actor-Critic によるデュアルネットワークの仕組み(AlphaZeroネットワーク)
  • 同期分散処理アルゴリズム
  • A2Cによるブロック崩しの学習のさせ方
  • 強化学習の応用
  • 方策勾配法等

Course content

8 sections64 lectures2h 49m total length
  • 紹介3:08

    コース全体の概要を説明しています。

    ・強化学習用語のおさらい

    ・強化学習アルゴリズムのおさらい

    ・Advantage Actor-Critic について

    ・Spot's Story(ポチの物語)

    ・ブロック崩しの学習

    ・テトリス学習の難しさ

Requirements

  • Udemyで強化学習に関するコースを受講された方。
  • ディープラーニングについての簡単な知識があることが前提となります。
  • Googleアカウントの取得

Description

強化学習アルゴリズム Advantage Actor-Critic(A2C)を使って、ブロック崩しゲームを経験ゼロの状態から自動で学習させていく方法を紹介します。Advantage Actor-Critic のネットワークモデルは、AlphaGo Zero でも使われているもので方策と価値と同時に学習できます。更に「同期処理」という方法からGPUを効率的に利用でき、数日かかっていた学習うが数時間でできるようになっています。ネットワークモデルの部分は、続編のAlphaGo Zeroのコースの基礎となりますので受講しておくようにしましょう。

また漫画Spot's storyで、A2Cの学習の流れを分かりやすく解説しています。わからなくなったときは数式やプログラムと一緒に見比べてみましょう。


モデルの学習時間:30分~数時間

保存データの読み込みから再生まで1分程度と、時間がかかりません。

Google Colab 上で実行しますので、様々なツールの用意は不要です。またお使いのパソコンの環境に依存しません。

PythonコードとPyTorchフレームワークの教材で実行できます。ChatGPTの強化学習でも利用されている考え方で、データサイエンス・AI学習中の方にもお薦めです。

Who this course is for:

  • 強化学習に興味のある方
  • ブロック崩しAIに挑戦したが動作できなかった方
  • DQN(Deep-Q-Network)の次を目指したい方
  • 強化学習でGPUを有効活用したい方