強化学習
自動運転のAIを開発するとき、「安全に運転する」という目標をどのように数学的に定...
強化学習
強化学習(Reinforcement Learning)は、エージェントが環境と...
強化学習
マルコフ決定過程(Markov Decision Process, MDP)は、...
強化学習
ベルマン方程式(Bellman equation)は、強化学習と動的計画法の中核...
強化学習
Q学習やSARSAといった価値ベースの手法では、行動価値関数 $Q(s, a)$...
強化学習
強化学習では、エージェントが環境と相互作用しながら試行錯誤で最適な行動を学びます...
強化学習
PPO(Proximal Policy Optimization)はOpenAI...
強化学習
A3C(Asynchronous Advantage Actor-Critic)...
強化学習
Q学習は強力なアルゴリズムですが、状態空間が大きい(あるいは連続的な)問題ではQ...
強化学習
TD学習(Temporal Difference Learning)は、モンテカ...