逆強化学習の理論 — 行動から報酬関数を推定する 2026年6月21日 強化学習 自動運転のAIを開発するとき、「安全に運転する」という目標をどのように数学的に定... MaxEntIRL報酬関数強化学習模倣学習機械学習逆強化学習