強化学習による衛星姿勢制御 — 古典PIDを超えるRobust Control 2026年8月11日 強化学習・宇宙制御 衛星の姿勢制御は、教科書の中では「3軸の独立したPIDで十分」と語られがちです。... PPOSACクォータニオン姿勢制御強化学習衛星
RLHFの仕組みを3ステップで完全理解する 2026年6月7日 NLP RLHF(Reinforcement Learning from Human F... GPTLLMPPORLHF報酬モデル大規模言語モデル強化学習
強化学習PPOで衛星姿勢制御を学習させる — 理論と実装 2026年5月19日 強化学習・宇宙制御 地球観測衛星のカメラを目標地点に向ける、深宇宙探査機のアンテナを地球に正確に指向... PPOクォータニオン姿勢制御宇宙AI強化学習衛星
PPO(Proximal Policy Optimization)の理論と実装 2026年3月15日 強化学習 PPO(Proximal Policy Optimization)はOpenAI... Actor-CriticGAEPPOProximal Policy OptimizationTRPO強化学習機械学習