LLM推論初出 7/18 02:56
物理学強化型強化学習による動的システムのリアルタイム最適制御
Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems
https://export.arxiv.org/api/query2026/7/18
AI要約
自動運転車の脆弱性に対する構造化された脅威情報の生成において、オープンウェイトLLMの評価を行います。CAVの脆弱性はCVEデータベースにプレーンテキストで記録されますが、セキュリティ専門家は影響を受けるアセットや弱点の種類に関する構造化された情報を求めています。
AI要点
- 高次元・パラメータ化された動的システムのリアルタイム最適制御のため、物理学強化型強化学習(PEARL)を提案。
- PEARLは、自動微分を用いたActor-Adjointアルゴリズムにより、短期間のポリシー勾配と将来の報酬の感度を計算。
- これにより、環境との相互作用数を大幅に削減し、長期的勾配の不安定性を軽減する。
- 実証実験では、PEARLが最先端RLアルゴリズムを上回り、サンプル効率が高く、パラメータ化システムで汎用性があることを示した。
- 高次元状態・行動空間へのスケーリングを可能にし、低次元状態表現やマルチエージェント戦略を必要としない。
なぜ重要か
複雑な動的システムの制御において、従来の強化学習のサンプル効率と汎用性の問題を解決し、ロボティクスや自動運転など、リアルタイム制御が不可欠な分野でのAI応用を加速させる可能性がある。