LLM推論初出 8/20 02:40
制御されたHawkesジャンプ拡散のための連続時間強化学習
Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
https://export.arxiv.org/api/query2026/8/20
AI要約
この研究は、 Hawkes過程駆動の確率微分方程式の連続時間強化学習を扱います。記憶のパス依存性により古典的な確率制御理論の範囲外にある非マルコフ設定での問題に対し、有限次元マルコフ化手順とアルゴリズムを開発し、多変量 Hawkes過程を指数カーネルの混合で近似します。これにより、複雑な確率システム制御へのML応用を示します。
AI要点
- 複雑な多変数Hawkesジャンプ拡散過程を、強化学習で扱えるように有限次元マルコフ化する手法を開発
- Hawkes-CT DDPGと呼ばれる連続時間強化学習アルゴリズムを提案し、非マルコフ過程の最適制御問題を解く
- イベント発生時刻のみから、未知のカーネル係数なしに最適制御問題を解くモデルフリーアルゴリズムを実装
- 提案手法は、指数分布、アーラン分布、べき乗則分布のカーネルを持つHawkes過程で、離散時間強化学習手法と比較して良好な性能を示した
なぜ重要か
非マルコフ過程の強化学習を可能にするこの手法は、金融、疫学、ソーシャルネットワークなど、イベント発生の履歴が重要な複雑なシステムへの応用が期待されます。