エージェント初出 9/10 05:00
T1: 長期タスクのための終端エージェント強化学習
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
https://huggingface.co/api/daily_papers2026/9/10
AI要約
T1は、コーディングや科学的発見などの長期タスク向けのターミナルエージェント強化学習モデルである。122BパラメータのMixture-of-Expertsモデルで、クラウドサンドボックス内の実際のシェルを操作し、タスク固有の検証器によって報酬が与えられる。安定した学習のための包括的なレシピを提供する。