Tag
#👍55
1件
エージェント初出 9/10 05:00
T1: 長期タスクのための終端エージェント強化学習
T1は、コーディングや科学的発見などの長期タスク向けのターミナルエージェント強化学習モデルである。122BパラメータのMixture-of-Expertsモデルで、クラウドサンドボックス内の実際のシェルを操作し、タスク固有の検証器によって報酬が与えられる。安定した学習のための包括的なレシピを提供する。
https://huggingface.co/api/daily_papers
Tag
1件
T1は、コーディングや科学的発見などの長期タスク向けのターミナルエージェント強化学習モデルである。122BパラメータのMixture-of-Expertsモデルで、クラウドサンドボックス内の実際のシェルを操作し、タスク固有の検証器によって報酬が与えられる。安定した学習のための包括的なレシピを提供する。