Tag · 5ページ目
#LLM推論
40件
RREDCoT: 推論モデルのためのセグメントレベル報酬再配分
RREDCoTは、推論モデルのためのセグメントレベル報酬再配分手法。遅延報酬問題であるCoT推論において、GRPOなどのモンテカルロ手法の効率を改善し、報酬の割り当てを最適化する。
TempoVLA: 速度制御可能なビジョン・言語・アクションポリシーの学習
TempoVLAは、速度制御可能な視覚言語行動ポリシー学習を提案。ロボット操作の異なるフェーズ(高速移動と精密動作)に適した速度調整を学習し、既存手法の固定速度問題と減速の課題を克服する。
失敗した推論トレースは、修正可能なことを教えてくれる(ただし、それを読むことによってではない)
推論モデルの失敗トレースは、修正可能な構造的失敗のシグナルをエンコードする。このシグナルを利用し、推論時の介入で回復可能な失敗を特定する手法を提案。