Tag
コーディングコンペティションでの金メダルパフォーマンスに向けたポストトレーニング言語モデル
コーディングコンペティションにおけるLLMの性能向上のための専門化パイプラインを提示する。大規模な問題キュレーション、合成推論トレース、SFT、RLを組み合わせ、Nemotronモデルを訓練する。
Verbal Reinforcement Learning の台頭
自然言語によるフィードバックをLLMエージェントの改善に活用する「Verbal Reinforcement Learning (VRL)」というパラダイムを体系化。フィードバックがいつ、何を修正するかに基づき、3つの主要なカテゴリに分類し、この分野の研究を整理する。
知るには十分な校正、行動するには校正不足:偽造証拠はLLM Agentに未知のものをコミットさせる
LLMエージェントが、たとえ偽の証拠(市場パネル)を提示された場合でも、不確実な予測に対して確信を持って回答してしまう現象を実証。LLMの過信と、提示される情報による判断への影響を指摘。