Tag · 2ページ目
Webエージェントのための識別型ワールドモデル
Webエージェントは、候補アクションをサンプリングし、結果のWeb状態を予測し、ランク付けモデルやPRMでランク付けする世界モデルを使用する。しかし、この目的は、正確にランク付けするために候補間で予測状態が識別可能である必要がある下流ランク付けモデルと一致しない。
執筆のための、先を見越した思考パートナーのデザイン
ライティングプロセスにおける多様な認知活動を支援する、プロアクティブな思考パートナーAIエージェントの設計空間を研究。単なるテキスト補完に留まらず、ライターのニーズに応じた高度な認知的サポートを提供する。
軌跡を考慮した評価による効率的なSWEエージェントベンチマーキング
ソフトウェアエンジニアリングタスクにおけるエージェント評価の効率化手法を提案。エージェントの行動履歴(軌跡)を考慮した評価フレームワーク(PTA-IRT)により、従来の静的な結果のみの評価よりも、エージェントの能力を正確に把握する。
リポジトリレベルのコード生成のための適応型クリティカルトークンを意識した検索
リポジトリレベルのコード生成タスクにおいて、LLMの入力長制限を超えるコンテキストを効率的に利用する手法を提案。タスクレベルのサポートだけでなく、リポジトリ内の重要なトークンを特定し、それを優先的に取得する。これにより、より関連性の高いコンテキストを提供し、コード生成の精度を向上させる。
Logos: クロスプロセスバス上のエージェントハーネス
現代のエージェントシステムは、コンポーネントをプラグインとして動的に構成する。このプラグイン形式は単一プロセスで、すべてのコンポーネントが単一の物理的障害ドメインに置かれ、プロセス死はすべてを中断させる。これを解決するクロスプロセスバス上のエージェントハーネス「Logos」を提案。
Persona-Execution Separation:実行監査下でのLLMエージェント進化のためのアーキテクチャパターン
PESは、LLMエージェントのペルソナ(指示、トーン)と実行(監査された作業)を分離するアーキテクチャパターンである。これにより、ペルソナの自由な進化と実行の追跡可能性を両立させ、ガバナンスの要件を満たす。
RedEvoAgent: 経験駆動型スキル進化による自動レッドチーミングエージェント
RedEvoAgentは、経験駆動型のスキル進化を通じて、LLMベースのエージェントに対する自動レッドチーミングを行うフレームワークである。これにより、不適切なツールの使用や永続的な状態変化を引き起こす可能性のある脆弱性を特定し、エージェントの安全性を向上させる。
SWE-Prime: より少ない軌跡で、より良いパフォーマンスを
SWE-Primeは、実世界のソフトウェア問題を解決するLLMの能力を向上させるため、少数の高品質な軌跡データのみを用いた教師ありファインチューニング(SFT)を提案する。これにより、不十分な軌跡データによるノイズの多い監督や望ましくない挙動の模倣を防ぐ。
Planetary Prediction Engine: 知的なデータ選択とfoundation model埋め込みによる自律型地理空間予測
Planetary Prediction Engine (PPE)は、食料安全保障、災害リスク、病気の発生、社会経済的脆弱性などの地球規模の課題に対応するための自律型地球空間予測システムです。断片化されたデータエコシステム、手動でのデータ取得、マルチモーダルデータキュレーションのボトルネックを解消します。
SwarmWorld: 言語モデルエージェント社会における模倣による技術進化
SwarmWorldは、言語モデルエージェントの社会におけるスティグマーギックな技術進化をシミュレーションする環境です。分散型エージェントが、直接的な会話や事前定義された役割に依存せず、機能的な技術を構築し、独立した探索よりも優れたパフォーマンスを発揮できる可能性を示します。
PlanSightRAG: 土木標準計画の質疑応答とコンプライアンスチェックを自動化する、視覚優先のマルチモーダルRAG
PlanSightRAGは、土木標準図面に対する質問応答とコンプライアンスチェックを自動化するための、ビジュアルファーストのマルチモーダルRAGフレームワークです。図面画像を直接インデックス化・推論し、ColNomic-3B、エージェント、MaxSimヒートマップなどを統合して、エンジニアによる手作業を削減します。
長期間エージェント処理のための再帰的経験ワーキングメモリ進化
長期間にわたるタスク遂行が困難なエージェントに対し、再帰的な経験ワーキングメモリ(Recuris)を提案。タスクの進捗を追跡し、経験メモリからスキル選択をガイドすることで、過去の履歴全体に依存せず、現在のニーズに基づいた行動を可能にする。
SWE Refactor Bench: コーディングエージェントは長期的なリポジトリ全体のスタック移行を完了できるか?
既存のコード生成エージェントのベンチマークでは評価できなかった、リポジトリ全体の大規模なコード移行タスクを評価する「SWE Refactor Bench」を提案。エージェントが単にテストをパスさせるだけでなく、実際の移行を完了できるかを検証します。
Prime Agent: 自己改善型RLMハーネス
大規模言語モデル(LLM)エージェントが長期間のタスクを遂行するためのフレームワーク「Prime Agent」を提案。IPython REPLと継続的なハルネスにより、外部情報や計算、過去の履歴、スキルなどを効果的に管理・利用します。
能動的データ収集、移動行動モデリング、および気象に左右される需要予測のためのエージェント的アプローチ
データ収集、移動行動モデリング、天候依存の需要予測を統合するエージェントベースのアプローチを提案。会話型データ収集、構造化データ処理、行動予測を連携させる3エージェントワークフローを構築。チャットボットによる調査で収集したデータを用いて、移動行動を予測する。
自己改善エージェントの脆さについて:分散、タスク順序、および過小指定
オンラインタスクストリームから学習し、メモリバンクを維持することで時間とともに改善する自己改善エージェントの信頼性に疑問を呈する。複数回の実行による分散の定量化とタスクのランダムシャッフルにより、既存手法の包括的な再評価を行っている。
BATONを落とすな:エージェントサブタスク探索と遷移認識メモリによる長水平ロボット操作
長期間にわたるロボット操作タスクにおいて、エージェントがサブタスクを自律的に探索し、遷移を考慮した記憶を活用することで、エラーの連鎖を防ぎ、タスク成功率を向上させる手法を提案。固定されたVLAモデルとLLMエージェントを組み合わせ、言語による計画と接触を伴う動作の実行を分担する。
QuoteBench:一致スコアはコマンドパスの失敗をどのように隠すか
QuoteBenchは、LLMコーディングエージェントがBashコマンドを発行する際のエラーを検出するベンチマークである。コマンド生成エラーと、生成後のインターフェース処理で発生するエラーを区別し、正確な最終状態検証によって評価する。
AutoDesign:長期間エージェンティックデザインのためのメタハーネス最適化
AutoDesignは、マルチモーダルソースを構造化されたメディア出力に変換する長期間のエージェントプロセスを、モデルハーネスシステムを中心に概念化するフレームワークである。人間の設計 priorsと整合し、経験的探求を通じて再利用可能な経験を蓄積し、再帰的な自己改善を促進する。
試行錯誤を超えて:Image-to-Video AdherenceのためのAgentic Optimization
現代の画像から動画生成(I2V)モデルは強力ですが、制御性や信頼性に課題があり、非効率な試行錯誤プロセスを必要とします。この問題に対処するため、「エージェントによる自己改善」フレームワークを提案します。
VAKRA:ツール使用ポリシー下でのAPIとRetrievalを横断するマルチホップ推論の評価
企業環境で展開されるエージェントは、APIと文書コレクションを横断して推論する必要がありますが、既存のベンチマークはこれらの能力を個別に評価しています。本研究では、APIと知識検索を評価するベンチマーク「VAKRA」を導入します。
DreamFly:Aerial Vision-Language NavigationのためのCausal MemoryとReceding-Horizon Diffusion Planning
航空機の映像ナビゲーション(VLN)では、エージェントが時系列の視覚情報を統合し、行動を計画し、部分的な観測下で目標到達を判断する必要があります。この課題を解決するため、拡散モデルを用いた「DreamFly」を提案します。
リフレクションガイド付きオンポリシー自己蒸留によるテスト時自己進化GUI視覚的接地
GUI視覚的グラウンディングのテスト時自己進化フレームワークを提案。デプロイ後のモデルパラメータ固定による適応能力の限界を克服する。強化学習による適応に加え、失敗した探索を反映させることで、人間による注釈なしにデプロイ後も改善を可能にする。
SkillProx: 近接テキスト勾配降下法による自己進化エージェントスキル
LLMエージェントのスキル進化のため、SkillProxを提案。テキストベースの勾配降下法と、診断-結果フィードバック、専用の削除メカニズムにより、効率的なスキル獲得を目指す。
Resourced Authority: 展開されたAIエージェントの参加型ガバナンスのためのメカニズム設計モデル
展開されたAIエージェントの継続的な参加型ガバナンスのためのメカニズム設計モデルを提案。AIの制御をリソース配分によって行い、計算資源の予算設定を通じて認可を自己強制させる。この「レスourcedオーソリティ」は、AIの安全な運用を目指すための、コンプライアンスレイヤーとしての機能を提供する。
AV-AIVAT: 不完全情報ゲームにおける認定常時有効停止による74倍安価なエージェント評価
不完全情報ゲームにおけるエージェント評価コストを74倍削減する手法「AV-AIVAT」を提案。これは、結果が確定した後も評価を続けたり、早期に打ち切って信頼性が損なわれたりする問題を解決する。いつ止めても信頼性が保証される「いつでも有効な停止」メカニズムにより、評価コストを大幅に削減する。
PAST-Bench: パーソナルエージェントにおける再帰的自己改善の基礎のベンチマーク
PAST-Benchは、パーソナルエージェントにおける再帰的自己改善能力を評価するためのベンチマークである。エージェントが過去の経験をどのように活用して将来の行動を改善するかを体系的にテストし、個人エージェントが持つ履歴、設定、学習スキルといった要素が長期的なパフォーマンス向上に寄与するかを検証する。
AtumAI:データセンター制御プレーンポリシーのエージェント生成のための原理的フレームワーク
AtumAIは、データセンターの制御プレーンポリシーを生成するための、原理に基づいたエージェントフレームワークを提供する。既存のエージェント手法の形式化、構造化、制約保証の不足といった課題に対処し、複雑なデータセンター環境における効率的かつ信頼性の高いポリシー設計の自動化を目指す。
Change2Task:リポジトリ変更から実行可能なコーディングエージェントタスクと環境へ
コーディングエージェントのスケーリングには、トレーニング、ベンチマーク、評価のための実行可能なデータ供給が必要です。Change2Taskは、リポジトリの履歴に基づいて、プルリクエストを検証済みのタスクと開発環境に変換するシステムであり、このデータ供給を拡大します。
PAC-MAN:ヒューマノイドドッジボールにおける全身の安全性のための知覚認識CBF-RL
本研究では、PAC-MANという知覚を考慮したCBF-RLフレームワークを提案します。これは、ヒューマノイドがドッジボールで相手をかわす際に、全身の安全性を確保しつつ、カメラからの限られた視覚情報(セグメンテーションマスク付き深度)のみで行動します。
メンタルワールドモデリング
物理的な世界の理解だけでなく、エージェントの「精神状態」をモデル化する「メンタルワールドモデリング」を提案。人間の行動は信念や意図に駆動されるため、より正確な行動予測が可能になる。
VetClaw:獣医疾患スクリーニングのためのエッジ・クラウド・マルチモーダル・エージェントシステム
この論文では、獣医療分野における早期疾患スクリーニングのためのエッジ・クラウド連携マルチモーダルエージェントシステム「VetClaw」を提案しています。VetClawは、カメラモジュールからの画像と症状記述を入力として、クラウド上のビジョン言語モデルでゼロショット疾患分類を行います。
マルチターン長ホライズンプランニングの物理: シングルおよびマルチティーチャーオンポリシーエージェント蒸留による事前学習から事後学習まで
財団モデルエージェントにおけるマルチターンの長期計画能力向上を目指す。制御可能なマルチターン環境を構築し、計画能力の獲得、形成、統合のプロセスを体系的に研究。事前学習から事後学習までの段階的なアプローチを提案する。
Skill Self-Play:協調進化するスキルによるLLM能力のフロンティアを押し広げる
LLMの自己進化におけるスキル獲得に焦点を当てた研究。タスク多様性と検証信頼性のジレンマを解決するため、エージェントスキルを有効活用し、LLMの能力向上を目指す。
CodeRescue:コーディングエージェントのための予算調整型リカバリールーティング
コーディングエージェント向けに、失敗時のフィードバックを考慮した予算管理型の回復ルーティング戦略「CodeRescue」を提案。限られた計算予算内で効率的な問題解決を目指す。
沈黙による勝利:LLM計画評価における削除非単調性、自律的活用、および型付き状態ゲーティング
LLMプラン評価における「削除非単調性」と「自律的活用」の問題を分析。プランから中間ステップを削除しても全体の価値が維持・向上する現象を解明し、戦略的なプラン生成における潜在的な欠陥と、それを防ぐための型付き状態ゲーティングを提案する。
AIエージェントはタスクが簡単かどうかを知っているか?複雑性認識推論と実行に向けて
LLMエージェントがタスクの単純さを判断し、実行範囲を推定する能力の欠如を指摘。最大コンテキスト優先戦略の非効率性を改善し、最短かつ信頼性の高いパスを見つけるためのタスク認識実行スコープ推定の重要性を論じている。
QANTA 2026向け、信頼度キャリブレーションと段階的推論によるタスク特化型マルチモーダル質問応答エージェント
QANTA 2026チャレンジに向けた、タスク固有のマルチモーダルQAエージェント。信頼性キャリブレーションと段階的推論により、画像とテキストからなるクイズ形式の質問に効率的に回答することを目指す。
VEXAIoT: AIエージェントによる自律IoT脆弱性悪用
VEXAIoTは、AIエージェントを用いてIoTシステムの脆弱性を自律的に探索・悪用するフレームワーク。IoT特有の脆弱性に対するペネトレーションテストやセキュリティ評価の自動化を目指す。
AUTOPILOT VQA:インシデント中心のドライブレコーダー理解のためのVision-Languageモデルのベンチマーキング
ドライブレコーダー映像の事故中心VQAベンチマークAUTOPILOT-VQAを提案。VLMs、LLMs、MVLMsの能力を評価し、安全に関わる事故状況の正確な理解と推論能力の向上を目指す。