Tag
#👍29
1件
LLM推論初出 9/9 05:00
MetroLLM-Bench: 自然言語処理モデルを交通案内キオスクの実行環境として評価する
MetroLLM-Benchは、言語モデルを交通キオスクのポリシーレイヤーとしてテストするための955ケースのベンチマーク。6つの実際の地下鉄システムと、ルーティング、運賃計算、障害、アクセシビリティなど11のカテゴリをカバー。モデルは構造化ツールを呼び出し、結果を含むターミナル状態を提出する必要がある。
https://huggingface.co/api/daily_papers