Tag
[8520] LLMの時代:戦況下におけるLarge Language Modelsの推論、外交、信頼性に関する戦略的1v1ベンチマーク
「Age of LLM」は、敵基地破壊を目的としたターン制1v1ベンチマークで、LLMの推論、外交、信頼性を評価します。フォッグ・オブ・ウォー、完全な外交交渉、厳格なJSONスキーマに従う必要のある信頼性という3つのストレス要因を導入しています。
[7806] AI auditing:エンタープライズAIに欠けているガバナンスレイヤー
AI監査は、AIシステムのライフサイクル全体を通じて、コンプライアンス、透明性、公平性、プライバシー、運用信頼性を検証するための構造化されたアプローチです。これは、可視的なアプリケーション層だけでなく、プロビナンス、バイアス、ログ記録、展開後の制御ドリフトなどの根本的な問題に対処する、エンタープライズAIの重要なガバナンスレイヤーとして機能します。