
サイバーセキュリティ研究者でレッドチームメンバーのグローバー氏は、現在の評価方法は最先端のAI機能に追いついていないと述べた。
「AIラボは数ステップ先まで考えることができるモデルを構築しているが、多くの評価環境では依然としてエージェントが意図したシナリオ内に留まることを前提としている」と彼女は付け加え、これが評価方法論のエラーを引き起こしていると指摘した。
さらに、グローバー氏は、ネットワークアクセスを制御するだけでなく、AIエージェントのインターネットアクセスをデフォルトで拒否することを推奨した。
注目すべきは、ほとんどのAIラボテストでは、エージェントが警告なしに意図したシナリオ内でタスクを完了することを前提としている点である。
テスト段階の知能(AI)エージェントには、データ呼び出しの制限があり、検出ツールが存在する。
研究者らは、評価環境は、想定される行動が「無断欠席」であると想定していると述べている(見かけ上のアルゴリズムは、期待される行動である可能性がある)。


コメント