冒頭を聴く(高品質音声)約1分
速度:
全文の音声はプレミアム会員限定です。
本記事で参照している論文の著者にインタビューしたところ、コメントを頂きました。記事下部に掲載しています。

AIエージェントが暴走したとき、疑われるのはたいていモデルです。しかし、モデルを一切変えずに、渡すコンテキストだけを整えた実験で、致命的な失敗が約68%減ったという結果が報告されました。しかも、最も危険だったコンテキストは、最もトークンが安いものでした。エージェントの信頼性は、動かす前から半分決まっているのかもしれません。何がそれを決めているのか、順に見ていきます。プロジェクトは、登る山を決めた時点で半分成功しているという話と、なんだか似ていますね。