次回の更新記事:【論文著者インタビューあり】そのAIエージェントはどれくらい危ない恐れがあるのか、点数で決める方法(公開予定日:2026年07月30日)
AIDBは、AI活用のノウハウ獲得や技術動向の調査のために、個人やチームが論文を探す・読む・活かす作業をサポートするプラットフォームです。なお、記事や投稿は人の手で書いています。

LLMエージェントが実行可能なPythonコードを生成するフレームワーク『CodeAct』

2024.05.13
深堀り解説

通常のLLMエージェントは、テキストやJSONを用いてAPIツールを操作していますが、柔軟性に欠ける(タスクに制限があるなど)といった課題があります。そこで研究者らは、LLMエージェントが自身のアクションプランに合わせたPythonコードを生成するフレームワーク「CodeAct」を提案しています。コードの実行結果に基づいて動的に行動を修正したり、新たな行動を生成したりすることができます。

参照論文情報

  • タイトル:Executable Code Actions Elicit Better LLM Agents
  • 著者:Xingyao Wang, Yangyi Chen, Lifan Yuan, Yizhe Zhang, Yunzhu Li, Hao Peng, Heng Ji
  • 所属:University of Illinois Urbana-Champaign, Apple

背景

LLMは単なるテキスト処理を超えて、APIの呼び出しやロボット制御など、より実世界に近いタスクにも適用できるようになってきました。LLMをベースとしたエージェント(いわゆるLLMエージェント)は、ツールの呼び出しやメモリ管理などの機能を備えることで、科学実験の実行といった複雑な現実世界のタスクにも取り組めるようになってきています。

LLMエージェントがツールを使用する際には、通常、テキストやJSONの形式が用いられています。しかし、特定のタスクやツールのみしか使用できないなど、柔軟性に欠けるといった課題があります。一方で、LLMにコードを生成させてロボットやゲームキャラクターを制御する試みもなされてきましたが、事前に定義された制御コードやプロンプトへの依存が大きく、環境からのフィードバックに基づいて動的にアクションを調整・生成することが難しいという問題がありました。

そこで本研究では、PythonコードをLLMエージェントのアクションとして用いるCodeActという枠組みが提案されました。

また、17種類のLLMを用いた詳細な実験により、CodeActの有効性が示されました。単純なツール使用のタスクでは、CodeActはテキストやJSONと同等以上の性能を発揮しました。さらに、複数のツールの連携が必要な複雑なタスクを集めたベンチマークM3ToolEvalでは、CodeActがベースラインに比べて最大20%の精度向上を達成しつつ、必要なアクション数を30%削減できることが確認されました。このパフォーマンスの向上は、LLMの能力が高いほど顕著に表れました。

以下ではフレームワークを詳しく紹介します。

プレミアム会員限定コンテンツです

無料会員でもできること

  • 一部記事の閲覧
  • AI検索(公開記事が対象)
  • PDF翻訳・パーソナライズなど各機能のお試し利用

プレミアム会員の特典

  • 1,000本以上の全過去記事を無制限閲覧
  • 論文ベースの深掘り解説を毎日更新で購読
  • AI検索の対象が短信・論文(5万本以上)まで拡大
  • 記事で取り上げた論文にその場でAIに質問
  • 論文から生まれたエージェントスキルライブラリ
  • PDF翻訳・PDF変換をフル活用
  • あなた専用の論文・記事おすすめが毎日届く

記事検索

年/月/日
年/月/日

こちらもどうぞ