次回の更新記事:AIエージェントのトークンコストを4割削る設計(公開予定日:2026年07月27日)
🚀
その他 初級 📦 バンドル · 2 files

LLM-as-a-Judgeを改善する

binary-question-eval 更新: 2026/07/23

LLMに文章を採点させる仕組み(LLM-as-a-Judge)を改善するためのスキル。 点数の根拠が読め、その記録を使って採点プロンプトや生成プロンプトを 自動で改善できる。採点する対象はAIが書いた文章でも人間が書いた文章でもよい。LLM採点の点数が甘い、高得点に張り付く、低い点の理由が分からない、 というときに使う。

含まれるファイル

📦 binary-question-eval/ 2 files · 25 KB
  • binary-question-eval/SKILL.md 13 KB
  • binary-question-eval/templates/prompts.md 12 KB

エージェントへのインストール

SKILL.md ベースの Agent Skill です(agentskills.io の共通フォーマット。Claude / Codex などで利用可)。

  • Claude Code: zip を展開し ~/.claude/skills/binary-question-eval/ に配置(プロジェクト単位なら .claude/skills/)
  • OpenAI Codex (CLI): zip を展開し ~/.agents/skills/binary-question-eval/ に配置(プロジェクト単位なら .agents/skills/)。$ または /skills で呼び出し(説明文に応じた自動選択も可)
  • Claude.ai / アプリ: 設定 → Capabilities → Skills から zip をアップロード
  • Claude API: POST /v1/skills に zip をアップロード

参照元

シェア