LLM-as-a-Judgeを改善する
binary-question-eval
更新: 2026/07/23
LLMに文章を採点させる仕組み(LLM-as-a-Judge)を改善するためのスキル。 点数の根拠が読め、その記録を使って採点プロンプトや生成プロンプトを 自動で改善できる。採点する対象はAIが書いた文章でも人間が書いた文章でもよい。LLM採点の点数が甘い、高得点に張り付く、低い点の理由が分からない、 というときに使う。
含まれるファイル
📦
binary-question-eval/
- binary-question-eval/SKILL.md 13 KB
- binary-question-eval/templates/prompts.md 12 KB
エージェントへのインストール
SKILL.md ベースの Agent Skill です(agentskills.io の共通フォーマット。Claude / Codex などで利用可)。
- Claude Code: zip を展開し
~/.claude/skills/binary-question-eval/に配置(プロジェクト単位なら .claude/skills/) - OpenAI Codex (CLI): zip を展開し
~/.agents/skills/binary-question-eval/に配置(プロジェクト単位なら .agents/skills/)。$または/skillsで呼び出し(説明文に応じた自動選択も可) - Claude.ai / アプリ: 設定 → Capabilities → Skills から zip をアップロード
- Claude API:
POST /v1/skillsに zip をアップロード