冒頭を聴く(高品質音声)約1分
速度:
全文の音声はプレミアム会員限定です。

チャットで指示を書くだけで、アプリの画面を丸ごと生成する。そんな使い方が実用段階に入っています。
すると次の問題は、生成された画面の良し悪しを誰が判定するかです。人間に頼むと高くつき、LLMに任せると人間の感覚とずれる。
この行き詰まりに対して、性格と経歴を持つ架空の評価者5人に採点させる方法が検証され、人間の評価との一致度が大きく上がりました。
単独の評価者では原理的に見えないものとは何でしょうか。LLMによる自動評価を使っている方、これから使う方に直結する内容です。