次回の更新記事:専門家の「聞く技術」をAIに移植するには、手本ではなく手順が必要【著者インタビュー掲載】(公開予定日:2026年08月03日)

【8月31日まで】個人情報マスキングツール「PII Mask」を全会員に開放中 / ローカルで動作、文書は外部に送信されません

ダウンロード →
AIDBは、AI活用のノウハウ獲得や技術動向の調査のために、個人やチームが論文を探す・読む・活かす作業をサポートするプラットフォームです。なお、記事や投稿は人の手で書いています。

LLMにおける事実性の評価&向上に役立つデータセットの作り方

2024.12.10
深堀り解説

LLMは、ハルシネーションと呼ばれる、事実に基づかない内容を生成してしまうという問題を抱えています。LLMはあたかも人間が書いたかのような流暢なテキストを生成するため、ユーザーがその内容を鵜呑みにしてしまう可能性があり、ハルシネーションは深刻な問題となっています。

これまでに行われてきた事実性評価研究では、生成されたテキストが、例えばニュース記事や書籍などのソース文書と一致しているかを検証していました。しかし、現実世界のように様々な種類のテキストが混在する状況には対応できていませんでした。また、検証に使うソース文書が常に存在するという前提にも無理があります。

有力なプロジェクトにはFEVER (Fact Extraction and VERification) があり、開発者らはWikipediaから抽出した文章を少し改変してデータセットを作りました。185,445件もの”事実に関する主張”を、それが正しいか、間違っているか、情報不足かを判断するためのものです。しかし、FEVERは個別の事実の真偽を判定することに特化しており、現実世界のテキストのように、複数の事実が複雑に絡み合った文章全体を評価するには不向きでした。

さらに、FACTORやFELMといった「LLM正しいテキストと間違ったテキストを自動生成する」フレームワークも考案されてきました。事実性評価のためのデータを作るためです。しかし生成されるデータセットは規模が小さく、十分ではありませんでした。

そこで、研究者たちは、現実世界の複雑なテキストを評価できる、より大規模で汎用的な、新しい事実性評価手法の開発に挑むことになりました。

本研究で示されている方法論を応用すると、独自のチャットボットを作成する際に「LLMが正しい答えを述べられるかどうかをチェックする」作業に役立つかもしれません。

研究のポイント

  1. 元の文章から細かい主張を抜き出し、それをほんの少し書き換えて間違った情報も作り出す方法論を考案した
  2. Wikipediaをもとに「幅広いトピックをカバーしている正しい文と間違った文のペア」を何万組も用意した大規模なデータセットを開発し、誰でも使えるようにした

以下で詳細を紹介します。

プレミアム会員限定コンテンツです

無料会員でもできること

  • 一部記事の閲覧
  • AI検索(公開記事が対象)
  • PDF翻訳・パーソナライズなど各機能のお試し利用

プレミアム会員の特典

  • 1,000本以上の全過去記事を無制限閲覧
  • 論文ベースの深掘り解説を毎日更新で購読
  • AI検索の対象が短信・論文(5万本以上)まで拡大
  • 記事で取り上げた論文にその場でAIに質問
  • 論文から生まれたエージェントスキルライブラリ
  • PDF翻訳・PDF変換をフル活用
  • あなた専用の論文・記事おすすめが毎日届く

記事検索

年/月/日
年/月/日

こちらもどうぞ