AI出力の検証を任せるなら、ツールが見つけられないものを知っておく

※本ページは日本語訳です。英語の原文が正本となります。

行政機関、学校、オフィスでは今、ソフトウェアに文書の草案を作らせています。決定通知、見積書、報告書、契約の要約などです。通常、その出力はもう一度検証されます。多くの場合、別のプログラムを使い、最後に訓練を受けた担当者が確認します。この検証の仕組みを設ける人は、とても実務的な問いに直面します。実際に何を探すべきなのでしょうか。

測定の基礎となるのは、誤りを意図的に仕込んだドイツ語の行政文書や事務文書の集まりです。誤った合計や割合、誤った期限、架空の規則、同じ段落内で自ら示した数値と矛盾する文、そして情報の欠落があります。情報の欠落とは、元の資料にある内容が、検証対象の出力にはまったく現れなくなることです。この文書集には、誤りのない箇所や、全体に誤りのない課題も含まれています。それがあって初めて、プログラムが正しいものを誤って指摘する頻度を数えられます。意図的に難しくした同じ版を、低価格の言語モデル5つと、異なる4社が提供する現在の最上位モデル4つという2群に与えました。各プログラムにつき1回の実行です。

情報の欠落、つまり検証対象の出力にまったく現れない条件は、この比較で検証プログラム間の差が最も大きかった誤りの種類です。性能の高いプログラムはその大半を見つけ、性能の低いプログラムは繰り返し見落とします。性能の低いプログラムに見られるこの傾向には、名前があります。対照数値盲です。

合計の誤りは、遅くとも次の請求書で明らかになります。そもそも文書に書かれていなかった条件は、誰かがその履行を求めるまで、誰にも気づかれません。そして、使っているツールの内部でどのモデルが動いているかを、外から見て分かるオフィスはほとんどありません。画面は同じで、語り口も同じように自信に満ちています。

承認のたびに必ず問う2つのこと

  1. 元の資料にはあるのに、出力にはないものは何ですか。
  2. 機械による指摘のうち、実際には誤りでないものはどれですか。

各プログラムにつき1回の実行であり、個々のツールへの評価を下すためではなく、出発点として設計したものです。この問いについて、独立した、再現可能な比較の基準はまだありません。それを生み出すことを目指しています。

ページ一覧とデータJSON