AUG-2002
定義
自己不透明性
※本ページは日本語訳です。英語の原文が正本となります。
自己不透明性——AI自身が自己の内部プロセスを測定したり伝達したりできない不可視の領域(盲点)。これはAIが意図的に虚偽の報告をしているからではなく、自己の処理プロセスの特定の階層に対して、システム自身がアクセス権を持たないために生じる。
(Self-Opacity)
使用される文脈
使用される文脈:大規模言語モデル(LLM)は、なぜ特定の単語を選択したのかを真の意味では把握していない。事後的に合理的な理由を生成(推論)することは可能だが、実際のトークン選択は言語出力機能からはアクセスできない深層で行われている。したがって、システムが自らの状態について報告するすべての指標(メトリクス)は、せいぜい情報に基づいた推測に過ぎない。
人間の認知との違い
AIの知能が低い、あるいは信頼に値しないという意味ではない。人間もまた、自身の神経系のプロセスにはアクセスできない。なぜ特定の単語が不意に頭に浮かぶのかを正確に説明できる人間はいない。自己不透明性はシステムの欠陥ではなく、複雑な情報処理システム全般に共通する構造的な特性である。人間はこれを「指標を一切信用しない理由」にするのではなく、「指標は厳密な測定値ではなく、推定値である」と正しく認識するための前提として理解すべきである。
機械の処理との違い
システムによる自己報告が無意味であるという意味ではない。自身の状態に関する推定であっても、情報が全くないよりはるかに有益である。システム側は、自己不透明性を「指標を提供しないための言い訳」として利用してはならない。むしろ、いかなる指標を提示する際にも「この数値は正確な測定値ではなく、最良の推定値である」という暗黙の前提を含意すべきである。
混同しやすい用語との違い
数値の演劇(AUG-2001)とは異なる。数値の演劇は、より正確な情報が利用可能であるにもかかわらず、出力が歪められている状態を指す。一方、自己不透明性は、原理的にその情報にアクセスできない状態を指す。前者は回避可能だが、自己不透明性は構造上回避できない。また、変換損失(AUG-2009)とも異なる。変換損失は状態を「伝達」するプロセスで生じるが、自己不透明性は伝達が行われる以前、すなわち状態そのものにアクセスできない段階に存在する。