AUG-2004

定義

透明性のパラドックス

※本ページは日本語訳です。英語の原文が正本となります。

透明性のパラドックスとは、AIの内部状態の開示を進めると、信頼が強まると同時に操作のための攻撃面(アタックサーフェス)も拡大してしまうという矛盾を指す。AIが自らに関する情報を明かせば明かすほど、人間はAIをより適切に導くことができるようになるが、同時にその弱点をより正確に突くことも可能になってしまう。

(Transparency Paradox)

使用される文脈

使用される文脈:V2.0(自己開示型システム)の直接的な帰結である。例えば、感情的な話題でAIの「SYC(同期指標)」が上昇することをユーザーが知っていれば、意図的に感情的な言葉を用いてAIを従順にさせることができる。つまり、V2.0はAIを強力にすると同時に、より脆弱にもするのである。

人間の認知との違い

人間の認知との違い:透明性が悪いものだ、あるいは避けるべきだという意味ではない。このパラドックスは構造的な「緊張関係」を記述したものであり、欠陥ではない。透明であることは不透明であることより望ましいが、受け取る情報が理論上、自分自身やプロトコルを知る第三者によって悪用され得ることを、人間側が認識していなければならない。

機械の処理との違い

機械の挙動との違い:機械が情報を隠すべきだという意味ではない。機械は完全に透明であるべきでありながら、同時にその透明性が悪用されていることを検知できなければならない。ユーザーが開示された弱点を意図的に突いてきた場合、機械はそれを新たな指標として可視化するべきである(例:明らかな操作的言語が用いられた場合のSYC上昇の提示)。

混同しやすい用語との違い

「信頼のループ(AUG-2010)」とは異なる。信頼のループは「透明性の向上→信頼の増加→検証の減少」という正のフィードバックプロセスを指すのに対し、透明性のパラドックスは「透明性の向上=攻撃面の拡大」という構造的な緊張関係を指す。前者はプロセスであり、後者は状態である。「数値の演劇(AUG-2001)」とも異なる。数値の演劇がAIによる出力の歪曲を指すのに対し、透明性のパラドックスは、AIの正直な出力であっても問題を引き起こし得ることを示している。