让工具复核AI输出,就应知道它查不出什么
此为中文翻译版本。学术引用请以英文原版为准。
公共机构、学校和办公室如今会让软件起草文本:决定文书、报价、报告、合同摘要。输出通常还会再检查一次,往往先由第二个程序检查,最后再由受过训练的审核员检查。安排这项复核的人面临一个很实际的问题:究竟应该查找什么?
测量以一组德语行政和办公文本为基础,其中人为植入了错误:错误的总额和百分比、错误的期限、虚构的规则、与同一段落中自身数字相矛盾的句子——还有缺失的信息:原始材料中存在的内容,在被检查的输出中却不再出现。这组文本还包含完全没有错误的段落和完整任务;只有这样,才能统计程序将正确内容误标为错误的次数。同一个刻意增加难度的版本交给了两类模型:五个低成本语言模型,以及来自四家不同提供商的四个当前顶尖模型。每个程序只运行一轮。
- 全部预设错误中的检出数:五个低成本模型为150处中的126处(84.0%)——四个顶尖模型为120处中的116处(96.7%)
- 三个最难位置的缺失信息检出数:15处中的4处(26.7%)——12处中的10处(83.3%)
- 每轮误报次数:平均八次——略少于三次
信息缺失——也就是在被检查的输出中根本没有出现的条件——是在这次比较中检查程序之间差异最大的一类错误:较强的程序能发现其中大部分,较弱的程序则经常漏掉。这种出现在较弱程序中的模式有一个名字:对照数字盲视。
总额算错,最迟到下一张账单时就会显现。从未写入文本的条件,却不会有人注意到——直到有人要求满足它。而从外部来看,几乎没有办公室能看出自己的工具内部运行的是哪一个模型。界面相同,语气也同样自信。
每次批准前都要问的两个固定问题
- 原始材料中有哪些内容没有出现在输出里?
- 机器标出的问题中,哪些根本不是错误?
每个程序只运行一轮,这项测量是一个起点,并非对个别工具的判定。针对这个问题,目前还没有独立、可复现的比较基准;这正是希望建立的。