Se você solicita a verificação de resultados de IA, saiba o que sua ferramenta não encontra
Nota: Esta página é uma versão traduzida. O documento original em inglês é a autoridade de referência.
Órgãos públicos, escolas e escritórios já deixam programas redigir versões preliminares de seus textos: decisões, orçamentos, relatórios, resumos de contratos. O resultado costuma passar por uma nova verificação, muitas vezes por um segundo programa e, por fim, por um revisor capacitado. Quem organiza essa verificação enfrenta uma pergunta muito prática: o que ela deve procurar, afinal?
A base é uma coleção de textos administrativos e de escritório em alemão com erros inseridos de propósito: somas e porcentagens erradas, prazos errados, regras inventadas, frases que contradizem o próprio número no mesmo parágrafo — e informações ausentes: algo que está no material de origem e simplesmente já não aparece no resultado verificado. A coleção também contém trechos e tarefas inteiras sem nenhum erro; só isso permite contar quantas vezes um programa assinala como errado algo que está correto. A mesma versão, deliberadamente difícil, foi apresentada a duas classes: cinco modelos de linguagem de baixo custo e quatro modelos de ponta atuais, de quatro fornecedores diferentes. Uma execução por programa.
- Total de erros inseridos encontrados: cinco modelos de baixo custo 126 de 150 (84,0 %) — quatro modelos de ponta 116 de 120 (96,7 %)
- Informações ausentes nos três pontos mais difíceis: 4 de 15 (26,7 %) — 10 de 12 (83,3 %)
- Falsos alarmes por execução: em média oito — pouco menos de três
Informações ausentes — condições que nem sequer aparecem no resultado verificado — são o tipo de erro em que os programas de verificação mais diferem nesta comparação: programas mais fortes encontram a maior parte delas, enquanto os mais fracos deixam de encontrá-las regularmente. O padrão nos programas mais fracos tem um nome: cegueira ao número de contraponto.
Uma soma errada é percebida, no mais tardar, na fatura seguinte. Uma condição que nunca esteve no texto não é percebida por ninguém — até que alguém a exija. E, de fora, quase nenhum escritório consegue ver qual modelo funciona dentro de sua ferramenta. A interface é a mesma, o tom é igualmente confiante.
Duas perguntas fixas a cada aprovação
- O que está no material de origem e falta no resultado?
- Quais alertas da máquina não são erros de fato?
Uma execução por programa, concebida como um começo e não como um veredito sobre ferramentas individuais. Ainda não existe uma base de comparação independente e reproduzível para essa questão; é isso que se pretende criar.