Si haces revisar los resultados de la IA, debes saber qué no detecta tu herramienta

Nota: Esta página es una traducción. La versión original en inglés es el documento de referencia.

Las administraciones públicas, las escuelas y las oficinas ya dejan que el software redacte sus textos: resoluciones, presupuestos, informes, resúmenes de contratos. Los resultados suelen revisarse de nuevo, a menudo con un segundo programa y, al final, por una persona formada para revisarlos. Quien organiza esa revisión se enfrenta a una pregunta muy práctica: ¿qué debería buscar exactamente?

La base es una colección de textos administrativos y de oficina en alemán con errores introducidos deliberadamente: sumas y porcentajes incorrectos, plazos erróneos, normas inventadas, frases que contradicen la cifra que ellas mismas presentan en el mismo párrafo — e información que falta: algo que figura en el material de origen y que sencillamente ya no aparece en el resultado revisado. La colección también contiene pasajes y tareas completas sin ningún error; solo así se puede contar cuántas veces un programa señala como incorrecto algo que es correcto. Se presentó la misma versión, deliberadamente difícil, a dos clases de modelos: cinco modelos de lenguaje económicos y cuatro modelos actuales de primer nivel de cuatro proveedores distintos. Una ejecución por programa.

La información que falta — condiciones que no aparecen en absoluto en el resultado revisado — es el tipo de error en el que más difieren los programas de revisión en esta comparación: los programas más potentes detectan la mayor parte, mientras que los menos potentes la pasan por alto con regularidad. El patrón de los programas menos potentes tiene un nombre: ceguera ante la cifra de contraste.

Una suma incorrecta se detecta, como muy tarde, en la siguiente factura. Una condición que nunca figuró en el texto pasa inadvertida para todos — hasta que alguien la exige. Y, desde fuera, casi ninguna oficina puede ver qué modelo funciona dentro de su herramienta. La interfaz es la misma y el tono transmite la misma seguridad.

Dos preguntas fijas para cada aprobación final

  1. ¿Qué hay en el material de origen que no aparece en el resultado?
  2. ¿Cuáles de las advertencias de la máquina no son errores en absoluto?

Una ejecución por programa, planteada como un comienzo y no como un veredicto sobre herramientas concretas. Todavía no existe una base de comparación independiente y reproducible para esta cuestión; eso es lo que se pretende crear.

Catálogo de páginas y datosJSON