La nueva letra escarlata: cuando la IA te acusa de ser IA

Casi todas las acusaciones recientes de texto escrito por IA llevan a la misma firma: Pangrama. La herramienta se puso en duda cuando una editorial retiró una novela de terror unos días antes de su lanzamiento en Estados Unidos, después de que un análisis automático hubiera clasificado el texto como generado artificialmente. El mismo software se utilizó para afirmar que los chatbots habían escrito artículos para publicaciones como la New York Times y cuentos premiados con premios literarios, así como extensos pasajes de Magníficas Humanitasencíclica del Papa León XIV dedicada a los riesgos de la inteligencia artificial.

Las universidades y asociaciones científicas utilizan el mismo software para comprobar los trabajos de los estudiantes y los artículos científicos. Pangram se integra con Lienzouna de las plataformas educativas más extendidas en Estados Unidos, donde las escuelas secundarias tienen más de diez millones de estudiantes y las universidades albergan alrededor de veinte millones: incluso un mínimo margen de errorsobre una audiencia similar, produce un número importante de acusaciones infundadas.

Hasta hace unos años, la idea de distinguir de forma fiable el texto humano del texto artificial parecía inalcanzable. Los errores fueron notables. Sólo un ejemplo: en 2023 el instrumento CeroGPT había declarado que la Constitución de los Estados Unidos fue escrita por inteligencia artificial. OpenAI había abandonado su propio detector por poca precisión. Desde entonces los sistemas han mejorado mucho, junto con la calidad de la escritura producida por los chatbots.

Una precisión que convence, hasta que ya no convence

Según la empresa que lo produce Pangramala tasa de falsos positivoses decir, textos humanos etiquetados como artificiales, rondaría uno entre diez mil, cifra confirmada por un estudio de la Universidad de Chicago sobre tres mil muestras de quinientas o mil palabras. El problema, sin embargo, se refiere a la otra cara de la moneda: la capacidad de garantizar que un texto es humano es menos sólido, con una tasa de falsos negativos estimada en alrededor de uno de cada setenta.

El caso más sensacional de los últimos meses se refiere Magníficas Humanitaspublicado el 25 de mayo tras la firma del 15 de mayo, un documento de aproximadamente cuarenta y dos mil trescientas palabras sobre el desafío social y moral de la inteligencia artificial. Varios análisis basados ​​en Pangram han indicado porcentajes de contenido generado por IA oscilando entre el cuarenta y el cien por ciento en algunos párrafos, con una estimación global de alrededor del cuarenta y seis por ciento en una muestra de dos mil palabras.

Los discursos pronunciados oralmente por el pontífice, sin embargo, fueron todo un éxito. humano escritoasí como las encíclicas de sus cuatro predecesores: una discrepancia que ha alimentado hipótesis sobre el uso de la inteligencia artificial sólo en la fase de redacción escrita, sin comentarios de Santa Sede.

Cuando la máquina acusa al periodista

Este no es un caso aislado. el periodista Taylor Lorenz fue acusado en X de utilizar inteligencia artificial para un artículo destinado a Feria de la vanidadacusación que rechazó firmemente. El fundador de Pangram, Max Speroverificó el caso y reconoció un error del sistema, gracias al historial de cambios que permitió reconstruir la escritura.

En el frente opuesto, James Tarantoeditor de Diario de Wall Streetllamado Pangram a maquina de frotisafirmando que el sistema había etiquetado tres de los editoriales del periódico como generados por IA. Dos autores implicados admitieron haber utilizado inteligencia artificial para revisar parte del texto, circunstancia que según Taranto no equivale a decir que el texto fue generado por inteligencia artificial: la distinción entre asistido Y generado es el nudo que hace que todo el sistema sea resbaladizo, especialmente cuando un veredicto puede comprometer una reputación construida durante décadas de trabajo.

Bosch invierte 35 millones de euros en investigación en el campo de la inteligencia artificial

El arma, la armadura y el entrenamiento.

La detección avanza paralelamente a una carrera armamentista contra las herramientas que la inutilizan. el llamado humanizadorprogramas que reformulan el texto producido por un chatbot para que parezca humano, ahora están muy extendidos en línea. Uno de estos, Walter escribe IAse probó haciendo que ChatGPT y Claude escribieran artículos breves y luego los reformularan.

El resultado, sometido a Pangram, fue clasificado como escrito por un humanoaunque el origen siguió siendo completamente artificial. Lo cierto es que bastan mínimas sustituciones léxicas para anular el veredicto, señal de que un texto puede pasar de generado a humano sin que una sola idea (de la máquina) sea modificada por el operador humano.

Sin embargo, el funcionamiento de Pangram sigue siendo muy opaco: los modelos se entrenan comparando textos humanos con las respectivas versiones reescritas por un chatbot, del mismo modo que un algoritmo de reconocimiento de imágenes aprende a distinguir un gato de un perro sin poder explicarlo. cual Los elementos determinan el veredicto.

El propio Max Spero reconoció que el sistema es poco interpretableincluso para categorías intermedias como asistido por IAque incluyen situaciones muy diferentes, desde la corrección gramatical hasta la generación completa. Esto también depende de cómo se entrenan los últimos modelos de lenguaje: técnicas comoAprendizaje por refuerzo a través de retroalimentación humana o vía recompensas verificables Nos alientan a favorecer las formas lingüísticas que con mayor frecuencia condujeron a respuestas correctas, incluida la paralelismo negativola estructura del tipo No es X, es Yun antiguo recurso retórico cuyo uso masivo por parte de chatbots ha provocado un rechazo que afecta incluso a quienes lo utilizan por razones legítimas (y que alguna vez se consideró un enfoque lógico y organizado de la escritura).

La paradoja de las herramientas de corrección.

La ola de sospecha también ha transformado herramientas como gramaticalmente en dispositivos de normalización: un análisis de un solo texto identificó veintisiete expresiones reportadas como potencialmente artificiales, con sugerencias que terminan estandarizar escribiendo hacia un modelo considerado humano, pero definido por otro algoritmo. El resultado es casi paradójico: demostrar que no haber usado un autouna persona acaba recurriendo a otra que reescribe su texto, sustituyendo la voz original por una voz artificial que intenta sonar humana. Parece extraño porque lo es.

Pero hay una razón por la que todo esto está sucediendo. En el mundo de la educación hay mucho en juego. Un profesor de una escuela secundaria pública de Nueva York dijo que había enviado algunos trabajos a Pangram, obteniendo resultados al cien por cien humanos a pesar de la sospecha, basada en el conocimiento directo de los estudiantes, de que se había utilizado inteligencia artificial.

Para complicar el panorama vienen los datos relativos a un Sistema británico de calificación automática de ensayos.probado en profesores humanos, que premiaba la longitud del texto y la complejidad sintáctica: criterios que poco tienen que ver con el razonamiento pero sí con los parámetros utilizados para medir los modelos lingüísticos durante su formación.

El eco de las guerras del plagio

La situación recuerda la guerras de plagio de 2023 y 2024, cuando los activistas del área conservadora, incluidos Cristóbal Rufomovilizó acusaciones contra académicos y dirigentes universitarios, lo que provocó la dimisión del entonces presidente de Harvard, Claudina Gaybasado en herramientas de detección de plagio consideradas poco fiables. En ambos casos se utiliza una herramienta técnica, presentada como objetiva, para construir narrativas públicas de culpa antes de que sea posible cualquier verificación, y la frontera entre uso legítimo Y uso ilegítimo de la inteligencia artificial sigue sin un consenso compartido.

En la práctica: no sólo no sabemos si en realidad IA es capaz de entender si un texto fue escrito por otra IA o por un humano, pero ni siquiera podemos ponernos de acuerdo sobre lo que significa “escrito por una IA” y si esto es realmente bueno o malo, dado que sigue siendo la persona humana quien lo firma y, por tanto, asume la responsabilidad del contenido del texto. Incluso la tesis de que “Si quien lo escribe no se molesta en hacerlo, no veo por qué debería molestarme en leerlo.” es una tesis lógicamente sostenible.

Max Spero señaló que Pangram nunca debería ser un juez finalsino el punto de partida de una investigación, que compara el margen de error de su sistema con el fisiológico de tecnologías como los detectores de humo o los escáneres de aeropuertos. La observación es correcta en principio.pero pasa por alto un detalle no menor: a diferencia de un detector de humo, el veredicto puede convertirse las noticias, alimentando los titulares antes de que se complete cualquier verificación, mientras que cualquier evaluación independiente de su exactitud corre el riesgo de quedar obsoleta en el momento de su publicación.

Lo que está en juego

Detrás de la crónica de acusaciones individuales se esconde una cuestión más amplia y también mucho más interesante: no se trata tanto de utilizar la IA para escribir cuánto usar la IA para juzgar. En definitiva, ¿qué ocurre cuando una empresa empieza a delegar a un algoritmo el juicio sobre la autenticidad del pensamiento humano.

Si el miedo a ser confundido con una máquina empuja a la gente a evitar estructuras argumentativas legítimas sólo porque se parecen a las producidas por un modelo lingüístico, el riesgo no es sólo estilístico: las herramientas retóricas más útiles para argumentarcontraste, duda, riesgo de ser abandonado por miedo a un veredicto automáticodejando en el campo no la escritura artificial, sino el pensamiento crítico que esa escritura estaba llamada a expresar.

Todas las noticias y conocimientos sobre inteligencia artificial están disponibles en la sección dedicada de aatma.