La medida responde a las exigencias de transparencia del Reglamento Europeo de Inteligencia Artificial y permitirá introducir una señal detectable mediante herramientas informáticas para identificar contenido producido por sus modelos.
El despliegue afectará a los usuarios elegibles de ChatGPT y Codex de todos los planes en la UE. Sin embargo, la compañía no aplicará inicialmente este sistema de forma predeterminada en el resto del mundo. En paralelo, los clientes de su API ya pueden activar voluntariamente la función en determinados modelos, aunque permanecerá deshabilitada por defecto.
OpenAI reconoce que la identificación de textos generados por inteligencia artificial continúa siendo un problema técnico sin resolver completamente. Por ello, ha optado por una implantación gradual y por restringir inicialmente el acceso a su herramienta de detección.
La tecnología desarrollada por OpenAI recibe el nombre de textGrain y funciona mediante la incorporación de una señal estadística invisible en las palabras que selecciona el modelo durante la generación de texto, dejando como resultado la habitual apariencia, pero con patrones específicos que pueden analizarse mediante detectores concretos.
Según explican desde OpenAI, textGrain ha igualado o superado en sus evaluaciones a otros mecanismos de identificación, incluido SynthID para texto. Además, OpenAI prevé publicar la tecnología como código abierto para facilitar su desarrollo.
Las pruebas también muestran diferencias importantes según la extensión y el tipo de contenido. Con una tasa objetivo de falsos positivos del 1%, el detector ha identificado aproximadamente el 80% de los textos de 200 tokens y el 95% de los de 400 tokens en contenidos de psicología. En cambio, los resultados son considerablemente inferiores en textos matemáticos, donde el modelo dispone de menos libertad para seleccionar palabras.
La principal limitación de textGrain está cuando el contenido original se modifica. Por ejemplo, en una evaluación con textos de 400 tokens, sustituir el 10% de las palabras por sinónimos ha reducido la detección del 92% al 66% y reemplazando el 25% del vocabulario, el porcentaje ha caído hasta el 17%, lo que muestra que una edición relativamente limitada puede debilitar considerablemente la señal estadística.
OpenAI también advierte que la ausencia de una marca detectable no demuestra que el contenido haya sido escrito por una persona. El texto podría haberse editado, traducido o generado mediante modelos anteriores que no incorporaban esta tecnología.
Asimismo, la marca no permite identificar al usuario, conocer sus instrucciones originales ni determinar quién posee los derechos sobre el contenido. Tampoco establece cuánto trabajo humano existe detrás de un texto ni verifica la exactitud de la información.
Por otro lado, aunque las marcas de agua llegarán a ChatGPT y Codex, OpenAI no permitirá inicialmente que cualquier persona utilice su detector puesto que el acceso quedará reservado a investigadores y organizaciones especializadas previamente autorizados, que podrán solicitar su utilización para evaluar la fiabilidad del sistema. La herramienta únicamente indicará si detecta una marca de OpenAI, sin revelar información sobre cuentas, conversaciones o instrucciones de los usuarios.