Anthropic ha confirmado que todas las nuevas versiones de Claude ofrecidas a nivel mundial llevaran incorporada una marca de agua invisible capaz de detectar si un texto fue generado o modificado por el modelo, aun cuando se trate de una edicion menor sobre escritura humana.
La tecnica, denominada internamente Scarlet Letter, funciona insertando patrones estadisticos sutiles en la distribucion de tokens del texto generado. Si alguien copia y pega contenido producido por Claude, un detector externo puede identificar la firma even si el usuario solo uso el modelo para corregir una frase o reformular un parrafo.
La compania aclaro que las marcas no funcionaran en algunas plataformas o funciones que no las soporten. Para contenido no textual, Anthropic recurrio al estandar C2PA de metadatos, usado por la industria fotografica para certificar el origen de imagenes.
Facil de evadir, facil de malinterpretar
La aproximacion descrita por la Union Europea e implementada por Anthropic es, segun varios investigadores, demasiado facil de burlar para actores maliciosos, mientras podria castigar a usuarios legitimos que confian en el sistema para saber si un texto fue modificado. Un atacante podria traducir el contenido a otro idioma, parafrasearlo con otro modelo o simplemente insertar caracteres invisibles para eliminar la firma.
La iniciativa forma parte de un esfuerzo mas amplio por distinguir contenido humano del generado por inteligencia artificial en un momento en que la frontera entre ambos se vuelve cada vez mas difusa. La Comision Europea exige transparencia a los proveedores de modelos de IA bajo el Acta de IA europea, aunque la implementacion practica queda en gran medida a criterio de cada empresa.
El Chasqui
Comentarios (0)
Sé el primero en comentar.