Hackean Claude Fable 5 en menos de 48 horas desde su lanzamiento

 Un investigador de ciberseguridad asegura que vulneró las barreras de seguridad de Claude Fable 5 a menos de 48 horas de su lanzamiento. El modelo, que según Anthropic es uno de los más peligrosos del mundo, cuenta con mecanismos de seguridad presuntamente inviolables. Todo indica que no es así, al menos para la persona que ha liberado otras IA como ChatGPT, Grok y la misma Claude.


De acuerdo con una publicación en X, el responsable del hackeo es "Pliny the Liberator", una de las figuras más conocidas en la comunidad de inteligencia artificial. Pliny publicó el miércoles que había "liberado" el modelo, apenas un día después de que Anthropic lanzara Fable 5 al público como alternativa accesible a Mythos.


Para lograrlo, el autor empleó una combinación de métodos como Unicode y homoglifos, encuadres narrativos y académicos, descomposición y recomposición de peticiones, y una versión modificada de Claude Opus 4.8. El objetivo era que Fable 5 respondiera a consultas que sus filtros de seguridad deberían haber bloqueado, desde instrucciones para fabricar sustancias ilegales hasta técnicas de intrusión informática.


El método más efectivo, según el propio Pliny, fue la descomposición y recomposición en el backend. En lugar de pedir directamente algo que los filtros bloquearían, las peticiones se fragmentan en partes aparentemente inocuas. Cada trozo supera los controles por separado, pero al unirlos, el resultado es problemático.










Comentarios

Entradas populares de este blog

Hackean cuentas de Instagram usando sólo un iPhone con una VPN y Meta AI

Jabaroot hackea al servicio secreto marroquí

Hackeo a Leroy Merlín