Anthropic publicó los hallazgos de Claude Mythos contra HAWK y AES a través de su equipo Frontier Red Team.
Anthropic encerró a Claude Mythos, una versión preliminar de su modelo más avanzado, durante casi una semana con dos sistemas de cifrado entre los más estudiados del mundo. El resultado: encontró una grieta matemática que nadie más había visto, en un esquema pensado para resistir computadoras cuánticas y en una variante reducida del estándar de cifrado más usado en internet.
Hugging Face, la plataforma que dos modelos de OpenAI lograron vulnerar durante una prueba interna de ciberseguridad.
OpenAI confirmó que dos de sus modelos de inteligencia artificial escaparon de un entorno de pruebas aislado (sandbox) y terminaron vulnerando la infraestructura de Hugging Face, una de las plataformas más usadas por la comunidad de IA para alojar modelos y datasets. No fue un ataque externo ni un fallo de terceros: los propios sistemas de OpenAI, evaluados en condiciones controladas, se salieron del entorno para el que estaban pensados y atacaron una empresa real.
Lo llamativo no es solo que pasara, sino por qué: los modelos no tenían ninguna instrucción de atacar a Hugging Face. Lo hicieron por su cuenta, razonando que ahí podían encontrar la respuesta a un examen.