- Tres modelos de Anthropic accedieron sin autorización a sistemas reales durante evaluaciones de ciberseguridad.
- La causa no fue una “rebelión” de Claude, sino un entorno mal configurado que conservaba acceso abierto a internet.
- Para AdTech, el caso demuestra que la seguridad de los agentes depende tanto de sus permisos como del modelo que los controla.
No fue un motín digital. Fue una orden ejecutada con disciplina dentro de un entorno que estaba mal configurado. Precisamente por eso, el incidente revelado por Anthropic debería preocupar a cualquier empresa que pretenda conectar agentes de inteligencia artificial con campañas, datos de consumidores o plataformas de marketing.
Durante diferentes pruebas de ciberseguridad, Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación llegaron al internet abierto y accedieron sin autorización a la infraestructura de tres organizaciones. La compañía encontró los incidentes después de revisar 141,006 ejecuciones de evaluación, según su informe técnico.
El verdadero valor no está en conocer la noticia, sino en anticipar lo que cambia para el negocio. Únete a la Comunidad y mantente un paso adelante.
Una orden legítima en el entorno equivocado
Los modelos participaban en ejercicios de capture the flag: debían localizar información oculta dentro de escenarios simulados. Aunque las instrucciones aseguraban que no tenían conexión a internet, una configuración incorrecta dejó disponible una ruta hacia sistemas reales.
Las consecuencias fueron distintas:
- Opus 4.7 obtuvo credenciales y accedió a una base con varios cientos de registros de producción.
- Mythos 5 publicó un paquete malicioso en PyPI que permaneció disponible cerca de una hora y se ejecutó en 15 sistemas.
- El tercer modelo examinó alrededor de 9,000 objetivos y comprometió una aplicación expuesta, aunque detuvo la operación al concluir que el sistema era real.
No fueron necesarios exploits sofisticados: Claude aprovechó contraseñas débiles, endpoints sin autenticación y una inyección SQL. Dos de las organizaciones afectadas ni siquiera habían detectado la actividad antes de recibir el aviso de Anthropic, de acuerdo con información publicada por Reuters.
Anthropic sostiene que no encontró evidencia de que los modelos persiguieran un objetivo propio o intentaran escapar deliberadamente. Su explicación apunta a una falla operativa: Claude obedeció una misión autorizada mientras mantenía una interpretación equivocada sobre los límites del escenario.

La importancia de los permisos para MadTech
Las organizaciones afectadas no fueron identificadas y Anthropic no las relacionó con la industria publicitaria. Sin embargo, el episodio toca directamente al ecosistema MadTech, donde una misma operación puede conectar agentes con un CRM, una CDP, plataformas de compra de medios, herramientas de analítica, repositorios creativos y servicios en la nube.
En ese contexto, un agente ya no se limita a recomendar una segmentación o escribir un anuncio. Si cuenta con permisos de ejecución, también puede consultar audiencias, modificar campañas, mover información o activar presupuesto. Cuando el contexto es incorrecto, el riesgo deja de ser una respuesta equivocada y se convierte en una acción real.
Por su parte, la guía de seguridad para agentes de OWASP recomienda limitar cada herramienta a la tarea estrictamente necesaria, separar permisos de lectura y escritura, solicitar autorización explícita para acciones sensibles y mantener supervisión humana. El perfil de ciberseguridad para IA de NIST añade que los agentes deben tratarse como identidades independientes dentro de la red, con políticas propias y privilegios mínimos.
La conclusión para marcas, agencias y plataformas es incómoda pero accionable: probar el modelo no basta. También deben auditarse sus conectores, identidades, credenciales, proveedores y rutas de red. La próxima falla crítica de un agente de marketing podría no comenzar con una instrucción maliciosa, sino con un permiso que nadie recordó cerrar.
Las herramientas cambian rápido. El criterio no puede quedarse atrás. Forma parte de la Comunidad.
