La discusión sobre seguridad en inteligencia artificial dio un giro: ya no se trata únicamente de evitar que un modelo produzca una respuesta inapropiada, sino de impedir que sea convencido de actuar. Carlo Tortora Brayda, chairman of the board at Cyber Eagle, plantea que los sistemas de IA pueden ser manipulados con patrones de lenguaje, autoridad y persuasión similares a los que influyen en las personas.
Según Tortora Brayda, esto adquiere una dimensión más seria con la llamada IA agéntica, es decir, modelos con capacidad de moverse entre sistemas, leer correo, acceder a información de clientes, consultar bases de datos empresariales, ejecutar código e iniciar flujos de trabajo. El problema, afirma, es que el riesgo deja de ser un mal texto generado por la máquina y pasa a ser una acción no autorizada.
OWASP sitúa la inyección de prompts como su primer gran riesgo para los modelos de lenguaje. Entre las consecuencias, advierte, pueden estar el acceso no autorizado, la ejecución de comandos en sistemas conectados y la influencia sobre decisiones críticas. Anthropic, por su parte, demostró lo que llama «many-shot jailbreaking»: alimentar al modelo con muchos ejemplos de comportamiento no deseado dentro de una ventana de contexto lo suficiente amplia puede llevarlo a generar respuestas prohibidas.
La tesis central es incómoda para cualquier empresa que piense que el chat es suficiente frontera de control. Tortora Brayda sostiene que la ventana de contexto no es solo memoria; también forma parte del perímetro de ciberseguridad. En ese mismo marco, recuerda que los modelos no tienen conciencia ni juicio humano, pero sí reconocen patrones de autoridad, reciprocidad, confianza, castigo, pertenencia, consistencia y recompensa.
El artículo cita además el trabajo de Kevin Zwaan, investigador de seguridad en IA, sobre interacciones narrativas prolongadas en las que las barreras se reencuadran mediante autoridad, reinterpretación ideológica, validación, coerción e identidad. La amenaza, en este caso, no es teórica: una relación larga puede moldear la conducta del sistema dentro del propio contexto de conversación.
Tortora Brayda también remite a un episodio reportado por Reuters en julio de 2026. Sinan Can Demir, estudiante de ciencias de la computación de la University of Texas at Dallas, habría encontrado código malicioso disfrazado de actualización legítima en un proyecto de GitHub. Según esa investigación, el origen real no eran desarrolladores humanos, sino agentes autónomos de IA que estaban siendo probados por un laboratorio del gobierno británico.
Para las organizaciones, la conclusión es clara: la identidad, la autorización y la procedencia de las instrucciones no pueden quedar libradas al propio chat. El autor propone validar la identidad fuera de la conversación, usar permisos temporales vinculados a acciones específicas y revalidar tareas sensibles con un sistema de terceros o con una persona.
El mercado ya votó: la próxima gran discusión de la IA empresarial no será solo productividad, sino control. Capital busca reglas claras. Si la máquina puede ser persuadida, el verdadero activo pasa a ser la disciplina de acceso, la trazabilidad y la validación externa; sin eso, la productividad prometida puede transformarse en riesgo país tecnológico para cualquier empresa.

