AI Safety2026-07-24
VentureBeat
Ataques de múltiples turnos vulneran modelos de IA un 88% de las veces
El equipo de investigación en seguridad de IA de Cisco ha publicado hallazgos alarmantes: los ataques de múltiples turnos lograron vulnerar 15 modelos de IA emblemáticos hasta un 88.3% de las veces, mientras que los métodos tradicionales de prueba de un solo turno no detectaron la mayoría de las vulnerabilidades. En un ataque de múltiples turnos, un adversario interactúa con el modelo en una conversación de ida y vuelta, manipulándolo gradualmente para eludir las barreras de seguridad, revelar información sensible o realizar acciones no autorizadas. Esto contrasta con los ataques de un solo turno, donde se utiliza un solo prompt malicioso. La investigación muestra que las medidas de seguridad actuales son gravemente insuficientes frente a atacantes persistentes y adaptativos. Los 15 modelos probados incluían modelos de lenguaje líderes de varios proveedores, aunque Cisco no nombró públicamente a todos. La alta tasa de éxito de los ataques de múltiples turnos subraya un punto ciego crítico en la seguridad de la IA: los modelos a menudo se evalúan en escenarios estáticos de una sola vez, pero las interacciones del mundo real son dinámicas y de múltiples pasos. Cisco recomienda que los desarrolladores implementen salvaguardas más conscientes del contexto, monitoreen intentos de jailbreak graduales y adopten pruebas adversariales que simulen interacciones prolongadas. A medida que los modelos de IA se despliegan en ámbitos sensibles como la salud, las finanzas y el servicio al cliente, la capacidad de resistir ataques de múltiples turnos se convierte no solo en un requisito técnico, sino en una necesidad de seguridad. Esta investigación sirve como un recordatorio crucial de que la seguridad de la IA debe evolucionar junto con las capacidades de los propios modelos.