AI Safety2026-07-31MIT Technology Review

LLMs tienen falla de seguridad imposible de arreglar

Un artículo innovador presentado en la Conferencia Internacional de Aprendizaje Automático (ICML) ha causado conmoción en la comunidad de seguridad de IA. Los investigadores sostienen que los modelos de lenguaje grandes (LLMs) poseen un defecto arquitectónico fundamental que los hace inherentemente vulnerables a ataques, independientemente de las salvaguardas aplicadas. El artículo demuestra sistemáticamente que los mismos mecanismos que permiten a los LLMs generar respuestas coherentes y contextualmente relevantes —como las capas de atención y la predicción de tokens— pueden ser explotados para eludir filtros de seguridad, extraer datos de entrenamiento o ejecutar instrucciones maliciosas. Los autores concluyen que lograr una seguridad total para los LLMs es teóricamente imposible, ya que cualquier medida defensiva puede ser eludida por un atacante con suficiente conocimiento de los internos del modelo. Esto desafía el enfoque predominante de parchear vulnerabilidades después del despliegue y sugiere que la industria podría necesitar repensar su dependencia de los LLMs para aplicaciones de alto riesgo. Los hallazgos tienen implicaciones inmediatas para la seguridad de la IA, particularmente en áreas como la generación automatizada de código, el asesoramiento financiero y los diagnósticos de salud. Si bien el artículo no propone una solución completa, pide un cambio de paradigma hacia el diseño de modelos con la seguridad como una restricción central, no como un añadido posterior. Para desarrolladores y responsables de políticas, esta investigación subraya la necesidad urgente de arquitecturas alternativas y monitoreo robusto en tiempo de ejecución.

Noticias relacionadas