AI Safety2026-09-17TechCrunch AI

Anthropic y OpenAI quieren evaluadores dentro de casa

Anthropic y OpenAI están explorando un enfoque nuevo para la seguridad de la IA: colocar evaluadores independientes dentro de sus propios laboratorios. La idea es dar a expertos externos acceso temprano a los modelos, a los procesos de entrenamiento y a las decisiones de despliegue, para detectar riesgos antes de que los productos lleguen al público. Los investigadores dicen que este nivel de acceso no tiene precedentes. Podría permitir que los evaluadores influyan en decisiones de diseño, prueben capacidades peligrosas y señalen problemas mientras arreglarlos todavía es barato. Sus defensores sostienen que la revisión interna puede detectar fallas más rápido que las auditorías externas que llegan después de que el modelo ya se lanzó. Pero los críticos advierten que los evaluadores embebidos pueden recibir presión para suavizar sus conclusiones. Si su financiamiento, su carrera o su acceso dependen de los laboratorios, ¿pueden realmente desafiar las prioridades comerciales? La independencia, la transparencia y líneas de reporte claras serían indispensables. También necesitarían poder publicar sus preocupaciones, escalar a los reguladores y retirarse sin represalias. El debate refleja una pregunta más amplia de gobernanza de IA: ¿puede funcionar la supervisión interna voluntaria en empresas que compiten por construir sistemas poderosos? Algunos expertos ven la revisión embebida como un paliativo útil, no como un reemplazo de la regulación. Quieren auditorías externas obligatorias, estándares de seguridad y responsabilidad legal. Otros creen que la colaboración estrecha entre laboratorios y evaluadores puede mejorar la cultura de seguridad y acelerar las protecciones. Por ahora, Anthropic y OpenAI han mostrado interés, pero los detalles siguen sin estar claros. La prueba clave será si los evaluadores embebidos obtienen poder real o si terminan siendo una capa de relaciones públicas. Si pueden cuestionar a los líderes, influir en los lanzamientos y divulgar riesgos, el modelo podría mejorar de forma significativa la rendición de cuentas. Si no, puede crear la ilusión de supervisión mientras las decisiones importantes siguen en manos de los laboratorios.

Noticias relacionadas