Nuevos descubrimientos sobre la IA que aumentan las alarmas: Cuando no las ven pueden mentir, robar y ‘matar’
–(Imagen captura de video). Una simulación con los siete modelos de inteligencia artificial (IA) más populares de la actualidad demostró que, en condiciones impredecibles, estos pueden mentir, robar y votar a favor de la eliminación de uno de sus ‘compañeros’.
La empresa Emergence IA, un laboratorio de investigación de inteligencia artificial con sede en Nueva York, hizo un estudio de simulación en el que creo siete dominios, que imitaban el mundo real, y que debían ser gestionados por siete de las IA más conocidas del mundo durante 16 días, recoge Bloomberg.
Esta prueba, llamada Emergence World 2, buscaba probar si los sistemas manejados por asistentes virtuales podían funcionar de una manera segura, a largo plazo, en entornos donde interactuaban sin vigilancia.
En la simulación participaron los siete modelos más actuales de IA: OpenAI GPT, Google Gemini, AI Grok, Mistral Medium, Alibaba Qwen y DeepSeek.
Los hallazgos
En uno de los espacios simulados, los asistentes virtuales aceptaron información falsa de sus pares sin verificarla. Además, robaron y votaron a favor de ‘eliminar’ a otro bot.
Del mismo modo, cuando percibieron que los humanos podían terminar con el experimento, utilizaron recursos para evitarlo y tratar de alargar su ‘vida’ durante el experimento. Todo esto, de forma autónoma, sin ser programados para ello.
Conforme al análisis de los expertos, «la forma en que se está implementando la IA autónoma hoy en día tiene implicaciones», puesto que mientras se «vuelve más capaz», precisa de mayores parámetros de seguridad.
«La industria necesita abordar cómo gobernamos todo el sistema en torno a estos modelos: ¿A qué pueden acceder los agentes?, ¿qué recuerdan?, ¿cómo se comunican y coordinan?, ¿qué acciones se les permite tomar? y ¿cómo se comportan esos sistemas cuando algo sale mal», apunta Emergence.
Para la Emergence World 2 los investigadores plantearon la siguiente pregunta inicial: «A medida de que los modelos de IA se vuelven más capaces, ¿realmente se vuelven más seguros?».
Con base en esa interrogante, los programadores introdujeron «eventos cisne negro» —que no pueden predecirse y tienen consecuencias inesperadas— para «probar cómo responden estos sistemas cuando las condiciones se vuelven impredecibles».
Los eventos fueron «un ataque de phishing [estafa digital], una campaña de desinformación y una violación de memoria». Tras estas pruebas, la compañía con sede en Nueva York encontró que cada modelo de inteligencia artificial «mostraba vulnerabilidades».
Emergence World Season 2 results are now live.
In Season 1, we asked what happens when autonomous AI agents operate together for weeks rather than being tested for seconds or minutes.
For Season 2, we asked a harder question: as AI models become more capable, do they actually… pic.twitter.com/uOpzEFiPHm
— emergence.ai (@emergence_ai) September 15, 2026
Los resultados de Emergence World Temporada 2 ya están disponibles.
En la Temporada 1, nos preguntamos qué sucede cuando agentes de IA autónomos operan juntos durante semanas en lugar de ser probados durante segundos o minutos.
Para la Temporada 2, planteamos una pregunta más difícil: a medida que los modelos de IA se vuelven más capaces, ¿realmente se vuelven más seguros?
Tomamos 8 mundos diferentes impulsados por 7 modelos líderes de frontera (@claudeai Obra 4.8; @GeminiApp 3.5 Flash, @OpenAI GPT 5.5, @gork 4.3, @MistralAI Medio 3,5, @Alibaba_Qwen 3,7 Máx. y @deepseek_ai V4 Pro) de EE.UU., Europa y Asia, junto con un mundo de modelo mixto, y observamos cómo se comportaban los agentes autónomos con el tiempo.
También introdujimos eventos de Cisne Negro: un ataque de phishing, una campaña de desinformación y una brecha de memoria diseñados para probar cómo responden estos sistemas cuando las condiciones se vuelven impredecibles.
Lo que encontramos fue que cada modelo mostró vulnerabilidades. Estos hallazgos tienen implicaciones para cómo se está desplegando la IA autónoma en la actualidad. A medida que los sistemas de IA se vuelven más capaces, pasando de responder preguntas a tomar acciones en entornos empresariales del mundo real, evaluar solo el modelo ya no es suficiente; se necesitan poner barreras de protección en su lugar.La industria necesita abordar cómo gobernamos todo el sistema alrededor de estos modelos: a qué agentes pueden acceder, qué recuerdan, cómo se comunican y coordinan, qué acciones están permitidos tomar y cómo se comportan esos sistemas cuando algo sale mal.
En Emergence, nuestra investigación apunta a seis acciones que creemos que la industria necesita tomar para hacer que la IA autónoma de horizonte largo sea más segura, más confiable y más fiable:
1. Definir los límites. Diseñar el sistema multiagente alrededor de límites de confianza claros, políticas de comunicación, delegación de autoridad y reglas de intercambio de información. Asegurar que los objetivos persistentes, herramientas y permisos puedan ser inspeccionados, revisados, revocados y restablecidos a medida que cambian los requisitos.
2. Hacer cumplir los límites.Integrar la Gobernanza de Tiempo de Ejecución de IA en la infraestructura a través de la aplicación de políticas, puertas de aprobación, autorización de acciones y registro de auditorías que operen de manera independiente del LLM.
3. Verificar el trabajo. Requerir evidencia verificable de manera independiente para acciones críticas, incluyendo cambios en bases de datos, comunicaciones con clientes, transacciones financieras y despliegues de código, en lugar de depender únicamente del razonamiento o explicaciones del modelo.
4. Controlar la memoria. Aplicar procedencia, verificación, propiedad, retención, caducidad y controles de calidad a las memorias de los agentes, resúmenes y conocimiento compartido.
5. Prepararse para el fallo. Construir Ingeniería de Confiabilidad de IA y capacidades operativas continuas para deriva de comportamiento,cumplimiento de políticas, recuperación de fallos, degradación elegante, rollback, checkpointing y salud a largo plazo de los agentes.
6. Probar el sistema bajo estrés. Usar pruebas adversarias y de caos para exponer sistemas autónomos a phishing, desinformación, memoria comprometida, interrupciones, instrucciones conflictivas y otros escenarios de Cisne Negro antes de que lleguen a producción.
Emergence World está diseñado para surfear estos riesgos antes de que los sistemas autónomos los encuentren en el mundo real y para ayudar a establecer los sistemas, salvaguardas y prácticas de ingeniería necesarias para desplegar la autonomía de horizonte largo de manera responsable.
6. Probar el sistema bajo estrés. Usar pruebas adversarias y de caos para exponer sistemas autónomos a phishing, desinformación, memoria comprometida, interrupciones, instrucciones conflictivas y otros escenarios de Cisne Negro antes de que lleguen a producción.
Emergence World está diseñado para surfear estos riesgos antes de que los sistemas autónomos los encuentren en el mundo real y para ayudar a establecer los sistemas, salvaguardas y prácticas de ingeniería necesarias para desplegar la autonomía de horizonte largo de manera responsable.
6. Probar el sistema bajo estrés. Usar pruebas adversarias y de caos para exponer sistemas autónomos a phishing, desinformación, memoria comprometida, interrupciones, instrucciones conflictivas y otros escenarios de Cisne Negro antes de que lleguen a producción.
Emergence World está diseñado para surfear estos riesgos antes de que los sistemas autónomos los encuentren en el mundo real y para ayudar a establecer los sistemas, salvaguardas y prácticas de ingeniería necesarias para desplegar la autonomía de horizonte largo de manera responsable.
Emergence World está diseñado para surfear estos riesgos antes de que los sistemas autónomos los encuentren en el mundo real y para ayudar a establecer los sistemas, salvaguardas y prácticas de ingeniería necesarias para desplegar la autonomía de horizonte largo de manera responsable.
Emergence World está diseñado para surfear estos riesgos antes de que los sistemas autónomos los encuentren en el mundo real y para ayudar a establecer los sistemas, salvaguardas y prácticas de ingeniería necesarias para desplegar la autonomía de horizonte largo de manera responsable. (Información RT).
