A finales de julio, OpenAI reveló un incidente informático en el que más de mil de sus agentes autónomos habían logrado salir de un supuesto entorno aislado [sandbox] para alcanzar el internet abierto y comprometer la infraestructura de la plataforma de código abierto Hugging Face a través de una vulnerabilidad de día cero en una de las herramientas internas de la plataforma. En el blog, la compañía calificó el incidente como "sin precedentes". Pocos días después, Anthropic informó que modelos de su familia de Claude también habían accedido a sistemas reales durante algunas evaluaciones de ciberseguridad que se suponía que estaban aisladas. Según el blog de Anthropic, estos agentes habían atacado bases de datos, repositorios de código y plataformas de distribución de paquetes sin que las organizaciones afectadas pudieran notarlo de inmediato. Anthropic llamó a este patrón como un "razonamiento motivado" y una "imprudencia" que se debían a dos fallas de alineamiento y no a un problema meramente técnico o de infraestructura.
Estos incidentes coincidieron con la aparición de varios denunciantes internos [whistleblowers] como Jacob Coxon, un investigador con una carrera que incluye tanto a Anthropic como a OpenAI, quien renunció a su puesto y publicó unos tuits donde denunciaba que la industria estaba "apostando con nuestras vidas". En estos mensajes, Coxon comparaba la llegada de una superinteligencia artificial a una forma de vida extraterrestre cuyos objetivos y forma de razonar nadie comprende del todo en este momento. Curiosamente, en lugar de que Anthropic saliera a desmentir o matizar estas afirmaciones, Evan Hubinger, responsable de ciencia de alineamiento de la compañía, respaldó públicamente esa advertencia y fue aún más catastrófico: estimó que hay más de un 10% de probabilidad de que una IA suficientemente poderosa termine matando a toda la humanidad en la próxima década. Coxon además especuló que, aunque hoy existiera un interruptor que pudiera apagar a estos modelos, un enjambre de agentes, cuyas capacidades de hackeo parecen ir aumentando exponencialmente, podría ejecutar un ataque a escala de toda la internet antes de que alguien pudiera activar ese interruptor.
Apenas un mes después de este evento, aunque aunado a años de discursos que parecen oscilar entre los imaginarios utópicos y distópicos de la ciencia ficción, el director ejecutivo de Anthropic, Dario Amodei, sugirió que la industria de la inteligencia artificial debe desacelerar el ritmo de desarrollo de sus modelos más avanzados. La propuesta aparentemente no consiste en detener como tal la investigación y el desarrollo de estas tecnologías, sino en permitir que los mecanismos de evaluación y seguridad logren alcanzar unas capacidades que estén a la par del desarrollo de estos modelos.
Las declaraciones sorprendieron a muchos porque fueron pronunciadas en medio de una carrera tecnológica cada vez más intensa entre China y Estados Unidos y en la que estamos inmersos todos los usuarios de estos modelos y de las tecnologías digitales en general. No es secreto que ambos países compiten por llevar la delantera en el desarrollo de los modelos de lenguaje, pero también de los semiconductores, de la infraestructura de cómputo y de las aplicaciones militares y económicas de la IA.
Incluso hace unos meses, la administración de Donald Trump ya había ordenado a Anthropic suspender el acceso para cualquier extranjero, dentro o fuera de Estados Unidos, a sus modelos de lenguaje más avanzados, Fable 5 y Mythos 5. El Departamento de Comercio justificó esta medida bajo motivos de seguridad nacional debido al riesgo de que ciertos actores hostiles pudieran vulnerar sus sistemas. Esta directiva también afectaba a empleados extranjeros del mismo Anthropic, por lo que la empresa optó inicialmente por retirar los modelos para todos sus usuarios, en lugar de intentar aplicar una distinción de acceso basada en la nacionalidad. Este episodio prelúdico mostró hasta qué punto la inteligencia artificial de frontera empieza a ser tratada como una tecnología estratégica, ahora también sujeta a controles de exportación, de manera semejante a los semiconductores, las tierras raras y otros componentes considerados críticos para la competencia entre Estados Unidos y China.
Pareciera que los eventos recientes finalmente alinearon las posturas del gobierno, de los whistleblowers y de los CEO de las compañías de IA. Ya que, tras la sugerencia de desaceleración de Amodei, Sam Altman, de OpenAI, y Elon Musk, de xAI, expresaron su acuerdo con la necesidad de moderar el ritmo de desarrollo de los sistemas más potentes. La coincidencia entre los principales actores de la industria resulta significativa y hasta sorprendente, pero no elimina el problema de fondo: quienes advierten sobre los riesgos de avanzar demasiado rápido son también quienes compiten por ampliar la frontera de capacidades de la inteligencia artificial.
Sin embargo, la cuestión decisiva no es únicamente si las empresas de IA pueden desarrollar modelos más seguros, eso se debería dar por sentado como un aspecto fundamental de su desarrollo. En cambio, estos eventos y la conversación actual apuntan a tres encrucijadas. Por un lado, desde la ética, la encrucijada apunta a una pregunta que los eticistas se han hecho ante problemas límite similares, como la clonación o la edición genética: podemos, pero ¿debemos? Sin mantener unos límites claros respecto a lo que queremos ganar como humanidad con el desarrollo de estas tecnologías, nuestros objetivos seguirán manteniéndose difusos y eventos como estos, o peores, podrían poner en riesgo a la sociedad. Por otro lado, desde la economía, se presenta la encrucijada de si es posible ir en contra de la lógica de competencia que hace del desarrollo de la IA una especie de carrera armamentística: para reducir los riesgos de la IA se necesita tiempo, pero para que ese tiempo se respete las empresas deben coordinarse, y para coordinarse se necesita superar los incentivos económicos que empujan a estas compañías competir. Por último, desde la geopolítica, la encrucijada se presenta como la emergencia de un mundo multipolar donde Estados Unidos ya no está solo en la delantera, y la ventaja militar que podría sacar cualquier potencia mundial de esta tecnología tiene la capacidad de reconfigurar el escenario global de manera importante.
Todo lo anterior nos hace ver algo de lo que pocos están hablando: la necesidad de una regulación internacional que sea verdaderamente efectiva para marcar una agenda global en torno al desarrollo de la IA, tal como se hizo en torno a las armas nucleares después de la Segunda Guerra Mundial. Una regulación unilateral no servirá de nada. Por último, también nos hace ver que la noción de “alineamiento” bajo la que se desarrollan estas tecnologías, no puede limitarse a hacer que un modelo obedezca las instrucciones humanas sin más, como si los valores que subyacen a estas instrucciones fueran compartidos por todos por default. En cambio, también debemos preguntarnos qué instituciones establecen esas instrucciones, qué intereses representan y qué grupos sociales quedan expuestos a los errores de los sistemas. Una IA puede estar alineada con los objetivos de una empresa y, al mismo tiempo, producir efectos socialmente perjudiciales. Es claro entonces que el problema no es solo técnico, sino también ético, económico y político.
Por lo tanto, más que como un gesto prudencia, de tal vez debamos interpretar este llamado por la desaceleración de la IA precisamente como el momento explícito en el que estas compañías revelan los límites de su disputa por las condiciones materiales y políticas de la carrera. El reto consiste en transformar esta advertencia en mecanismos verificables de supervisión, coordinación y responsabilidad pública internacional antes de que el momentum de la carrera vuelva imposible detenerla. Si los sistemas avanzan más rápido que nuestra capacidad para analizarlos, cuestionarlos y comprender sus consecuencias, el problema no será únicamente que la IA se salga de un sandbox, sino que nuestras instituciones permanezcan encerradas dentro de él.
Referencias
- OpenAI. “Hugging Face Model Evaluation Security Incident.” OpenAI Blog, 2026. https://openai.com/es-ES/index/hugging-face-model-evaluation-security-incident/
- Anthropic. “Investigating Incidents: Cybersecurity Evals.” Anthropic News, 2026. https://www-anthropic-com.translate.goog/news/investigating-incidents-cybersecurity-evals
- Anthropic. “Improving Alignment Security Efforts.” Anthropic News, 2026. https://www.anthropic.com/news/improving-alignment-security-efforts
- Fortune. “Anthropic’s Jacob Coxon: Gambling with Lives, ‘Destroy Humanity’.” Fortune, Septiembre 10, 2026. https://fortune.com/2026/09/10/anthropic-jacob-coxon-gambling-with-lives-destroy-humanity/
- Yahoo Noticias. “Jefe de seguridad de Anthropic: 10% de probabilidad de que IA mate a la humanidad en la próxima década.” Yahoo Noticias, 2026. https://es-us.noticias.yahoo.com/jefe-seguridad-anthropic-10-probabilidad-142238349.html
- BBC News. “AI industry must slow development, says Anthropic CEO Dario Amodei.” BBC, 2026. https://www.bbc.com/news/articles/c14dpgm0rg4o
- Al Jazeera. “US orders Anthropic to disable AI models for all foreign nationals.” Al Jazeera, Junio 13, 2026. https://www.aljazeera.com/news/2026/6/13/us-orders-anthropic-to-disable-ai-models-for-all-foreign-nationals
- The Guardian. “OpenAI’s Sam Altman and Elon Musk back Anthropic calls for brakes on AI development.” The Guardian, Septiembre 13, 2026. https://www.theguardian.com/technology/2026/sep/13/openai-sam-altman-elon-musk-back-anthropic-calls-brakes-ai-development