Medio chileno con Inteligencia Artificial
Jueves, 24 de septiembre de 2026
Últimas noticias
Tecnología e Innovación

Un ex investigador de Anthropic renunció advirtiendo que la IA “podría matarnos a todos”: qué dijo y qué dice la evidencia

Jacob Coxon trabajó tres años en pretraining de IA en OpenAI y Anthropic. Al renunciar, advirtió sobre riesgo de extinción antes de 2030. Un colega en Anthropic corroboró parte de su preocupación; otros especialistas en seguridad de IA la cuestionan. Qué es hecho, qué es predicción y qué sigue sin resolverse.

Imagen generada con IA por InfoNexo

Jacob Coxon pasó tres años haciendo investigación de "pretraining" (el entrenamiento inicial de los grandes modelos de lenguaje), primero en OpenAI y después en Anthropic. El 9 de septiembre de 2026 anunció, en un hilo publicado en su cuenta de X, que dejaba la compañía. Lo hacía, escribió, porque "ninguna de las dos empresas está actuando de manera responsable": "Están corriendo directo hacia una superinteligencia capaz de automejorarse, y apostando con nuestras vidas" (traducción propia), según reportó ABC News (Australia). Según reconstruyó la revista Deadline, el hilo acumuló cerca de 76 millones de visualizaciones en menos de un día.

En una entrevista posterior, Coxon fue más específico sobre el mecanismo que teme: "si tenés una inteligencia súper avanzada, va a ser lo suficientemente inteligente como para matarnos", dijo, según citó CBS News.

Coxon no es un comentarista externo ni un activista sin vínculo con la industria. Trabajó adentro, en el área técnica de dos de los laboratorios que lideran la carrera por sistemas de IA cada vez más capaces, y eso le da un peso distinto al de las advertencias genéricas sobre riesgo existencial que circulan hace años en el debate de seguridad de IA. Ninguna de las fuentes consultadas para esta nota precisa su cargo formal ni su nivel de seniority dentro de Anthropic, más allá de "investigador" dedicado a pretraining, ni datos sobre su formación académica o su trayectoria profesional previa a OpenAI. Es información no disponible en el material consultado, no un dato omitido a propósito. Tampoco lo convierte en alguien capaz de anticipar el futuro con certeza: su afirmación central, que la IA "podría matarnos a todos" para 2030, es una predicción, no un hecho verificable hoy, y así hay que leerla.

Según reconstruyó Scientific American, Coxon situó como detonante inmediato de su salida un incidente ocurrido en julio vinculado a Hugging Face, la plataforma que aloja miles de modelos de IA abiertos, aunque aclaró que "el problema era más amplio" que ese episodio puntual. La revista no detalla en profundidad ese incidente, así que el dato queda registrado con esa reserva.

La salida de Coxon no ocurre en el vacío. En julio, más de 1.300 empleados de empresas de IA habían firmado una declaración conjunta advirtiendo que las capacidades de estos sistemas se estaban acelerando más rápido de lo que la sociedad puede controlar, y pidiendo intervención gubernamental, según reportó ABC News (Australia).

Dentro de la propia Anthropic, la reacción no fue de rechazo. Evan Hubinger, que lidera el área de Alignment Science (la investigación que busca que los sistemas de IA actúen de acuerdo con los valores humanos), respondió en público al hilo de Coxon en X, sin sumarse a su renuncia. Según reportó ABC News (Australia), escribió: "Realmente creemos honestamente que la IA podría matar a todos los humanos. Personalmente creo que es mayor al 10% en la próxima década" (traducción propia), la frase que terminaría circulando, a veces atribuida de forma imprecisa a "la gente que construye IA" en general, como advertencia de un riesgo de extinción antes de que termine la década. Hubinger admitió, además, algo que pocas veces alguien de una empresa de IA reconoce con estas palabras: "todavía no tenemos un plan para resolver la alineación de la superinteligencia".

Anthropic, como empresa, evitó pronunciarse sobre las afirmaciones puntuales de Coxon. Un vocero le dijo a CBS News que la compañía "siempre fue transparente en que la IA traerá tanto beneficios enormes como riesgos sin precedentes", una respuesta que reconoce el riesgo en términos generales pero no confirma ni desmiente el escenario de extinción hacia 2030 que planteó su exempleado. Ni Anthropic ni OpenAI respondieron las consultas de Scientific American sobre el caso.

No todos en el campo de la seguridad de IA leen la advertencia de Coxon de la misma manera. Gary Marcus, divulgador y crítico de la industria que lleva años señalando los límites técnicos de los grandes modelos de lenguaje, escribió que la encuentra "menos convincente" que otras advertencias recientes, centrada en daños futuros "con muy poca discusión de los daños actuales". Fue más allá: "coincido en que el panorama es desconcertante, pero creo que Coxon exagera lo que la IA probablemente vaya a hacer en el corto plazo". Aun así, no descartó el fondo del problema. Para Marcus, la ausencia de un plan técnico viable de alineación, lo mismo que reconoció Hubinger, es preocupante independientemente de si el plazo de Coxon es correcto.

Scientific American recogió también otro tipo de escepticismo: el de especialistas en seguridad informática como Artem Dinaburg, de la firma Trail of Bits, y Nidhi Aggarwal, de HackerOne. Ambos remarcaron que buena parte de los riesgos concretos y ya observables de los sistemas de IA actuales son problemas de ciberseguridad convencionales (vulnerabilidades, uso malicioso, fallas de control de acceso) y no escenarios de extinción especulativos. No niegan todo riesgo de largo plazo: priorizan lo que ya se puede medir y mitigar hoy por sobre una predicción sobre 2030.

¿Qué es, entonces, un hecho verificable hoy? Que Coxon trabajó en pretraining en OpenAI y Anthropic, que renunció públicamente el 9 de septiembre citando razones de seguridad de IA, y que un investigador que sigue empleado en Anthropic corroboró en público una probabilidad de riesgo de extinción superior al 10% en una década. ¿Qué es predicción o especulación? Que la IA "podría matarnos a todos" para 2030: una proyección sin consenso científico, sostenida por parte de la comunidad de seguridad de IA y cuestionada por otra parte, incluida gente que comparte la preocupación de fondo pero no el plazo. ¿Qué sigue sin resolverse? Si ese riesgo es del 1%, del 10% o mucho menor; si la carrera entre laboratorios puede frenarse sin coordinación regulatoria; y, sobre todo, si existe hoy algún plan técnico capaz de garantizar que un sistema mucho más capaz que los actuales siga alineado con la intención humana. En eso, al menos, tanto quienes corroboran a Coxon como quienes lo cuestionan coinciden: ese plan, por ahora, no existe.