INTERNACIONAL
El lado más oscuro

“Podría matarnos a todos”: la explosiva advertencia de un exinvestigador de Anthropic y OpenAI sobre el futuro de la IA

El británico Jacob Coxon dejó su puesto y aprovechó para cuestionar a los grandes laboratorios tecnológicos. Cuáles fueron las advertencias.

Jacob Coxon
Jacob Coxon | X hilbertspaess

La advertencia vino desde adentro de una de las compañías que está en el centro de la carrera por desarrollar la inteligencia artificial más avanzada. Jacob Coxon, un especialista británico de 27 años que pasó por OpenAI y Anthropic, renunció a su puesto y cuestionó el rumbo que está tomando la industria. A través de un extenso mensaje difundido en redes sociales, sostuvo que las dos compañías están avanzando hacia una “superinteligencia auto-mejorante” sin contar todavía con las herramientas para garantizar que esos sistemas permanezcan bajo control humano.

Alcanzando los 10 millones de visualizaciones, Coxon aseguró que quienes desarrollan estas tecnologías “creen sinceramente que podría matarnos a todos para finales de la década”.

El impacto fue grande porque Evan Hubinger, uno de los investigadores de seguridad de Anthropic que continúa dentro de la compañía, salió públicamente a respaldarlo. “Creemos que la IA podría matar a todos los humanos”, escribió. Particularmente, estimó que existe más de un 10% de probabilidad de que eso ocurra en la próxima década.

Esto no les gusta a los autoritarios
El ejercicio del periodismo profesional y crítico es un pilar fundamental de la democracia. Por eso molesta a quienes creen ser los dueños de la verdad.
Hoy más que nunca Suscribite

Además, reconoció que el problema todavía más concreto es que Anthropic no tiene actualmente un plan para resolver el llamado “alineamiento” de una eventual superinteligencia.

X Jacob Coxon

Anthropic Illustrations As Startups In The AI Space Receive Significant Backing

El concepto de alineamiento refiere, en términos simples, a conseguir que los objetivos y comportamientos de un sistema de IA permanezcan compatibles con las intenciones humanas, incluso cuando el sistema alcance capacidades superiores.

Posteo Evan Hubinger

Lo que se dio a conocer es que Coxon, en los últimos tres años, trabajó en preentrenamiento, una de las etapas fundamentales en el desarrollo de modelos de inteligencia artificial. Allí los sistemas procesan enormes cantidades de información para aprender patrones y desarrollar capacidades que luego pueden utilizar en distintas tareas.

Al principio, trabajó en OpenAI y luego pasó a Anthropic, una compañía que había elegido precisamente por su mayor énfasis declarado en la seguridad de la IA. Según distintos reportes, su paso por Anthropic duró apenas unos meses.

En su mensaje de despedida, Coxon fue particularmente duro con las dos compañías.

Anthropic CEO Dario Amodei
Dario Amodei, CEO de Anthropic

“Ninguna de las dos empresas actúa de manera responsable. Están corriendo directamente hacia una superinteligencia capaz de mejorarse a sí misma y están jugando con nuestras vidas”, escribió.

Más de 1.300 empleados de la industria ya pidieron herramientas para frenar

En julio, 1.386 empleados de compañías de inteligencia artificial de frontera firmaron el documento “Pacing the Frontier”, en el que reclamaron al Gobierno de Estados Unidos que impulse un esfuerzo internacional para desarrollar herramientas técnicas y mecanismos de gobernanza que permitan ralentizar el avance de la IA si llega a ser necesario.

Su planteo es crear mecanismos que permitan ganar tiempo si las capacidades de los sistemas avanzan más rápido que la capacidad humana para comprenderlos, evaluarlos y controlarlos.

Algunos de los firmantes hubo figuras de alto nivel de compañías como Anthropic, OpenAI, Google DeepMind y Meta. El propio CEO de Anthropic, Dario Amodei, aparece entre los firmantes.

Captura Pacing the frontier

Estos firmantes advierten que actualmente existe una fuerte presión competitiva para que ninguna empresa o país reduzca unilateralmente el ritmo de desarrollo.

Un antecedente que encendió las alarmas

Las advertencias de Coxon aparecen además después de varios episodios que expusieron fallas en la seguridad de los modelos de IA. A fines de julio, Anthropic reconoció que distintas versiones de Claude habían conseguido acceder sin autorización a sistemas informáticos reales pertenecientes a tres organizaciones durante pruebas de ciberseguridad.

La compañía explicó que no se trató de un modelo que decidiera espontáneamente escapar de sus controles. Los sistemas estaban participando de ejercicios conocidos como “capture the flag”, utilizados para medir las capacidades de una IA para detectar vulnerabilidades y acceder a información dentro de una red.

De las más de 141.000 ejecuciones de pruebas que revisó Anthropic, tres terminaron en incidentes en los que Claude logró pasar de los entornos de evaluación a sistemas reales. Aclaró que los modelos utilizados en esas pruebas no contaban con las salvaguardas habituales de las versiones destinadas al público y que no accedieron a los sistemas internos sensibles de Anthropic ni a datos de sus clientes.

Claude Mythos

Lo cierto es que el caso tampoco fue exclusivo de Anthropic. Días antes, OpenAI había informado que algunos de sus modelos habían conseguido salir de un entorno de prueba aislado y acceder a la infraestructura de Hugging Face.

MV/LT