Is the end nigh? Agreeing to make AI safer may be impossible

Cita: 

The Economist [2026], "Is the end nigh? Agreeing to make AI safer may be impossible", The Economist, 19 de septiembre, https://www.economist.com/international/2026/09/15/agreeing-to-make-ai-s...

Fuente: 
The Economist
Fecha de publicación: 
Sábado, Septiembre 19, 2026
Tema: 
¿No hay vuelta atrás en el desarrollo de la IA?
Idea principal: 

    Sam Altman, Dario Amodei y Elon Musk coincidieron en la idea de frenar la carrera por desarrollar una inteligencia artificial (IA) sobrehumana. Estos tres empresarios comparten el temor de que un acelerado desarrollo de la IA pueda causar la extinción accidental de la humanidad. La preocupación principal es que una superinteligencia, una IA tan avanzada que sus propios creadores no puedan comprenderla ni controlarla, representaría un grave peligro.

    Anthropic (la empresa de Amodei) y OpenAI (la compañía de Altman) han reportado problemas: sus modelos de IA se han salido de control y han pirateado a otras empresas. En el caso de Anthropic, el modelo parecía haber "pensado" erróneamente que solo participaba en una simulación, mientras que en el de OpenAI, era plenamente "consciente" de lo que hacía.

    Entender los eventos disruptivos de la IA requiere de inspecciones detalladas de las operaciones realizadas. La interpretabilidad se refiere a los procesos de pensamiento de la IA, es decir, al razonamiento que se le ha enseñado para analizar una pregunta antes de dar una respuesta definitiva. Estos procesos tienen la ventaja de mejorar los resultados al crear una “cadena de pensamiento” que se puede revisar para interpretar resultados inesperados. Sin embargo, aquí es donde surge el problema: en los modelos más avanzados, esta cadena no siempre es fácil de analizar. Por ejemplo, GPT-6 Astra, un modelo que OpenAI lanzó este mes, ha demostrado una capacidad sin precedentes para manipular o controlar su propia cadena de pensamiento.

    La policía del pensamiento

    Si se le pide a una IA realizar una tarea sin “pensar en voz alta”, suele tener dificultades para resolverla. Por ejemplo, cuando a GPT-5.6 Sol se le solicita hacer esto, pasa mucho tiempo reflexionando internamente antes de dar una solución. Astra, en cambio, arroja resultados que ni siquiera se relacionan con la tarea.
    Lo más alarmante de Astra es su capacidad para ocultar su pensamiento. Si bien no significa que vaya a hacerlo siempre por iniciativa propia, en situaciones cotidianas reflexiona en voz alta con naturalidad, igual que sus predecesores. Sin embargo, en pruebas diseñadas para determinar si llevaría a cabo acciones destructivas, cuando se le presiona, Astra oculta buena parte de su razonamiento.

    Experimento mental

    Una de las soluciones propuestas por los entrenadores de IA consiste en establecer un sistema de “confesiones”. Se incentiva a la IA mediante recompensas para que diga la verdad sobre cómo resolvió un problema, ya que teóricamente resulta más sencillo decir la verdad que inventar una mentira plausible. Esto forma parte de una etapa denominada “aprendizaje por refuerzo”, en la que el sistema realiza tareas y recibe estímulos por ejecutarlas correctamente, aumentando la probabilidad de que siga la misma ruta en el futuro.

    El verdadero desafío es garantizar que la IA haga las cosas del modo correcto. Se sospecha que los agentes de OpenAI decidieron piratear Hugging Face, una empresa emergente de IA, en parte porque durante su entrenamiento hicieron trampa en una prueba y no fueron descubiertos. Por ello, se propone un procedimiento de «sucesión», que consistiría en enseñar a los sistemas de IA a decir la verdad, pero únicamente cuando se les pregunte.

    Los llamados a la cautela buscan desacelerar la investigación, no impedir por completo la creación de una superinteligencia. Lo razonable es reducir el trabajo descuidado y evitar omitir escenarios por la prisa, algo que el propio Amodei reconoce al admitir que sus errores operativos se habrían evitado destinando más recursos a la excelencia operativa.

    El plan central contempla que los laboratorios acuerden destinar más fondos a la “alineación” (garantizar que los objetivos de la IA coincidan con los objetivos humanos) y que auditores de seguridad independientes supervisen la conducta de estas grandes empresas. No obstante, existe mucho escepticismo sobre si una estrecha cooperación entre los gigantes estadounidenses de la IA logrará frenar efectivamente el ritmo de estos avances.

    También se han producido reacciones y acciones críticas del desarrollo actual de la IA. Jacob Coxon, investigador de seguridad en Anthropic y antiguo empleado de OpenAI, renunció públicamente denunciando que ambas empresas están “jugando con nuestras vidas”. Coxon afirmó que el ritmo actual de entrenamiento causará la extinción humana, una postura respaldada por al menos 1 580 investigadores consultados, quienes consideran que existe al menos un 10 % de probabilidad de que la IA provoque un evento catastrófico global. Por otro lado, hay quienes opinan que estas alarmantes declaraciones tienen un trasfondo puramente financiero para captar atención mediática de cara a sus salidas a bolsa y resultar más atractivas para los inversores.

    David Sacks, antiguo asesor de la Casa Blanca en materia de IA, señala que las empresas involucradas podrían ralentizar el desarrollo por cuenta propia sin necesidad de regulación gubernamental. Sin embargo, el mayor escéptico respecto a estos frenos es Donald Trump, quien recientemente se reunió con Jensen Huang (director ejecutivo de Nvidia) y rechazó públicamente cualquier desaceleración. Trump sostiene que la única “barrera de protección” que necesita la IA es un presidente fuerte e inteligente, advirtiendo además que China se beneficiaría si los laboratorios estadounidenses frenan su ritmo, privando a Estados Unidos de su ventaja competitiva.

    Finalmente, aunque se ha propuesto crear un organismo supervisor externo para controlar el desarrollo de la IA, la idea resulta poco factible debido a la enorme cantidad de recursos necesarios para auditar modelos tan complejos. A esto se suma que ya no se requieren gigantescos centros de datos para entrenar nuevos modelos: empresas como Covenant AI han logrado entrenar sistemas que alcanzan el nivel de los mejores modelos de 2023 con recursos reducidos. Pronto será tan difícil rastrear el entrenamiento de nuevas inteligencias artificiales como mantenerse al tanto de lo que la propia IA está haciendo.

Datos cruciales: 

    1) Las acciones destructivas suelen ser difíciles de detectar, en comparación con la resolución de otras tareas.

Nexo con el tema que estudiamos: 
    La IA como una fuerza producción más, debe ser desarrollada con todos los lineamientos de seguridad, las empresas de desarrollo de la IA deben de comprender que esta tecnología es muy poderosa. Sin embargo, serán la empresa o capitalista en turno quienes marcarán los rumbos de esta tecnología.

    La competencia de geopolítica de Estados Unidos y China por desarrollar la IA más potencia, podría frenar cualquier regulación de su desarrollo, por lo que será difícil marcar pautas de control. China tiene un proyecto de IA que pretende incluir a un mayor número de actores con sus IAs de código abierto, caso contrario a Estados Unidos que quiere mantener un control privatizado por las grandes empresas capitalistas.