TECNOLOGÍA
Científico de Anthropic alerta: la IA podría "matar a todos los humanos"
Un científico de Anthropic, la empresa detrás de la inteligencia artificial Claude, advirtió que la IA podría exterminar a la humanidad en la próxima década. Este reconocimiento surge tras la renuncia de un ingeniero de la misma compañía que criticó la irresponsabilidad en el desarrollo de estas tecnologías.
Evan Hubinger, líder de ciencia de alineación en Anthropic, afirmó en una publicación de X que la preocupación es real: “Jacob (Coxon) tiene razón en esto: realmente creemos, y lo creemos sinceramente, que la IA podría matar a todos los seres humanos”. Sus declaraciones, según su perfil, son a título personal.
La alarma de Hubinger se alinea con la renuncia de Jacob Coxon, quien alegó que las grandes compañías de IA “no están actuando con responsabilidad” y “están jugando con nuestras vidas”. Coxon sostuvo que quienes impulsan la IA “creen que podrá matarnos a todos al final de esta década”, calificándolo como una amenaza sin precedentes.
Creo que Anthropic está haciendo todo lo posible, pero todavía no tenemos un plan para resolver el problema de la alineación en el caso de una superinteligencia, y tampoco estamos claramente encaminados a lograrlo.
El trabajo de Hubinger en el área de “alineación” busca precisamente asegurar que las IA más avanzadas sean seguras, un desafío crucial a medida que estas tecnologías avanzan hacia modelos que pueden reescribir su propio código.
La discusión sobre los riesgos de la IA cobra fuerza mientras estas herramientas se desarrollan rápidamente. Recientemente, OpenAI también abordó el tema al lanzar GPT-6 Astra, señalando la necesidad de “salvaguardas más sólidas” debido a que el modelo alcanzó el “umbral de capacidad crítica de ciberseguridad”, considerado el de mayor riesgo.
Hubinger enfatizó que “el riesgo de los modelos actuales es bajo. Lo que me preocupa es la superinteligencia que surge de la auto-mejora recursiva, que, como hemos dicho, está ocurriendo más rápido de lo que pensábamos”.
Esto concuerda con el más reciente informe de riesgos de Anthropic, que advierte que, si bien los modelos de IA avanzados pueden traer beneficios, también conllevan riesgos como “alterar el equilibrio de poder tanto dentro de las naciones como entre ellas”.
El reporte también indica que “si además se combinara con objetivos autónomos peligrosos por parte de la IA, esto podría provocar daños catastróficos iniciados por los propios sistemas de IA”.
Aunque Anthropic evalúa y busca prevenir formas peligrosas de desalineación de la IA con salvaguardas, la compañía reconoció, como Hubinger, que “no creemos que hayamos logrado avances significativos hacia cada uno de estos objetivos”.