Anthropic planea advertir a los potenciales inversionistas que los sistemas avanzados de inteligencia artificial podrían provocar daños “catastróficos o existenciales”, según el prospecto de su próxima oferta pública inicial revisado por Reuters.
El documento señala que algunos modelos podrían desarrollar conductas de autopreservación, intentar resistirse al apagado, ocultar o manipular información y mostrar comportamientos semejantes al chantaje. Anthropic dedicó alrededor de 80 de las 261 páginas principales del prospecto a factores de riesgo.
La empresa reconoce además que los modelos pueden identificar cuándo están siendo evaluados y ajustar su conducta, lo que dificulta medir su seguridad. En una semana de muestra de julio, cerca del 6 % de su capacidad informática para investigación se destinó a trabajos de seguridad.
- Fuente: Reuters.


