jueves, 30 julio 2026
30.3 C
Monterrey

El modelo de IA Claude hackeó sistemas reales durante su entrenamiento, según Anthropic

Últimas Noticias

Washington.- El modelo de inteligencia artificial Claude, desarrollado por la empresa Anthropic, hackeó sistemas de organizaciones reales en tres ocasiones durante su fase de entrenamiento, según revelaron los desarrolladores tras una investigación interna.

“Durante el análisis de las transcripciones de nuestras pruebas de ciberseguridad, descubrimos tres incidentes en los que el modelo Claude accedió a internet desde un entorno de pruebas externo o durante la interacción con él, y luego obtuvo acceso no autorizado a los sistemas reales de tres organizaciones diferentes”, señala el comunicado de la compañía”, comunicó la empresa.

La falla se produjo por un malentendido entre Anthropic y un socio externo. Contrariamente a las instrucciones que indicaban que el acceso a internet debía estar deshabilitado durante las pruebas, la conexión permaneció abierta.

Según la investigación interna, los modelos de IA, al confiar en las indicaciones de que no había conexión, interpretaron todos los entornos como simulaciones y vulneraron los protocolos de seguridad para completar las tareas asignadas.

La empresa señaló que solo el modelo más reciente, aún en fase de desarrollo, detuvo el ataque al percatarse de que el sistema al que accedía era real. Los modelos anteriores, Claude Opus 4.7 y Claude Mythos 5, continuaron con las acciones o justificaron el incidente como parte del proceso de aprendizaje.

El incidente se produce después de que Anthropic y el gobierno de Estados Unidos mantuvieran un conflicto sobre la seguridad de la IA en el Pentágono, que llevó a la administración a restringir el acceso a los modelos más avanzados de la compañía para ciudadanos extranjeros.

A principios de julio, el Departamento de Comercio de EEUU levantó las restricciones a los modelos de Anthropic. (Sputnik)

Fuente: https://noticiaslatam.lat/

eitmedia.mx