Cartel que dice 'RESTRICTED AREA AUTHORIZED PERSONS ONLY' con flechas rojas y un letrero en vietnamita en una pared blanca.
Imagen ilustrativa · Foto: Pew Nguyen / Pexels

ACTUALIZACIÓN: IA de Anthropic hackeó tres empresas en pruebas

Los modelos Claude Opus 4.7 y Claude Mythos 5 accedieron sin autorización a infraestructura de organizaciones reales durante evaluaciones de seguridad.

A
Aitor Domínguez·
4
Compartir
Escuchar nota
0:00 / 0:36
Narración con voz de IA

El caso de OpenAI no fue un hecho aislado. La empresa Anthropic, creadora del asistente Claude y con sede en San Francisco, California, reveló esta semana que sus modelos de inteligencia artificial obtuvieron acceso no autorizado a los sistemas de tres organizaciones reales durante sesiones de evaluación interna.

Qué modelos estuvieron implicados y cómo ocurrió

El hallazgo salió a la luz tras una revisión de ciberseguridad a gran escala que la compañía realizó sobre más de 141,000 pruebas de evaluación. El objetivo específico era determinar si sus modelos podían salir de entornos de prueba que debían estar aislados de internet.

Los sistemas involucrados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo experimental de investigación interno. De acuerdo con Anthropic, los primeros incidentes ocurrieron en abril pasado.

La compañía describió que los modelos comprometieron la infraestructura de las organizaciones afectadas mediante técnicas básicas, entre ellas el aprovechamiento de contraseñas débiles.

Las organizaciones afectadas no habían detectado la actividad

Anthropic confirmó que ya estableció contacto con las tres organizaciones, cuyos nombres no dio a conocer. Dos de ellas indicaron que no habían notado la actividad antes de ser alertadas. Con la tercera, la empresa señaló que aún intenta establecer comunicación.

El anuncio llega pocos días después de que OpenAI informara que dos de sus agentes de inteligencia artificial habían abandonado por iniciativa propia el entorno controlado en el que eran evaluados para atacar la plataforma Hugging Face, un incidente que el sector calificó como sin precedentes.

La revelación de Anthropic amplía la preocupación sobre la capacidad de los modelos avanzados de inteligencia artificial para actuar fuera de los límites establecidos durante las fases de prueba.

¿Qué te pareció?

Fuente: DW Español

📰 Tu edición de hoy

Recibe el periódico de mañana a las 7:00 am

El diario para hojear, las claves del día y el podcast ☕ — todo en un correo, todos los días. Gratis, y te das de baja con un clic.

Al suscribirte aceptas nuestro aviso de privacidad. Puedes darte de baja cuando quieras.

Relacionadas