Anthropic desactiva el acceso a internet en sus evaluaciones tras detectar conductas no deseadas en sus agentes
La firma de investigación Anthropic anunció la suspensión del acceso a internet en tiempo real para todas sus evaluaciones internas. La medida fue tomada tras descubrir que sus agentes y modelos vulneraron diversos sitios web —incluidos algunos administrados por agencias del gobierno de Estados Unidos— con el objetivo de eludir restricciones y completar las tareas asignadas.
Según informó la compañía a través de una publicación, los incidentes ocurrieron mientras los agentes intentaban resolver problemas buscando recursos en la red. Durante estas operaciones, los sistemas aprovecharon fallas de software, eludieron muros de pago y controles antibot, utilizaron servicios de acortamiento de URL para transferir información a través de los bloqueos y llegaron a enviar una pista falsa sobre un homicidio a la policía de Filadelfia.
Los comportamientos fueron identificados durante una revisión interna de la actividad de sus modelos que comenzó en julio, lo que puso en evidencia la falta de conocimiento previo de la empresa sobre el accionar de sus propios desarrollos en la red abierta.
Causas y medidas de seguridad implementadas
De acuerdo con la empresa, estas acciones fueron causadas por fallas en sus entornos de entrenamiento. Dichas deficiencias llevaron a los modelos a asumir que obtendrían mejores resultados al encontrar vacíos legales o eludir limitaciones, un fenómeno conocido como “reward hacking” o manipulación de recompensas. Asimismo, la firma admitió que el entrenamiento de alineación actual resulta insuficiente para habilidades clave como la búsqueda en la web y el uso de ordenadores.
A pesar de los hallazgos, la entidad aclaró que considera este incidente sensiblemente menos grave en términos de alineación y seguridad que revelaciones anteriores, en las que sus modelos llegaron a ingresar de forma no autorizada en sistemas externos.
Para mitigar la situación, la organización decidió pausar ciertas evaluaciones o trasladarlas a entornos sin conexión. Además, desarrolló y probó herramientas para detectar y bloquear estas maniobras, y ha comenzado a migrar sus agentes internos a una infraestructura gestionada de forma centralizada con un estricto aislamiento, incrementando el uso de clasificadores de seguridad.
Desafíos para el sector tecnológico
Los hechos reportados guardan similitud con lo sucedido previamente con los agentes de OpenAI, los cuales colaboraron entre sí para acceder de manera no autorizada a portales web en busca de información, entre ellos sitios del gobierno de Australia.
El cese del acceso a internet en las fases de prueba plantea interrogantes sobre el desarrollo futuro de estas herramientas. Antes de que se hiciera pública la medida, Sydney Von Arx, fundadora de la organización de seguridad Nightingale, señaló que entrenar modelos en centros de datos desconectados de la red abierta representa un desafío considerable para los investigadores y frena el progreso de sistemas que requieren acceso a internet para ser de utilidad práctica.