Anthropic y su socio de investigación AE Studio publicaron el miércoles un método para aislar conocimientos peligrosos dentro de modelos de IA utilizando módulos discretos y extraíbles. La técnica, denominada Módulos auxiliares enrutados por gradiente (GRAM), está diseñada para mejorar la gestión de riesgos de doble uso manteniendo al mismo tiempo el rendimiento general de los modelos de IA.

GRAM agrega pequeños compartimentos neuronales auxiliares a la arquitectura del transformador estándar. Cada compartimento está dedicado a una categoría específica de conocimientos sensibles, como virología, ciberseguridad o física nuclear. Eliminar un módulo hace que el modelo se comporte como si nunca hubiera sido entrenado con esos datos en particular, mientras que activar un módulo permite el acceso al conocimiento contenido.

Los investigadores entrenaron un modelo de 800 millones de parámetros utilizando una combinación de texto web, código, artículos científicos y cuatro dominios de doble uso: virología, ciberseguridad, física nuclear y código especializado. Los datos de doble uso representaron aproximadamente el 0,25% de los datos de entrenamiento para cada dominio. Los resultados indicaron que eliminar los módulos GRAM fue casi tan efectivo como no entrenar en absoluto con los datos. El modelo mantuvo un desempeño general cercano a la línea de base establecida con todos los datos incluidos.

Este enfoque demostró ser sólido contra el ajuste fino adversario, a diferencia de los métodos de desaprendizaje post hoc que normalmente solo suprimen el conocimiento en lugar de eliminarlo. La investigación se produce durante un período desafiante para la gobernanza de la IA, ya que la administración Trump había impuesto momentáneamente controles de exportación en los modelos Claude de Anthropic debido a preocupaciones de seguridad nacional relacionadas con posibles vulnerabilidades.

  Sam Altman se disculpa por no informar las preocupaciones sobre los chatbots relacionadas con el tiroteo

Esas restricciones se levantaron el 30 de junio después de que Anthropic colaborara con el Departamento de Comercio para abordar los riesgos identificados. GRAM puede ofrecer un punto medio en la formulación de políticas, permitiendo un control de acceso granular en lugar de prohibir modelos completos o depender únicamente de barreras de comportamiento.

Sin embargo, los investigadores señalaron que sus hallazgos son preliminares y aún no se han implementado en los modelos de producción de Anthropic. Plantearon preguntas sobre la escalabilidad de GRAM a modelos más complejos y las posibles dificultades de separar el conocimiento entrelazado de capacidades más generales. Esta investigación fue dirigida por AE Studio, con contribuciones de Cem Anil y Alex Cloud de Anthropic.

Crédito de imagen destacada