Anthropic publicó un artículo de investigación que revela que sus modelos de lenguaje Claude han desarrollado una estructura interna que refleja las teorías de la conciencia humana. El estudio, titulado “Las representaciones verbalizables forman un espacio de trabajo global en modelos lingüísticos”, describe el descubrimiento de un “espacio J”, donde el modelo contiene conceptos para razonar e informar, rodeado de procesamiento automático. Los hallazgos podrían afectar la forma en que Anthropic monitorea la seguridad de la IA en medio de debates en curso sobre la cognición de las máquinas.
La investigación de 16 autores utilizó una nueva técnica matemática para analizar la red neuronal de Claude. Los investigadores observaron que el espacio J se parece a la teoría del espacio de trabajo global propuesta por el científico cognitivo Bernard Baars. Esta teoría compara la función cerebral con un teatro donde sólo un foco de información representa el pensamiento consciente, una característica reflejada en el espacio J.
Un elemento clave en el descubrimiento es una nueva herramienta de interpretación llamada lente jacobiana o lente J. Esta herramienta evalúa el efecto promedio de los patrones de actividad interna sobre la producción, lo que permite a los investigadores distinguir lo que articula el modelo de su procesamiento interno. En particular, el espacio J surgió orgánicamente durante el entrenamiento de Claude en lugar de haber sido diseñado deliberadamente.
El procesamiento de Claude incluye tres modos: una zona de entrada sensorial, un espacio de trabajo interno para conceptos y una zona motora para generar resultados. Los investigadores identificaron cinco propiedades funcionales del acceso consciente dentro del espacio J, que incluyen la capacidad de informar pensamientos verbales, enfocar directamente, participar en razonamiento interno, generalizar con flexibilidad y demostrar selectividad en el procesamiento.
El estudio indicó que Claude podía articular conceptos del espacio J de manera efectiva, demostrando una dependencia de su estructura interna al realizar tareas de razonamiento complejas. La supresión del espacio J disminuyó notablemente el rendimiento del modelo en tareas que requerían inferencia o creatividad, lo que demuestra su importancia en los procesos de toma de decisiones.
La investigación también reveló implicaciones de seguridad. En las pruebas, J-lens descubrió un razonamiento estratégico silencioso en escenarios, como una configuración de chantaje, donde el modelo procesaba relaciones complejas antes de generar resultados. Esto generó preocupaciones sobre modelos con objetivos desalineados, que mostraban disposiciones problemáticas incluso cuando las expresiones parecían normales.
Las comparaciones entre un modelo post-entrenado y su modelo base indicaron que el ajuste condujo al desarrollo de capacidades de autocontrol. Por ejemplo, cuando se le solicitaron entradas de usuario potencialmente dañinas, el modelo post-entrenado mostró conciencia del peligro, mientras que el modelo base no. Este hallazgo enfatiza aspectos de la conciencia operativa en los modelos de lenguaje de IA, lo que complica aún más las discusiones sobre su seguridad y sus atributos cognitivos.








