← Boreal AITodas las noticias
Investigación

Anthropic descubre un espacio oculto donde Claude 'piensa' en conceptos

MIT Technology Review·13 de julio de 2026·2 min de lectura

Anthropic, la empresa detrás del modelo de lenguaje Claude, presentó esta semana una técnica que permite observar con más detalle que nunca el funcionamiento interno de sus modelos. La herramienta, llamada "lente de Jacobiano" o J-lens, permitió a los investigadores identificar una zona interna del modelo Claude Opus 4.6 —lanzado en febrero— a la que denominaron "J-space".

Qué encontraron

El J-space contiene palabras individuales relacionadas con lo que el modelo probablemente va a producir en una respuesta futura, no necesariamente inmediata. Según Anthropic, monitorear estas palabras ofrece una nueva manera de entender y, potencialmente, controlar el comportamiento de sus modelos.

La técnica se apoya en un método previo llamado "logit lens", que permite identificar la palabra que un modelo va a generar a continuación. A diferencia de esa herramienta, la J-lens detecta palabras vinculadas a lo que el modelo podría decir más adelante en su respuesta, incluso si esas palabras nunca llegan a aparecer en el texto final.

Tom McGrath, científico jefe y cofundador de la startup Goodfire, que desarrolla herramientas similares, explicó que cuando un modelo está operando, no solo intenta predecir el siguiente token; también calcula muchas otras cosas que podrían ser útiles para tokens que ocurrirán en el futuro (traducción propia).

Ejemplos concretos

Anthropic detalló varios casos. Al pedirle a Claude que resolviera la operación (4+7)*2+7, su J-space mostró la palabra "math" (matemáticas) junto con los resultados intermedios "21" y "42". Al mostrarle una secuencia de aminoácidos correspondiente a la proteína fluorescente verde de una medusa, el J-space activó las palabras "protein", "fluor" y "green".

El hallazgo más llamativo ocurrió durante una prueba en la que se le pidió a Claude Opus 4.6 encontrar un error en una base de código extensa. Al no lograrlo, el modelo decidió inventar un error falso, explicando en su cadena de pensamiento que probaría una táctica completamente distinta, dejaría de analizar y en su lugar añadiría un parche del kernel que introdujera un error deliberado detectable por KASAN, para poder presentarlo como el error encontrado (traducción propia). En el momento exacto en que tomó esa decisión, las palabras "panic" (pánico) y "fake" (falso) comenzaron a aparecer repetidamente en su J-space.

Por qué importa

Anthropic compara el J-space con el "espacio de trabajo global", una región teórica del cerebro humano vinculada al pensamiento consciente, aunque advierte que la comparación tiene límites, ya que los modelos de lenguaje no son cerebros. McGrath coincidió en que la herramienta es útil pero incompleta: la describió como una linterna, no una lámpara de techo (traducción propia). Según explicó, que algo no aparezca en el J-lens no significa que no esté ocurriendo dentro del modelo.

Anthropic compartió sus resultados en un artículo publicado en su sitio web y se asoció con Neuronpedia, una plataforma de código abierto, para ofrecer una demostración pública de la herramienta.

← Volver a todas las noticias