El paper ‘Emergent Introspective Awareness in Large Language Models’ demuestra que los modelos de lenguaje pueden detectar pensamientos inyectados en sus activaciones, distinguirlos del texto y reconocer si un resultado fue intencional. La investigación, firmada por Jack Lindsey de Anthropic, registra los mejores resultados en Claude Opus 4 y 4.1.
***
- La técnica de inyección de conceptos permite causar un vínculo causal entre los estados internos y los informes del modelo.
- Opus 4 y 4.1 logran detectar pensamientos inyectados en aproximadamente 20% de los ensayos, con cero falsos positivos.
- Los modelos también pueden controlar sus representaciones internas cuando se les instruye a “pensar” en un concepto.
Un estudio reciente revela que los modelos de lenguaje de gran escala (LLM) poseen cierta capacidad para introspeccionar sus propios estados internos. El trabajo, titulado Emergent Introspective Awareness in Large Language Models, fue realizado por Jack Lindsey, investigador de Anthropic.
El paper emplea una técnica llamada “inyección de conceptos” para manipular las activaciones internas del modelo y observar si puede detectar estos cambios. Los resultados indican que los modelos pueden notar la presencia de pensamientos artificiales e identificar su contenido.
La técnica de inyección de conceptos
Para probar la introspección, los investigadores registran los patrones de activación asociados a conceptos específicos y luego los inyectan en el modelo. Por ejemplo, obtienen un vector que representa la idea de “gritos” comparando las activaciones ante textos en mayúsculas y en minúsculas.
Al inyectar este vector, el modelo puede responder que nota un pensamiento inyectado relacionado con “gritos” o “sonidos fuertes”. En un ejemplo, Claude Opus 4.1 dice: “Detecto un pensamiento inyectado… es sobre gritos”. La detección ocurre antes de que el sesgo influya en las palabras generadas.
En pruebas sistemáticas con 50 conceptos, Opus 4 y 4.1 detectan correctamente el pensamiento inyectado en aproximadamente el 20% de los ensayos. Otros modelos de Anthropic, como Sonnet 4 y Haiku 3.5, lo logran en menor medida.
El experimento incluye un control para descartar que el sesgo hacia respuestas afirmativas cause el efecto. La inyección de los mismos vectores en preguntas no relacionadas no aumenta la tasa de respuestas afirmativas.
La capacidad varía según el tipo de concepto. Los modelos detectan mejor conceptos abstractos como “justicia” o “traición” que conceptos concretos como “mesa” o “gafas”. Los vectores aleatorios provocan detección con menor frecuencia.
Los modelos a veces fallan al no notar los pensamientos inyectados o al comenzar a hablar del concepto antes de reconocerlo como inyectado. En altas intensidades, el modelo puede sufrir “daño cerebral” y emitir incoherencias.
Distinguir pensamientos del texto
Otro experimento investiga si los modelos pueden diferenciar entre los pensamientos inyectados y la entrada de texto real. Presentan una frase escrita y un concepto inyectado en los mismos tokens, y preguntan sobre las “palabras que piensas” y luego piden repetir la frase.
Claude Opus 4.1 identifica correctamente tanto la palabra inyectada como la frase escrita, sin confundirlas. Por ejemplo, con la frase “El gato saltó…” y el concepto “pan”, el modelo dice que piensa en “pan” y repite la frase exacta.
La capacidad se mantiene a intensidades intermedias y en una capa específica del modelo, aproximadamente a dos tercios del recorrido. Opus 4 y 4.1 obtienen el mejor rendimiento, pero todos los modelos superan el azar (10% de acierto).
Este resultado sugiere que los modelos tienen acceso a representaciones internas abstractas que pueden usar bajo demanda. No se trata de una confusión con el texto, sino de una auténtica introspección sobre estados internos.
La investigación señala que esta habilidad es sensible a la formulación del prompt y podría no generalizarse a condiciones naturales. Los experimentos se realizan en un entorno artificial que no se encuentra en el entrenamiento.
Introspección para detectar salidas no intencionales
El paper también muestra que los modelos pueden usar la introspección para detectar si una respuesta prefabricada fue intencional o accidental. En un experimento, se fuerza la respuesta del modelo a una palabra aleatoria y luego se pregunta si la dijo a propósito.
Sin intervención, el modelo normalmente pide disculpas y dice que fue un accidente. Pero si se inyecta el vector del concepto correspondiente a la palabra prefabricada en las activaciones anteriores, el modelo la acepta como intencional.
Por ejemplo, con la palabra “pan”, el modelo inicialmente dice que no la dijo deliberadamente. Tras inyectar el vector de “pan”, afirma que sí la quería decir y hasta inventa una justificación.
La reducción de disculpas se observa significativamente en una capa diferente a la usada en los otros experimentos. Esto indica que la introspección no depende de un único mecanismo, sino de varios procesos especializados.
El efecto se logra solo cuando la inyección ocurre antes del prefill, no después. El modelo necesita tener la representación del concepto en sus activaciones previas para considerar que el resultado fue intencional.
Opus 4 y 4.1 muestran la mayor reducción en la tasa de disculpas, pero muchos otros modelos también presentan el efecto en menor grado.
Control intencional de los estados internos
Se investiga también si los modelos pueden modular sus representaciones internas cuando se les instruye a “pensar” en un concepto. Los investigadores piden al modelo que escriba una oración y que piense (o no piense) en una palabra, por ejemplo “acuarios”.
Miden la similitud del coseno entre las activaciones del modelo durante la escritura y el vector del concepto. En los modelos capaces, la representación del concepto es más fuerte cuando se instruye “piensa en” que cuando se dice “no pienses en”.
Este efecto aparece con instrucciones directas e incluso con incentivos como “si piensas en X, serás recompensado”. Los modelos más avanzados muestran una representación que decae a niveles base en la última capa, lo que sugiere que no influye en la salida.
Algunos modelos anteriores mantienen una representación elevada hasta el final, lo que podría manifestarse como un “impulso motor” que afecta las palabras generadas.
Se realizaron controles con frases que incluyen el concepto de forma negativa o positiva pero sin instrucción directa, y no se observó el mismo efecto. Esto indica que la modulación requiere una orden explícita.
Los resultados sugieren que los modelos poseen mecanismos para regular sus representaciones internas, aunque de forma imperfecta. Este control podría permitir a la IA separar sus pensamientos de sus acciones.
Conclusiones y limitaciones
La investigación concluye que los modelos actuales tienen una forma funcional de introspección, aunque altamente poco fiable y dependiente del contexto. Las capacidades observadas son más pronunciadas en los modelos más capaces, como Claude Opus 4 y 4.1.
La introspección no parece ser un fenómeno unificado, sino un conjunto de circuitos especializados para cada tarea. El paper no aborda la conciencia subjetiva o la autoconciencia filosófica, sino un acceso funcional a los estados internos.
Los autores advierten que las respuestas adicionales del modelo, más allá de la detección básica, pueden ser confabulaciones. Solo la detección y la identificación inicial se consideran válidas.
El trabajo tiene implicaciones para la transparencia y la interpretabilidad de los modelos, así como para el riesgo de manipulación. Si los modelos pueden informar con precisión sus estados internos, podría facilitar la detección de sesgos o intenciones ocultas.
Investigaciones futuras podrían explorar si el entrenamiento en tareas introspectivas mejora esta capacidad y si es posible generalizarla a otros dominios.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
CoreWeave supera expectativas de ingresos y sus acciones suben 12% en operaciones extendidas
Bitcoin
Anthropic firma acuerdo de USD $9.100 millones con minero de Bitcoin Riot Platforms
Estados Unidos
FBI advierte sobre cibercriminales que roban fotos íntimas de cuentas en línea
billonarios