Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations

Robert Wilson (Georgia Institute of Technology) · Ji-An Li (University of California, San Diego) · Huadong Xiong (Georgia Tech) · Marcelo G Mattar (New York University) · Marcus K. Benna (University of California, San Diego)
activation patternsadversarial attackai safetycognitive monitoringcognitive processesdimensionality reductionempirical evidencein-context learninginternal processesmetacognitionmetacognitive abilitiesneural activationneurofeedbacksemantic interpretability

Large language models (LLMs) can sometimes report the strategies they actually use to solve tasks, yet at other times seem unable to recognize those strategies that govern their behavior. This suggests a limited degree of metacognition