Detecting High-Stakes Interactions with Activation Probes
activation probescomputational savingsdownstream analysisfinetuned monitorshierarchical monitoringhigh-stakes interactionsinitial filtermodel activationsout-of-distribution dataperformance evaluationprobe architecturesresource-aware systemsrobust generalizationsynthetic datasettext-based monitoring
Monitoring is an important aspect of safely deploying Large Language Models (LLMs). This paper examines activation probes for detecting ``high-stakes'' interactions