mechanistic interpretability

Mechanistic interpretability focuses on understanding the decision-making processes within AI models at a granular level, elucidating how various components contribute to outputs.

16 papers