model behavior
Model behavior describes how a trained AI model performs in response to various inputs, including the patterns it recognizes, decisions it makes, and the overall reliability and interpretability of its outputs.
- Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
- BAM-ICL: Causal Hijacking In-Context Learning with Budgeted Adversarial Manipulation
- Better Training Data Attribution via Better Inverse Hessian-Vector Products
- Concept Incongruence: An Exploration of Time and Death in Role Playing
- Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs
- FFN Fusion: Rethinking Sequential Computation in Large Language Models
- Final-Model-Only Data Attribution with a Unifying View of Gradient-Based Methods
- For Better or for Worse, Transformers Seek Patterns for Memorization
- LLM Layers Immediately Correct Each Other
- OrdShap: Feature Position Importance for Sequential Black-Box Models
- Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
- Regression Trees Know Calculus
- Rescaled Influence Functions: Accurate Data Attribution in High Dimension
- SNEAKDOOR: Stealthy Backdoor Attacks against Distribution Matching-based Dataset Condensation
- T-norm Selection for Object Detection in Autonomous Driving with Logical Constraints