task performance
The measure of how well an AI model or system can accomplish a specific task, often quantified through metrics such as accuracy, precision, or F1 score. Understanding task performance is essential for evaluating and comparing different models.
- Causal Head Gating: A Framework for Interpreting Roles of Attention Heads in Transformers
- Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
- Do different prompting methods yield a common task representation in language models?
- Estimating cognitive biases with attention-aware inverse planning
- On Extending Direct Preference Optimization to Accommodate Ties
- On Reasoning Strength Planning in Large Reasoning Models
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Real-World Reinforcement Learning of Active Perception Behaviors
- Representation Consistency for Accurate and Coherent LLM Answer Aggregation
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- SilentStriker: Toward Stealthy Bit-Flip Attacks on Large Language Models
- SpecEM: Training-Free LLM Ensembling via Iterative Drafting, Verification, and Online Feedback
- The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization
- TokenSwap: A Lightweight Method to Disrupt Memorized Sequences in LLMs
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR