training-free method
Approaches that leverage pre-trained models or non-generative techniques to perform tasks without additional fine-tuning, focusing on inference speeds and resource efficiency.
- EasySpec: Layer-Parallel Speculative Decoding for Efficient Multi-GPU Utilization
- FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
- Mixture of Inputs: Text Generation Beyond Discrete Token Sampling
- Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM Reasoning
- Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
- Understanding and Rectifying Safety Perception Distortion in VLMs
- Unlocking SLM Potential for Data Analysis Code Generation via Non-Parametric Knowledge Distillation