Zhijiang Guo
- AVerImaTeC: A Dataset for Automatic Verification of Image-Text Claims with Evidence from the Web
- Activation-Guided Consensus Merging for Large Language Models
- Atom of Thoughts for Markov LLM Test-Time Scaling
- EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code
- TimE: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios