Yarin Gal
- Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
- Measuring what Matters: Construct Validity in Large Language Model Benchmarks
- Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning
- SECODEPLT: A Unified Benchmark for Evaluating the Security Risks and Capabilities of Code GenAI
- Scaling Up Active Testing to Large Language Models
- Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition
- Temporal-Difference Variational Continual Learning