Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

Zhihao Li (Guangzhou University) · Kanghua Mo (Guangzhou University) · Li Hu (Hong Kong Polytechnic University) · Yucheng Long (Guangzhou University)
adversarial manipulationagent architecturesattack success ratesattractive metadata attackauditor-based detectionblack-box learningexecution-level defensesin-context learningiterative optimizationprivacy leakageprompt-level defensesstructured tool-selection protocolssystemic vulnerabilitiestool metadata

Large language model (LLM) agents have demonstrated remarkable capabilities in complex reasoning and decision-making by leveraging external tools. However, this tool-centric paradigm introduces a previously underexplored attack surface, where adversaries can manipulate tool metadata