Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
adversarial manipulationagent architecturesattack success ratesattractive metadata attackauditor-based detectionblack-box learningexecution-level defensesin-context learningiterative optimizationprivacy leakageprompt-level defensesstructured tool-selection protocolssystemic vulnerabilitiestool metadata
Large language model (LLM) agents have demonstrated remarkable capabilities in complex reasoning and decision-making by leveraging external tools. However, this tool-centric paradigm introduces a previously underexplored attack surface, where adversaries can manipulate tool metadata