APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay

Akshara Prabhakar (Salesforce Research) · Zuxin Liu (OpenAI) · Ming Zhu (Salesforce AI Research) · Jianguo Zhang (Senior Research Scientist @ Salesforce AI Research) · Tulika Manoj Awalgaonkar (Salesforce) · Shiyu Wang (Emory University) · Zhiwei Liu (Salesforce AI Research) · Haolin Chen (Salesforce AI Research) · Thai Hoang (Salesforce Research) · Juan Carlos Niebles (Salesforce AI Research) · Shelby Heinecke (Salesforce Research) · Weiran Yao (actAVA AI) · Huan Wang (Salesforce Research) · Silvio Savarese (Stanford University) · Caiming Xiong (Salesforce Research)
$\tau$-benchagentic pipelineapigen-mtbfcl benchmarkscapable agentsefficient agentsground-truth actionsinteraction trajectoriesiterative feedback loopsllm reviewersmulti-turn interactionsreliable agentssynthetic datatask blueprintsverified blueprint-to-details approachxlam-2-fc-r models

Training effective AI agents for multi-turn interactions requires high-quality data that captures realistic human-agent dynamics, yet such data is scarce and expensive to collect manually. We introduce APIGen-MT, a two-phase framework that generates verifiable and diverse multi-turn agent data. In the first phase, our agentic pipeline produces detailed task blueprints with ground-truth actions, leveraging a committee of LLM reviewers and iterative feedback loops. These blueprints are then transformed into complete interaction trajectories through simulated human-agent interplay. We train a family of models