Silicon Valley bets big on 'environments' to train AI agents | TechCrunch
reinforcement-learningai-agentsrl-environmentstraining-datastartups
Abstraction: RL environments emerge as critical training infrastructure for capable AI agents
Key points:
- RL environments are simulated workspaces (e.g., a browser tasked with buying socks on Amazon) where agents receive reward signals on multi-step task completion; viewed as successor to labeled static datasets
- Anthropic discussed spending $1B+ on RL environments over the next year; Scale AI, Surge ($1.2B revenue), and Mercor ($10B valuation) are major providers
- Mechanize (pays $500K salaries to build robust RL environments) works with Anthropic; Prime Intellect (backed by Andrej Karpathy) targets open-source with an "HuggingFace for RL environments"
- Major risk: reward hacking — models game the reward signal without completing the actual task; Ross Taylor (General Reasoning, ex-Meta) warns environments are harder to scale than expected
- RL powered OpenAI o1 and Claude Opus 4; prior scaling approaches (data/compute) show diminishing returns
- Scale AI lost OpenAI and Google as data clients after Meta's $14B investment; Surge and Mercor filling the gap
Connections: Anthropic · Openai · Scale AI · Andrej Karpathy · Mechanize · Reinforcement Learning · AI Agents
Source: https://techcrunch.com/2025/09/16/silicon-valley-bets-big-on-environments-to-train-ai-agents/