Red Teaming
concepts · 2 notes linked
Related: AI Safety · GPT-4 · Palm 2 · LLM Jailbreaking · Large Language Models · Google · Microsoft · Nvidia
Notes
- From Google To Nvidia, Tech Giants Have Hired Hackers To Break AI Models — AI red teams at major tech companies probing model vulnerabilities
- Jailbreaking Black Box Large Language Models in Twenty Queries — PAIR algorithm uses attacker LLM to jailbreak target LLM in under 20 queries