Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO Paper โข 2606.09701 โข Published Jun 8 โข 1 โข 1
GPT-Red: Automated Red Teaming via Self-Play at Scale Paper โข 2607.26115 โข Published 14 days ago โข 8 โข 4