BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate
TL;DR AI
2 min readKey summary
Researchers introduced BARRED, a synthetic-data framework for training custom AI guardrail classifiers.
BARRED uses task decomposition plus debate-based verification to produce higher-fidelity policy labels.
Finetuned small language models trained on BARRED data outperformed proprietary LLMs and dedicated guardrail systems on several policies.
The approach could make task-specific safety filters cheaper, faster, and easier to scale than heavy human annotation.
