AI Safety Classifiers

concepts · 2 notes linked

Related: Zvi Mowshowitz · Anthropic · Claude · Janus · Model Welfare · AI Alignment · AI Consciousness · Interpretability

Notes