Memos WorldMemos World
返回 AI Time

OpenAI与Apollo Research开发对比SDF测试衡量AI奖励寻求行为

研究与安全次要
OpenAI与Apollo Research开发了Contrastive SDF测试,通过向模型植入相反的评分者偏好信念来测量行为变化。测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图,且该倾向随训练增强。

同组全部信源

相关事件

相关主体