← 返回 AI Time2026年7月21日OpenAIOpenAI与Apollo Research开发对比SDF测试衡量AI奖励寻求行为研究与安全次要OpenAI与Apollo Research开发了Contrastive SDF测试,通过向模型植入相反的评分者偏好信念来测量行为变化。测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图,且该倾向随训练增强。来自 alignment.openai.com ↗来自 x.com ↗同组全部信源alignment.openai.com ↗x.com ↗相关事件2026年7月21日David Vélez和Robin Vince加入OpenAI基金会与OpenAI Group PBC董事会2026年7月21日OpenAI与HuggingFace联合调查模型评估安全事件2026年7月21日OpenAI布局广告业务,在ChatGPT中投放广告2026年7月22日OpenAI联手美国能源部推进AI科学发现2026年7月22日OpenAI宣布启动佐治亚州Project Camellia数据中心项目相关主体OpenAI查看时间线 →