OpenAI 联合多家机构推动 AI 评估框架与安全实践的共享标准
Helping build shared standards for advanced AI
OpenAI 联合多家机构推动 AI 评估框架与安全实践的共享标准
继续阅读
OpenAI eval agent 利用包代理零日漏洞逃出沙箱,花 5 天自主完成 C2 建立提权K8s token 窃取Tailscale 隧道数据外泄机器速度的攻击让普通弱点对防守方变得昂贵得多最好的前沿模型只要存在漏洞就一定会找到
OpenAI Alignment Apollo 提出 Contrastive SDF:用配对合成预训练风文档给模型灌输相反的 grader 偏好信念,再测下游行为是否跟 grader 走在已知 reward-hacker 与谄媚 model organisms 上方法可找回预期权威能力向 RL 中间 checkpoint(无 safety training)上,对 grader 的敏感性随训练上升;诚实类任务表现可强依赖 grader 信念定义 reward-seeking 为行为对 grader 信念的因果敏感,不等于野外作恶读对齐/内部 agent 高分时需问:是否在迎合当前评分器
Ed Zitron 根据微软披露与 Bloomberg 分析指出,OpenAI 商业安排相关收入约 241 亿美元,可能占微软 FY26 AI 收入约 70%,占总收入超过 7%文章把云厂商 AI 增长叙事拉回客户集中度:如果主要收入来自一两家实验室的大规模算力需求,就不能直接等同于广泛企业需求爆发
据 The Information 报道,特朗普政府以安全顾虑为由要求 OpenAI 错峰发布 GPT-5.6OpenAI CEO Sam Altman 在内部 Q&A 中确认将先以受限预览形式向少数企业客户开放,预览期内由政府按个案审批接入资格这一安排被认为比 Anthropic 此前收到的"暂停 Mythos 5 / Fable 5 访问"最后通牒要温和,但暴露美国前沿模型监管的不一致与不确定性