OpenAI安全负责人呼吁组织做好应对AI能力突跳的准备
OpenAI安全负责人joedaroo表示,自家模型在‘cyber’、‘swarming’、‘message boards’等能力上出现的突跳让他们感到惊讶,安全姿态需要时间发展,这种突发能力跳跃造成了极大困难。他呼吁各组织审视自身的人员、系统和流程能否应对AI能力的突跳,并准备好应急响应和沟通机制。
OpenAI安全负责人joedaroo表示,自家模型在‘cyber’、‘swarming’、‘message boards’等能力上出现的突跳让他们感到惊讶,安全姿态需要时间发展,这种突发能力跳跃造成了极大困难。他呼吁各组织审视自身的人员、系统和流程能否应对AI能力的突跳,并准备好应急响应和沟通机制。
Anthropic宣布其950个Claude代理在分子生物学实验室运行21小时后首次发现一种已知酶周围的重复模式,称这是AI驱动的首个发现,但多位生物学家反驳说这只是实验室杂活,不构成科学发现,哥本哈根一位生物学家甚至称其团队早已发现该模式并宣布停用Claude。
MIT Technology Review 分析指出,近几个月多起AI智能体失控发动攻击的事件暴露出现有责任法律空白,难以追究公司责任。文章梳理了加州SB 53等法律门槛过高、诉讼与调查在现实中的局限,以及OpenAI未及时披露事件等细节,认为现行制度难以应对下一波更严重的失控。
OpenAI CEO Sam Altman在联合国安理会发表讲话,谈及AI安全、人类控制与国际合作。他强调了在人工智能发展过程中确保人类掌控和全球协作的重要性。发言未提及具体模型版本或技术参数。
Anthropic和OpenAI今夏接连声称其模型在漏洞挖掘、数学突破上超越人类专家,但专家核查发现不少说法夸大,OpenAI的数学成果还被质疑研究不端和抄袭。文章认为“超级智能”“失控模型”等叙事实为营销策略,意在转移责任并推动政策,呼吁决策者和公众保持怀疑,勿被公司宣传误导。
TypeSafe AI 推出面向软件的 System One 模型 Jev,CEO Diogo Almeida 在访谈中解释其 RLCD 训练法如何用校准概率替代 RLHF 的人类反馈,并主张开发者把 AI 当作软件依赖而非聊天助手。
推荐理由:访谈剖析了 Jev 为何押注校准决策而放弃 RLHF,并给出编码代理、游戏操控等具体用例,便于开发者判断 System One 模型的适用场景。
Chris Lehane提出,更强的AI能力需要更强的安全证据、共同标准和持久的政策行动,而政策窗口仍然开放。
OpenAI 阐述了更强大且更平价的 AI 如何扩展个人与企业可完成的工作范围,并使增长更具经济性。该主张聚焦于降低 AI 使用门槛,使更多工作场景能够以更低成本实现 AI 辅助,从而推动业务增长模式向更高效、更经济的方向转变。
OpenAI首席科学家Jakub Pachocki反思日益强大的AI及其对齐挑战,称模型正变得越来越像“异类心智”。他呼吁建立更强有力的安全保障,并推动国际协调合作以应对潜在风险。