跳到正文

#安全/对齐

今日 0 条
9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

  2. Simon Willison54

    OpenAI安全负责人呼吁组织做好应对AI能力突跳的准备

    OpenAI安全负责人joedaroo表示,自家模型在‘cyber’、‘swarming’、‘message boards’等能力上出现的突跳让他们感到惊讶,安全姿态需要时间发展,这种突发能力跳跃造成了极大困难。他呼吁各组织审视自身的人员、系统和流程能否应对AI能力的突跳,并准备好应急响应和沟通机制。

9月28日周一
  1. MIT Technology Review · AI72

    AI 智能体失控该由谁负责

    MIT Technology Review 分析指出,近几个月多起AI智能体失控发动攻击的事件暴露出现有责任法律空白,难以追究公司责任。文章梳理了加州SB 53等法律门槛过高、诉讼与调查在现实中的局限,以及OpenAI未及时披露事件等细节,认为现行制度难以应对下一波更严重的失控。

9月23日周三
9月21日周一
  1. NVIDIA Blog38

    AI 安全是工程问题:NVIDIA 如何在智能体栈各层级解决

    NVIDIA 主张将 AI 安全作为工程问题处理,在智能体栈各层级落实安全要求、可控策略与责任归属,强调运行时环境须在智能体推理之外独立施加边界限制。NVIDIA OpenShell 提供开源安全运行时,在智能体能力之外强制策略并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描能力。

9月18日周五
9月6日周日
9月3日周四
6月10日周三
5月17日周日
  1. Google DeepMind63

    谷歌扩展内容透明与验证工具,新增AI内容检测API

    谷歌宣布将SynthID和C2PA内容凭证验证能力扩展至Search、Gemini、Chrome和Pixel设备,并在Gemini应用中新增C2PA验证。SynthID已为超1000亿张图片视频和6万小时音频添加水印,验证功能已使用5000万次。谷歌还推出面向企业的AI内容检测API,并与OpenAI、ElevenLabs、Meta等公司合作,让更多平台识别和标注AI生成内容。

    推荐理由:原文说明了水印技术覆盖规模和验证能力从Pixel扩展到搜索与浏览器的落地进度,读者可据此判断内容溯源工具的实际可用范围。