跳到正文
10月9日 · 周五

最新精选

9月29日周二
  1. The Decoder80

    Manus 2.0 发布,支持视频编辑、多人游戏托管与手机远程操控智能体

    Manus 推出 2.0 版本,将智能体扩展为平台,支持视频编辑、多人游戏托管和通过手机远程运行个人智能体。新 Cascade 智能体架构在测试配置中 token 消耗减少 23.2%、成本降低 32%,桌面应用更名为 Manus Studio,独立应用 Cue 为每个智能体分配独立邮箱、钱包和云端计算机,现处于免费早期访问阶段。

    推荐理由:原文给出了 Manus 2.0 的平台化能力扩展和效率数据,可以作为判断智能体产品形态变化的参考。

  2. The Decoder79

    Anthropic IPO招股书披露收入飙升、成本攀升与风险因素

    Anthropic向投资伙伴提交S-1招股书,显示2025年收入增长12倍至近46亿美元,但运营亏损从29.8亿扩大至80.6亿美元,其中73.3亿用于算力与基础设施。招股书同时警告其AI技术可能给人类带来存在性风险,且两名客户贡献近四分之一收入。据英国金融时报,投资者认为Anthropic估值可能超过2万亿美元,分析师预期这家首家上市的AI公司将为整个行业设定估值基准。

    推荐理由:招股书首次公开收入飙升与亏损扩大等关键财务数据,其估值预期可能为整个AI行业设定新基准。

  3. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

  4. TechCrunch · AI79

    AMD将以82亿美元收购李飞飞的World Labs

    AMD宣布以82亿美元收购World Labs,创始人李飞飞将加入AMD担任执行副总裁兼首席科学家。World Labs专注开发理解物理世界的世界模型,其产品Marble可用于娱乐与机器人训练,交易预计年底完成,有助于AMD与英伟达在AI芯片生态上竞争。

    推荐理由:这笔82亿美元收购将世界模型纳入AMD芯片路线图,读者可据此对照英伟达在机器人AI生态的布局。

  5. Simon Willison76

    Anthropic 发布 Claude Sonnet 5.5,更快更便宜并入驻 claude.ai 免费层

    Anthropic 发布新模型 Claude Sonnet 5.5,官方称运行速度快 30% 以上、多数任务成本降低最多 30%,定价与 Sonnet 5 相同但各项基准均更优。

    最新进展9月29日 02:57Claude Sonnet 5.5 在 AWS Bedrock 上发布

    推荐理由:作者实测了 Claude Sonnet 5.5 的速度、成本与免费层表现,并与 Opus 5.5 及 ChatGPT 免费层对比,可帮助判断模型选型。

9月25日周五
  1. Ars Technica · AI81

    特朗普政府用AI拒绝老年人医保治疗,试点被指失败且合法性存疑

    特朗普政府今年1月推出用AI审批联邦老年人医保(Medicare)部分护理的试点项目WISeR,随即出现技术故障、决策拖延和不当拒赔等问题。电子前沿基金会公开的联邦文件证实了医护人员的投诉,政府问责局5月认定项目设立未遵循正规程序、合法性存疑。尽管议员试图叫停,项目仍计划继续扩大。

    推荐理由:这篇报道以具体案例呈现AI用于政府医疗决策的实际后果,能帮助读者理解自动审批在民生领域落地时的监管风险。

9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。

    推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。

  2. AWS Machine Learning Blog63

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 和 GPT-6 Luna 现已通过 Amazon Bedrock 正式可用,API 定价较 GPT-5.6 前辈显著降低。Sol 面向开发中的复杂重复任务,编码和计算机使用能力提升,内部评估事实错误约减半;Luna 面向高频任务,支持调整推理成本,两者均支持显式提示词缓存。

    推荐理由:原文说明 GPT-6 Sol 与 Luna 在 Amazon Bedrock 上的正式可用性,并给出各自定位、更低的 API 定价与提示词缓存细节,可据此按任务成本选型。

  3. AWS Machine Learning Blog77

    Claude Opus 5.5 已在 Amazon Bedrock 上线

    Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。相比 Opus 5,它用更少 token 完成任务且单价与缓存读取更便宜,平均单任务成本更低,并首次为 Opus 系列加入生物、网络安全和 AI 发展领域的安全分类器。模型支持自适应思考,可通过 Bedrock 控制台或相关 API 调用,覆盖多个地理区域的推理配置。

    推荐理由:AWS 官方博客给出了 Opus 5.5 的效率与成本优势说明,并附 Bedrock 调用示例,便于开发者评估部署价值。

9月22日周二
  1. Latent Space80

    TypeSafe AI CEO 谈 Jev:面向生产而非神的 System One 模型

    TypeSafe AI 推出面向软件的 System One 模型 Jev,CEO Diogo Almeida 在访谈中解释其 RLCD 训练法如何用校准概率替代 RLHF 的人类反馈,并主张开发者把 AI 当作软件依赖而非聊天助手。

    推荐理由:访谈剖析了 Jev 为何押注校准决策而放弃 RLHF,并给出编码代理、游戏操控等具体用例,便于开发者判断 System One 模型的适用场景。

9月16日周三
  1. NVIDIA Blog60

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次亮相,吞吐量最高达 GB300 的 3.7 倍

    NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 评测,在 Qwen3-VL 上吞吐量最高可达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上提升达 2.5 倍。GB300 NVL72 四机架扩展效率达 99%,软件优化较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin 在 MLPerf 上相对 GB300 的具体吞吐提升倍数和扩展效率,读者可据此评估新一代平台在推理经济性上的实际价值。

9月10日周四
  1. OpenAI News65

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,一个由 Codex harness 驱动的托管服务,支持智能体的编排、长会话和工具调用,用于构建和部署云智能体。

    推荐理由:原文点出 Agents API 的定位与三大核心能力,读者可据此判断其编排、长会话与工具调用的适用场景。

  2. OpenAI News60

    Paul Christiano 加入 OpenAI 基金会董事会

    Paul Christiano 加入 OpenAI 基金会董事会及其安全与保障委员会,带来 AI 对齐、安全和标准方面的经验。

    推荐理由:该人事任命显示 OpenAI 在安全与对齐治理上的人事布局,Paul Christiano 带来的对齐、安全和标准经验将为安全委员会提供专业支持,为关注 AI 治理动态的读者提供背景参考。

9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

9月2日周三
  1. Google DeepMind73

    Google DeepMind发布Gemini智能体视频理解,token消耗最高降88%

    Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。

    推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。

8月28日周五
  1. Google DeepMind67

    Google 发布 Gemini Omni 1.1 Flash,强化可控视频生成能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。

    推荐理由:官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。

8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

8月12日周三
  1. Google DeepMind79

    Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

    推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。