Anthropic 发布 Sonnet 5.5,主打更快更省成本
Anthropic 发布中端模型 Sonnet 5.5,官方称其速度比上一代快30%、token消耗更慢,并在智能体编码上表现优于 Opus 5.5。该模型首次适用与 Fable 和 Opus 相同的网络安全保障,公司还计划数周内推出小模型 Haiku 新版。
Anthropic 发布中端模型 Sonnet 5.5,官方称其速度比上一代快30%、token消耗更慢,并在智能体编码上表现优于 Opus 5.5。该模型首次适用与 Fable 和 Opus 相同的网络安全保障,公司还计划数周内推出小模型 Haiku 新版。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称运行速度快 30% 以上、多数任务成本降低最多 30%,定价与 Sonnet 5 相同但各项基准均更优。
推荐理由:作者实测了 Claude Sonnet 5.5 的速度、成本与免费层表现,并与 Opus 5.5 及 ChatGPT 免费层对比,可帮助判断模型选型。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上正式可用。该模型专注于编码和知识工作,多数任务的单任务成本更低、速度更快,并支持 IAM、CloudTrail、CloudWatch 和 Bedrock Guardrails 等现有 AWS 管控能力。
推荐理由:原文说明了 Sonnet 5.5 在 AWS 上的定位与成本优势,有助于读者在 Sonnet 与 Opus 之间作选型判断。
Anthropic 发布 Claude 5.5 家族第二款模型 Sonnet 5.5,官方称其输出速度比前代快三成以上、按任务成本低最多三成,编码与知识工作多项基准接近 Opus 5.5。
Meta 推出面向企业的 AI 服务新业务部门 Meta Enterprise Platform,首批产品包括 Muse 智能体、Meta Business Agent、Muse API 和 Muse Code,由前 MongoDB CEO Chirantan Desai 负责并直接向扎克伯格汇报。
GPT-6 Sol 和 GPT-6 Luna 现已通过 Amazon Bedrock 正式可用,API 定价较 GPT-5.6 前辈显著降低。Sol 面向开发中的复杂重复任务,编码和计算机使用能力提升,内部评估事实错误约减半;Luna 面向高频任务,支持调整推理成本,两者均支持显式提示词缓存。
推荐理由:原文说明 GPT-6 Sol 与 Luna 在 Amazon Bedrock 上的正式可用性,并给出各自定位、更低的 API 定价与提示词缓存细节,可据此按任务成本选型。
TypeSafe AI 推出面向软件的 System One 模型 Jev,CEO Diogo Almeida 在访谈中解释其 RLCD 训练法如何用校准概率替代 RLHF 的人类反馈,并主张开发者把 AI 当作软件依赖而非聊天助手。
推荐理由:访谈剖析了 Jev 为何押注校准决策而放弃 RLHF,并给出编码代理、游戏操控等具体用例,便于开发者判断 System One 模型的适用场景。
AI 生成的代码仍需人工审查,RAG 并未消亡,Skills 也未能取代 MCP——GitHub 博客逐条剖析这些热点观点。作者强调代码审查责任、检索增强生成的价值,以及 Skills 与 MCP 的互补关系,并指出微调并非代码质量差的借口,这些工具应协同使用而非相互取代。
GitHub Copilot app 现在内置 diff、终端和浏览器面板,用户无需切换编辑器、终端和浏览器,即可在同一应用中审查、运行并预览智能体对代码的改动。diff 面板用绿色和红色高亮增删行,终端面板支持直接运行项目命令并多开窗口,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成后可直接在应用内接受改动并创建 pull request。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。
推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。
Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。
推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。
针对长程交互中递归摘要带来的性能损失,Berkeley AI Research提出ABBEL框架,将摘要组织为自然语言信念状态并引入信念评分以监督其信息内容。在CollabBench协作编码环境中,ABBEL将全上下文模型的性能差距缩小约50%,训练步数由100步减至50步,同时峰值上下文token大幅降低。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:官方放出三款Flash模型的token效率、速度与价格数据,可据此评估它们对规模化智能体工作流的实际价值。
Google DeepMind 发布 Gemini 3.5 系列,首批推出 3.5 Flash,主打智能体与编码,今天面向 Gemini 应用、Google 搜索 AI 模式及 Antigravity 等平台开放。
推荐理由:官方给出了 3.5 Flash 的基准成绩和开放渠道,可据此判断它在智能体任务上的速度与成本取舍。