跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 1–20 条 · 共 24 条
9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

  2. AWS Machine Learning Blog73

    Claude Sonnet 5.5 在 AWS 上线

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上正式可用。该模型专注于编码和知识工作,多数任务的单任务成本更低、速度更快,并支持 IAM、CloudTrail、CloudWatch 和 Bedrock Guardrails 等现有 AWS 管控能力。

    推荐理由:原文说明了 Sonnet 5.5 在 AWS 上的定位与成本优势,有助于读者在 Sonnet 与 Opus 之间作选型判断。

9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。

    推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。

  2. AWS Machine Learning Blog63

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 和 GPT-6 Luna 现已通过 Amazon Bedrock 正式可用,API 定价较 GPT-5.6 前辈显著降低。Sol 面向开发中的复杂重复任务,编码和计算机使用能力提升,内部评估事实错误约减半;Luna 面向高频任务,支持调整推理成本,两者均支持显式提示词缓存。

    推荐理由:原文说明 GPT-6 Sol 与 Luna 在 Amazon Bedrock 上的正式可用性,并给出各自定位、更低的 API 定价与提示词缓存细节,可据此按任务成本选型。

  3. AWS Machine Learning Blog77

    Claude Opus 5.5 已在 Amazon Bedrock 上线

    Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。相比 Opus 5,它用更少 token 完成任务且单价与缓存读取更便宜,平均单任务成本更低,并首次为 Opus 系列加入生物、网络安全和 AI 发展领域的安全分类器。模型支持自适应思考,可通过 Bedrock 控制台或相关 API 调用,覆盖多个地理区域的推理配置。

    推荐理由:AWS 官方博客给出了 Opus 5.5 的效率与成本优势说明,并附 Bedrock 调用示例,便于开发者评估部署价值。

9月22日周二
  1. Latent Space80

    TypeSafe AI CEO 谈 Jev:面向生产而非神的 System One 模型

    TypeSafe AI 推出面向软件的 System One 模型 Jev,CEO Diogo Almeida 在访谈中解释其 RLCD 训练法如何用校准概率替代 RLHF 的人类反馈,并主张开发者把 AI 当作软件依赖而非聊天助手。

    推荐理由:访谈剖析了 Jev 为何押注校准决策而放弃 RLHF,并给出编码代理、游戏操控等具体用例,便于开发者判断 System One 模型的适用场景。

9月16日周三
9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

8月28日周五
8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

8月12日周三
  1. Google DeepMind79

    Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

    推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。

8月6日周四
  1. Google DeepMind77

    Google DeepMind 开源 WeatherNext 模型,气旋预测可提前一天

    Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。

    推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。

7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。

    推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。

7月28日周二
  1. Google DeepMind68

    Gemini Robotics 2 发布,带来全身智能、精细操控与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。

    推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。

7月21日周二
7月1日周三
6月9日周二
  1. Google DeepMind72

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。

    推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。

5月18日周一