跳到正文

#推理

今日 0 条
9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

9月23日周三
  1. AWS Machine Learning Blog63

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 和 GPT-6 Luna 现已通过 Amazon Bedrock 正式可用,API 定价较 GPT-5.6 前辈显著降低。Sol 面向开发中的复杂重复任务,编码和计算机使用能力提升,内部评估事实错误约减半;Luna 面向高频任务,支持调整推理成本,两者均支持显式提示词缓存。

    推荐理由:原文说明 GPT-6 Sol 与 Luna 在 Amazon Bedrock 上的正式可用性,并给出各自定位、更低的 API 定价与提示词缓存细节,可据此按任务成本选型。

9月16日周三
  1. NVIDIA Blog60

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次亮相,吞吐量最高达 GB300 的 3.7 倍

    NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 评测,在 Qwen3-VL 上吞吐量最高可达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上提升达 2.5 倍。GB300 NVL72 四机架扩展效率达 99%,软件优化较 v6.0 提升最高 1.6 倍。

    推荐理由:原文给出了 Vera Rubin 在 MLPerf 上相对 GB300 的具体吞吐提升倍数和扩展效率,读者可据此评估新一代平台在推理经济性上的实际价值。

9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

8月13日周四
  1. Microsoft Research54

    MindTopo 基准揭示多模态大语言模型的空间推理能力

    微软研究院推出 MindTopo 基准,评估多模态大语言模型对连通、封闭、排序、分离和打结等拓扑关系的理解,发现模型在静态识别上远优于交互规划。基准在五个拓扑类别上分别测试推理与规划,并在可控模拟器中提供精确真值以分离感知与规划两类失败。当前模型常在规划多步后失去结构关系或提出违反物理约束的动作,静态识别也会因漏看墙或开口而失败。

7月26日周日
5月16日周六
  1. Google DeepMind23

    Calico Life Sciences 借助 Co-Scientist 开启衰老研究新路径

    Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 梳理衰老生物学中分散的发现,提出值得检验的假设。团队在整合应激反应(ISR)研究中生成关于代谢如何调节 ISR 的新假说,并借助工具优化实验设计,实验结果对 ISR 在健康与疾病中的作用具有重要含义,计划发表。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向更长视野世界模型的基于梯度的规划

    GRASP是一种新的基于梯度的规划器,用于学习动力学(世界模型),通过将轨迹提升为虚拟状态实现时间并行优化、直接向状态迭代添加随机性进行探索、重塑梯度以避免高维视觉模型中的脆弱梯度,从而让长视野规划变得实用。这项工作针对现代世界模型在长视野规划中的病态优化、非贪心局部极小和高维空间失效问题,提出了更鲁棒的梯度规划方法。

4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布开源模型 Gemma 4,主打推理与智能体工作流

    Google DeepMind 发布开源模型 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可,31B 模型在 Arena 文本榜单位列开源模型第 3。新模型支持 140+ 语言、最高 256K 上下文、原生多模态与语音输入,可离线运行于手机等边缘设备,并兼容 Hugging Face、vLLM、Ollama 等主流工具。

    推荐理由:官方披露 Gemma 4 四个尺寸与 Apache 2.0 许可,有助于评估其智能-参数比优势和本地部署门槛。