跳到正文

全部动态

今日 0 条
9月16日周三
9月15日周二
9月11日周五
  1. GitHub Blog · AI & ML47

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器面板

    GitHub Copilot app 现在内置 diff、终端和浏览器面板,用户无需切换编辑器、终端和浏览器,即可在同一应用中审查、运行并预览智能体对代码的改动。diff 面板用绿色和红色高亮增删行,终端面板支持直接运行项目命令并多开窗口,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成后可直接在应用内接受改动并创建 pull request。

9月10日周四
  1. OpenAI News65

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,一个由 Codex harness 驱动的托管服务,支持智能体的编排、长会话和工具调用,用于构建和部署云智能体。

    推荐理由:原文点出 Agents API 的定位与三大核心能力,读者可据此判断其编排、长会话与工具调用的适用场景。

  2. OpenAI News60

    Paul Christiano 加入 OpenAI 基金会董事会

    Paul Christiano 加入 OpenAI 基金会董事会及其安全与保障委员会,带来 AI 对齐、安全和标准方面的经验。

    推荐理由:该人事任命显示 OpenAI 在安全与对齐治理上的人事布局,Paul Christiano 带来的对齐、安全和标准经验将为安全委员会提供专业支持,为关注 AI 治理动态的读者提供背景参考。

9月9日周三
9月8日周二
9月7日周一
9月6日周日
9月4日周五
9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

9月2日周三
  1. Google DeepMind73

    Google DeepMind发布Gemini智能体视频理解,token消耗最高降88%

    Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。

    推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。

9月1日周二
8月28日周五
8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

8月13日周四
  1. Microsoft Research54

    MindTopo 基准揭示多模态大语言模型的空间推理能力

    微软研究院推出 MindTopo 基准,评估多模态大语言模型对连通、封闭、排序、分离和打结等拓扑关系的理解,发现模型在静态识别上远优于交互规划。基准在五个拓扑类别上分别测试推理与规划,并在可控模拟器中提供精确真值以分离感知与规划两类失败。当前模型常在规划多步后失去结构关系或提出违反物理约束的动作,静态识别也会因漏看墙或开口而失败。

8月12日周三
  1. Google DeepMind79

    Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

    推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。

8月6日周四
  1. Google DeepMind77

    Google DeepMind 开源 WeatherNext 模型,气旋预测可提前一天

    Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。

    推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。

7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。

    推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。

7月28日周二
  1. Google DeepMind68

    Gemini Robotics 2 发布,带来全身智能、精细操控与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。

    推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。

7月26日周日
7月22日周三
7月21日周二
7月13日周一
7月7日周二
7月3日周五
  1. Google DeepMind40

    Google DeepMind 与 A24 宣布开展首创研究合作

    Google DeepMind 与 A24 宣布建立一项首创性研究合作,双方将围绕多个项目开展长期研发,帮助艺术家开发新的工作流与技巧,使未来工具由创作者塑造。此外,Google 已对 A24 进行投资,具体目标与技术成果将随合作推进而演变。

7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生成果展

    伯克利人工智能研究实验室(BAIR)发布2026届博士毕业生成果巡礼,研究方向涵盖机器人学与具身智能、大语言模型与推理、计算机视觉、生成建模、AI安全、人机交互及AI for Science等。