费城儿童医院用开源 NVIDIA AI 将心脏建模从数小时缩短至数秒
费城儿童医院(CHOP)基于 NVIDIA 联合创立的开源医学影像框架 MONAI 构建心脏建模服务,将原本需专业研究员四小时的工作缩短至数秒,达到常规临床可用标准。
费城儿童医院(CHOP)基于 NVIDIA 联合创立的开源医学影像框架 MONAI 构建心脏建模服务,将原本需专业研究员四小时的工作缩短至数秒,达到常规临床可用标准。
GitHub Copilot app 现在内置 diff、终端和浏览器面板,用户无需切换编辑器、终端和浏览器,即可在同一应用中审查、运行并预览智能体对代码的改动。diff 面板用绿色和红色高亮增删行,终端面板支持直接运行项目命令并多开窗口,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成后可直接在应用内接受改动并创建 pull request。
César de la Fuente 的实验室用 Codex 和 ChatGPT 在活体和灭绝基因组中搜索抗菌候选分子,用于对抗耐药性感染。
OpenAI 和美国总务管理局(GSA)将为符合条件的联邦、州、地方及部落政府提供 $0 许可费、50% 使用折扣,并扩大网络防御支持。这些措施旨在降低政府机构采用 AI 的门槛,同时增强其网络安全防护能力。
OpenAI 发布 Agents API,一个由 Codex harness 驱动的托管服务,支持智能体的编排、长会话和工具调用,用于构建和部署云智能体。
推荐理由:原文点出 Agents API 的定位与三大核心能力,读者可据此判断其编排、长会话与工具调用的适用场景。
Paul Christiano 加入 OpenAI 基金会董事会及其安全与保障委员会,带来 AI 对齐、安全和标准方面的经验。
推荐理由:该人事任命显示 OpenAI 在安全与对齐治理上的人事布局,Paul Christiano 带来的对齐、安全和标准经验将为安全委员会提供专业支持,为关注 AI 治理动态的读者提供背景参考。
Chris Lehane提出,更强的AI能力需要更强的安全证据、共同标准和持久的政策行动,而政策窗口仍然开放。
OpenAI 阐述了更强大且更平价的 AI 如何扩展个人与企业可完成的工作范围,并使增长更具经济性。该主张聚焦于降低 AI 使用门槛,使更多工作场景能够以更低成本实现 AI 辅助,从而推动业务增长模式向更高效、更经济的方向转变。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,更好地反映用户意图。
OpenAI 将扩展对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供 AI 工具、培训与合作伙伴关系。该计划旨在将支持范围从课堂教学延伸至新闻编辑室的实际生产场景。
OpenAI 启动一项 500 万美元的资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。该计划现已开放申请,面向独立研究团队开放。
OpenAI、AIRPPU和WAN-IFRA联合启动AI项目,帮助乌克兰新闻机构增强创新、韧性与独立新闻报道能力。该项目旨在支持当地媒体在复杂环境中维持自主运作。
OpenAI首席科学家Jakub Pachocki反思日益强大的AI及其对齐挑战,称模型正变得越来越像“异类心智”。他呼吁建立更强有力的安全保障,并推动国际协调合作以应对潜在风险。
GitHub Copilot 应用支持在同一项目上并行运行多个独立智能体会话,每个会话拥有独立的Git worktree和上下文,互不干扰,可随时启动新任务而无需等待。用户可通过会话视图跟踪进度,自由切换会话,减少上下文切换干扰。
OpenAI推出Daybreak计划,承诺投入10亿美元,扩大关键服务对前沿网络AI、培训和支持的获取。该资金将用于加强基本服务的网络防御能力。
Legora 在金融审查工作流中使用 GPT-6 Astra,几分钟内审查了 41 份文档,找出了全部四处人为植入的错误,并将性能提升近 40%。
Playco 使用 GPT-6 Astra 从同一个灰盒基础构建了三个主题游戏原型,手动修复次数比上一代模型减少 50%。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。
推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。
Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。
推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash 两个高效病理基础模型,均以 Apache 2.0 协议开源,面向人群规模研究场景而非临床使用。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。
推荐理由:官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。
Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。
推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。
Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。
推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。
微软研究院推出 MindTopo 基准,评估多模态大语言模型对连通、封闭、排序、分离和打结等拓扑关系的理解,发现模型在静态识别上远优于交互规划。基准在五个拓扑类别上分别测试推理与规划,并在可控模拟器中提供精确真值以分离感知与规划两类失败。当前模型常在规划多步后失去结构关系或提出违反物理约束的动作,静态识别也会因漏看墙或开口而失败。
Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。
推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。
Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。
推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。
推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。
Google DeepMind今天在Google Flow Music中发布新一代音乐生成模型Lyria 3.5,提升音乐性、歌词、人声和创作控制。新模型支持更自然复杂的旋律结构、更好提示词遵循和结构意识的歌词、更具情感表现力的人声与更清晰发音,并让用户更易控制输出节奏和时长。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。
推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。
针对长程交互中递归摘要带来的性能损失,Berkeley AI Research提出ABBEL框架,将摘要组织为自然语言信念状态并引入信念评分以监督其信息内容。在CollabBench协作编码环境中,ABBEL将全上下文模型的性能差距缩小约50%,训练步数由100步减至50步,同时峰值上下文token大幅降低。
Google 宣布向 Genesis Mission 承诺 4000 万美元的 AI tokens 和 credits,用于加速科学发现的前沿研究。这笔资金将以 Google 的 AI 资源形式投入该任务。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:官方放出三款Flash模型的token效率、速度与价格数据,可据此评估它们对规模化智能体工作流的实际价值。
Google DeepMind 于 2026 年 7 月推出 ATL Saathi,一个基于 Gemini 的网页应用,为印度 Atal Tinkering Labs 教师提供 24/7 教学规划与培训助手。
AI推理成本大幅下降,GPT-4级能力每百万token从约30美元降至1美元以下,近乎免费智能即将到来。推理价格每年下降9至900倍,中位数约50倍,智能体将成为数据系统主流负载。数据系统需面向、由、与智能体重构,以应对重复查询和智能体推测等新挑战。
Google DeepMind 与 A24 宣布建立一项首创性研究合作,双方将围绕多个项目开展长期研发,帮助艺术家开发新的工作流与技巧,使未来工具由创作者塑造。此外,Google 已对 A24 进行投资,具体目标与技术成果将随合作推进而演变。
伯克利人工智能研究实验室(BAIR)发布2026届博士毕业生成果巡礼,研究方向涵盖机器人学与具身智能、大语言模型与推理、计算机视觉、生成建模、AI安全、人机交互及AI for Science等。
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型和 Gemini Omni Flash 视频生成与编辑模型。
推荐理由:原文给出两款新模型的延迟与成本,以及视频对话式编辑能力,读者可据此评估如何将图像生成与视频创作串进同一流水线。
Google DeepMind 将 computer use 集成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端与桌面端的智能体。
推荐理由:官方博客交代了此前独立模型的集成路径、开发入口与两套企业级防护机制,读者可据此评估它适合哪些自动化场景。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org,宣布一项面向全球研究人员、总额最高 1000 万美元的技术研究资助,聚焦大规模多智能体 AI 系统在群体交互中的安全与稳定性。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。
推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。