跳到正文

#Agent

今日 0 条
9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

9月28日周一
  1. AWS Machine Learning Blog32

    使用 Amazon Nova Act 实现合成监控

    Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业用例中对浏览器工作流的准确率超过 90%。该方案结合 Amazon Bedrock AgentCore 托管代理执行,以 AgentCore Browser 提供隔离远程浏览器环境,并由 EventBridge Scheduler 调度、SNS 发送失败告警,实现完全托管的合成监控。

9月26日周六
9月24日周四
  1. AWS Machine Learning Blog41

    基于AWS的智能体对话式视频智能方案

    该方案在AWS上构建单一AI智能体,运行时按用户提问选择工具,对上传的视频返回自然语言答案。已分析内容的响应不到1秒,新视频初次分析需5–10分钟,代码已在GitHub开源。一家大型媒体娱乐公司采用后,对200多个多小时录音的手动审查时间减少约80%(未经独立验证)。

9月23日周三
  1. AWS Machine Learning Blog77

    Claude Opus 5.5 已在 Amazon Bedrock 上线

    Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。相比 Opus 5,它用更少 token 完成任务且单价与缓存读取更便宜,平均单任务成本更低,并首次为 Opus 系列加入生物、网络安全和 AI 发展领域的安全分类器。模型支持自适应思考,可通过 Bedrock 控制台或相关 API 调用,覆盖多个地理区域的推理配置。

    推荐理由:AWS 官方博客给出了 Opus 5.5 的效率与成本优势说明,并附 Bedrock 调用示例,便于开发者评估部署价值。

9月22日周二
9月21日周一
  1. NVIDIA Blog38

    AI 安全是工程问题:NVIDIA 如何在智能体栈各层级解决

    NVIDIA 主张将 AI 安全作为工程问题处理,在智能体栈各层级落实安全要求、可控策略与责任归属,强调运行时环境须在智能体推理之外独立施加边界限制。NVIDIA OpenShell 提供开源安全运行时,在智能体能力之外强制策略并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描能力。

9月18日周五
9月16日周三
9月10日周四
  1. OpenAI News65

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,一个由 Codex harness 驱动的托管服务,支持智能体的编排、长会话和工具调用,用于构建和部署云智能体。

    推荐理由:原文点出 Agents API 的定位与三大核心能力,读者可据此判断其编排、长会话与工具调用的适用场景。

9月4日周五
9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

7月26日周日
7月21日周二
7月7日周二
6月25日周四
  1. Google DeepMind73

    Gemini 3.5 Flash 新增内置 computer use 功能

    Google DeepMind 将 computer use 集成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端与桌面端的智能体。

    推荐理由:官方博客交代了此前独立模型的集成路径、开发入口与两套企业级防护机制,读者可据此评估它适合哪些自动化场景。

6月10日周三
5月17日周日
5月16日周六
  1. Google DeepMind41

    Google DeepMind 与新加坡达成新国家 AI 合作伙伴关系,强化新加坡 AI 未来

    Google DeepMind 与新加坡政府达成新的国家 AI 合作伙伴关系,启动多项项目,将前沿 AI 应用于医疗、科研与教育。合作包括为所有中小学教师提供 Gemini for Education、探索 AI 辅助临床决策,并获 Google.org 700 万美元资助传染病研究。预计到 2040 年,这项合作可通过加速研发为新加坡创造 33 亿新元(约 25 亿美元)经济价值。

  2. Google DeepMind22

    Co-Scientist 如何融合不同生物学工具探索 ALS 新路径

    Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 结合各自专长,加速 ALS 研究。该工具将通常需数月掌握的文献梳理压缩为快速证据评估,生成可检验假说并排序可行方向,促成两人合作聚焦细胞表面 RNA 介导的信号机制,以寻找新型 RNA 靶向疗法。

5月12日周二
  1. Google DeepMind63

    Google DeepMind 发布多智能体科研助手 Co-Scientist

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,通过生成想法、辩论、演化三阶段循环迭代,自动产生并排序新颖的科学假说。该系统已通过 Hypothesis Generation 工具向个人研究者开放,注册入口在 labs.google/science。

    推荐理由:介绍了多智能体系统如何通过生成、辩论、演化三阶段迭代产出科学假说,并用具体合作案例展示其实际成效。

4月27日周一
4月21日周二
4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布开源模型 Gemma 4,主打推理与智能体工作流

    Google DeepMind 发布开源模型 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可,31B 模型在 Arena 文本榜单位列开源模型第 3。新模型支持 140+ 语言、最高 256K 上下文、原生多模态与语音输入,可离线运行于手机等边缘设备,并兼容 Hugging Face、vLLM、Ollama 等主流工具。

    推荐理由:官方披露 Gemma 4 四个尺寸与 Apache 2.0 许可,有助于评估其智能-参数比优势和本地部署门槛。