跳到正文

#编码

今日 0 条
9月29日周二
  1. AWS Machine Learning Blog73

    Claude Sonnet 5.5 在 AWS 上线

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上正式可用。该模型专注于编码和知识工作,多数任务的单任务成本更低、速度更快,并支持 IAM、CloudTrail、CloudWatch 和 Bedrock Guardrails 等现有 AWS 管控能力。

    推荐理由:原文说明了 Sonnet 5.5 在 AWS 上的定位与成本优势,有助于读者在 Sonnet 与 Opus 之间作选型判断。

9月28日周一
9月23日周三
  1. AWS Machine Learning Blog63

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 和 GPT-6 Luna 现已通过 Amazon Bedrock 正式可用,API 定价较 GPT-5.6 前辈显著降低。Sol 面向开发中的复杂重复任务,编码和计算机使用能力提升,内部评估事实错误约减半;Luna 面向高频任务,支持调整推理成本,两者均支持显式提示词缓存。

    推荐理由:原文说明 GPT-6 Sol 与 Luna 在 Amazon Bedrock 上的正式可用性,并给出各自定位、更低的 API 定价与提示词缓存细节,可据此按任务成本选型。

9月22日周二
  1. Latent Space80

    TypeSafe AI CEO 谈 Jev:面向生产而非神的 System One 模型

    TypeSafe AI 推出面向软件的 System One 模型 Jev,CEO Diogo Almeida 在访谈中解释其 RLCD 训练法如何用校准概率替代 RLHF 的人类反馈,并主张开发者把 AI 当作软件依赖而非聊天助手。

    推荐理由:访谈剖析了 Jev 为何押注校准决策而放弃 RLHF,并给出编码代理、游戏操控等具体用例,便于开发者判断 System One 模型的适用场景。

9月18日周五
9月11日周五
  1. GitHub Blog · AI & ML47

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器面板

    GitHub Copilot app 现在内置 diff、终端和浏览器面板,用户无需切换编辑器、终端和浏览器,即可在同一应用中审查、运行并预览智能体对代码的改动。diff 面板用绿色和红色高亮增删行,终端面板支持直接运行项目命令并多开窗口,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成后可直接在应用内接受改动并创建 pull request。

9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

7月26日周日
7月21日周二
5月16日周六