在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(第一部分)
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
本文演示如何在 Amazon SageMaker AI 上部署 vLLM-Omni,实现从文本提示词生成图像并动画化为短视频。方案部署两个端点:FLUX.2-klein-4B 图像生成模型运行在实时端点,Wan2.1-VACE-1.3B 视频生成模型运行在异步端点,输出 MP4 文件存储于 Amazon S3。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业用例中对浏览器工作流的准确率超过 90%。该方案结合 Amazon Bedrock AgentCore 托管代理执行,以 AgentCore Browser 提供隔离远程浏览器环境,并由 EventBridge Scheduler 调度、SNS 发送失败告警,实现完全托管的合成监控。
Amazon Textract 将 adapter ID 外部化到 AWS Systems Manager Parameter Store,实现跨账户的 adapter 生命周期自动化管理,生产更新从耗时数小时或数天的协调流程缩短至数秒,且无需应用重新部署。
Simon Willison 用 Opus 5.5 通过 vibe coding 编写了一个 Bluesky 回复机器人检测工具,可扫描任何 Bluesky 账户并匹配机器人特征。它检查的信号包括几秒内就回复其他帖子、从不发布自己的内容(或图片、链接)却持续回复高关注度用户,以及大量带问号的回复。
Simon Willison 用 Claude Opus 5.5 生成了包含 20 只新西兰鸮鹦鹉的像素动画派对页面,再让 Claude Code 通过 Playwright 自动点击并录制成 15 秒视频用于演讲闭幕。他在文中给出了完整 prompt 和 Playwright 脚本,可复用。
GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,可根据自然语言描述生成看板、清单、表单等布局,并支持双向实时更新。用户通过 `/create-canvas` 技能用纯英文描述工作流即可生成,无需手写代码,且创建后可作为扩展保存复用。
该方案在AWS上构建单一AI智能体,运行时按用户提问选择工具,对上传的视频返回自然语言答案。已分析内容的响应不到1秒,新视频初次分析需5–10分钟,代码已在GitHub开源。一家大型媒体娱乐公司采用后,对200多个多小时录音的手动审查时间减少约80%(未经独立验证)。
ChatGPT Work 和 Codex analytics 帮助团队理解 AI 使用情况和花费,识别培训需求,并将采用情况与业务结果相连。这些分析功能旨在让企业量化 AI 投入的实际业务价值,为后续优化提供依据。
GitHub Copilot app 现在内置 diff、终端和浏览器面板,用户无需切换编辑器、终端和浏览器,即可在同一应用中审查、运行并预览智能体对代码的改动。diff 面板用绿色和红色高亮增删行,终端面板支持直接运行项目命令并多开窗口,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成后可直接在应用内接受改动并创建 pull request。
César de la Fuente 的实验室用 Codex 和 ChatGPT 在活体和灭绝基因组中搜索抗菌候选分子,用于对抗耐药性感染。
GitHub Copilot 应用支持在同一项目上并行运行多个独立智能体会话,每个会话拥有独立的Git worktree和上下文,互不干扰,可随时启动新任务而无需等待。用户可通过会话视图跟踪进度,自由切换会话,减少上下文切换干扰。
文章提出一种基于分治范式的强化学习算法,不依赖时序差分(TD)学习,通过将轨迹分为两段并组合其值更新完整轨迹,理论上可将Bellman递归次数从线性降至对数。该算法无需选择n步TD中的超参数,也不受高方差影响。近期与Aditya合作,已将其扩展到目标条件RL,据作者所知是首个此类工作。