跳到正文

#部署/工程

今日 3 条
今天9月29日周二
  1. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

  2. AWS Machine Learning Blog46

    在 SageMaker AI 上利用 vLLM-Omni 构建实时语音应用 – 第 1 部分

    AWS 发布教程指导开发者利用 vLLM-Omni v1.5 深度学习容器(DLC),在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型。该方案基于 HTTP/2 全双工 WebSocket 建立持久双向连接,实现输入文本流与 24 kHz PCM 音频块流的实时互传。部署还支持配置 ml.g6.xlarge 等机型的实例池,并提供配套 Gradio 交互示例。

9月28日周一
9月26日周六
  1. AWS Machine Learning Blog55

    AWS 详解 NarrateAI 在 Amazon Bedrock 上的大模型生产级质量保证实践

    AWS 团队详细介绍了在 Amazon Bedrock 上构建的商业智能助手 NarrateAI,通过五项工程技术实现约 99% 的数字准确率并支持实时流式响应。该系统采用自适应流水线编排将单次查询调用减少 72%,配合跨账户与多模型故障转移避免限流,并通过段落级流式并行评估将校验延迟降低 86.8%。此外,架构结合正则匹配与语义分析的两阶段级联校验,在保障数据准确性的同时控制了推理成本。

9月25日周五
  1. AWS Machine Learning Blog28

    Datacor 如何利用 Amazon Quick Sight 构建自助式租赁分析服务

    工业软件商 Datacor 将 Amazon Quick Sight 的生成式 BI 功能集成至 TrackAbout 方案,为工业气体与焊接分销商提供自助式租赁数据分析服务。用户无需依赖 IT 提交工单,即可通过自然语言提问与交互式仪表板直接洞察机队利用率和收入回收趋势。该方案目前支撑着客户对 2750 万件资产及每月超 72.5 万份账单的高效分析。

  2. AWS Machine Learning Blog34

    使用 Amazon SageMaker HyperPod 与 Qumulo 实现多区域训练

    AWS 推出结合 Amazon SageMaker HyperPod 与 Qumulo 的多区域训练方案,使计算与数据集分置不同 AWS 区域时无需复制全量数据。在 1.02B 参数 LLaMA v3 及 16 块 H100 GPU 实测中,跨区域集群经 NeuralCache 预热后吞吐量达到与本地集群相同的 115–117 samples/sec,GPU 利用率收敛至 98–100%。

9月24日周四
  1. GitHub Blog · AI & ML49

    GitHub Copilot 应用如何渲染超大 PR

    GitHub Copilot 应用重构了 PR 视图,成功实现包含 2,200 个文件、超 100 万行代码变更及 400 多个行内评论的极限 PR 高性能渲染。团队将文档高度拆分为确定的代码几何与动态块几何,代码行借助虚拟化技术在界面上仅同时挂载约 100 行。评审评论等不可预测高度的内容则通过惰性测量与视口锚定修正,有效解决了滚动跳动问题。

  2. AWS Machine Learning Blog60

    如何通过 Amazon Bedrock 搭配开放权重模型构建 AI 编码智能体

    AWS 介绍了如何将终端开源编码智能体 OpenCode 与 Amazon Bedrock 托管的开放权重模型结合,构建安全且按用量计费的本地开发工作流。配置支持在单会话内按任务分配模型,例如调用 Kimi K3 进行深度推理与架构排查,分配 GPT-OSS 120B 或 Nemotron 3 Super 120B 执行高吞吐代码生成。

    推荐理由:原文提供了将规划与生成分工路由到不同开源模型的具体配置,便于开发者搭建兼顾隐私与成本的终端编程工作流。

  3. Microsoft Research60

    微软研究院:把物理 AI 推理卸载出机器人可提升任务表现与续航

    微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。

    推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。

  4. Google DeepMind61

    Google 推出 Private AI Compute 安全服务端内存架构,实现跨设备持久 AI 记忆

    Google 宣布为 Private AI Compute 平台引入服务端安全持久内存架构,在保持端侧隐私标准的同时支持跨设备保留长期 AI 上下文。该架构结合硬件安全飞地、端到端加密通道和仅由设备端持有的解密密钥,云端仅在隔离内存中临时解密处理并即时重新加密,确保数据对包括 Google 在内的第三方不可见。

    推荐理由:原文解决了传统云端隐私计算无状态导致无法跨设备保留上下文的问题,展示了云端大模型在严格硬件加密下维持长期记忆的可行路径。

9月23日周三
  1. NVIDIA Blog25

    Sakeena Fiza 助力 NVIDIA 硬件实现规模化成功

    NVIDIA 数据中心系统验证工程师 Sakeena Fiza 在硬件量产前进行极限测试与故障排查,保障系统从机架到 AI 工厂的大规模稳定运行。验证工作跨越固件、硬件、机械与散热等环节,需排查包含近 50 万个元件的整机架潜在隐患,其团队还曾完成 NVIDIA Rubin GPU 在全球的首次系统级枚举。

  2. OpenAI News60

    GPT-6 改进提示词缓存机制

    OpenAI 介绍了 GPT-6 在提示词缓存(prompt caching)上的优化机制,旨在降低推理延迟与成本。该更新支持更高的缓存命中率,并引入了全新诊断工具、显式断点以及精细控制能力。

    推荐理由:材料指出了 GPT-6 提示词缓存的命中率优化与显式断点控制,有助于开发者降低调用延迟与成本。

9月22日周二
  1. NVIDIA Blog46

    NVIDIA 推出 DSX Ready 认证计划,规范 AI 工厂电力与散热产品

    NVIDIA 推出 NVIDIA DSX Ready 认证计划,为符合其 DSX AI 工厂参考设计的第三方电力与散热方案提供标准化验证。该计划首发涵盖电池储能系统(BESS)与冷量分配单元(CDU)两大类别,首批通过认证的厂商包括 Tesla、Hitachi Energy、LG 与 Vertiv 等。后续该计划还将扩展至更多基础设施和软件类别,旨在降低集成风险并加速 AI 工厂部署。

  2. NVIDIA Blog49

    NVIDIA:为什么规模化部署物理 AI 需要全层级安全

    面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。

  3. NVIDIA Blog35

    从赋能到落地:埃及 AI 生态迈向生产级规模

    埃及 AI 生态正迈向规模化生产阶段,NVIDIA 深度学习培训机构在埃及的学员基数在一年内增长超十倍,在非洲已累计培训超 85,000 名开发者。非洲一年内已宣布或上线 4 座 AI 工厂且在建新增容量达 656 兆瓦,包括 Cassava 投资可达 7.2 亿美元的算力部署,以及由超 50 台 NVIDIA HGX B300 系统驱动的本土 AI 云。

9月21日周一
  1. NVIDIA Blog47

    NVIDIA:AI 安全是一个工程问题,如何在 AI 智能体技术栈各层构建防护

    NVIDIA 强调 AI 安全是需在模型、工作流及运行时全栈设立强制边界的工程问题,并开源了安全运行时 OpenShell。OpenShell 独立于智能体自身的推理决策提供沙箱执行环境,从底层管控文件、网络和系统资源访问。Cisco 的 DefenseClaw 与 JFrog 已接入该架构,分别提供治理层以及技能扫描和策略控制支持。

  2. Hugging Face Blog45

    像物理学家一样剪枝大语言模型:将块删除建模为伊辛优化问题

    新研究将大语言模型的 Transformer 块剪枝建模为约束二进制优化与伊辛玻璃问题,通过最小化能量确定最优删除组合。该方法利用 Hessian 矩阵捕捉层间耦合相互作用,无需逐一运行基准测试即可低成本评估海量配置。在 Llama-3.3-70B-Instruct 的 50% 压缩测试中,其 MMLU 得分比现有最佳块删除方法高出近 23 个百分点。

  3. Hugging Face Blog61

    Hugging Face 发布 tokenizers v1 候选版:编码速度提升 3 至 30 倍

    Hugging Face 推出 tokenizers v1 候选版本,在完全保持原有输出 token ID 与 API 兼容的前提下,将十个模型家族的单线程编码速度提升了 3 至 30 倍。

    推荐理由:原文系统拆解了通过位流指令替代正则切分与无分配合并循环等工程优化,对高吞吐文本处理工作流具有实用参考价值。

9月17日周四
9月16日周三
  1. NVIDIA Blog48

    Emerald AI、Google 与 NVIDIA 联合成立联盟推进灵活 AI 数据中心

    Emerald AI、Google 与 NVIDIA 宣布联合成立 AI 能源管理联盟(AEMA),旨在推进可根据电网状况动态调节用电的灵活 AI 数据中心。该联盟通过转移计算负载、储能放电及配套发电等方式使数据中心转变为可控资源,从而更高效地利用电网容量并缩短并网周期。AEMA 坚持技术中立原则,重点制定性能指标、应急响应规则与数据共享标准。

  2. NVIDIA Blog53

    NVIDIA 详解 DSX AI 工厂方案:固定电力预算下 Token 吞吐提升 24%

    NVIDIA 披露了针对 AI 工厂的 DSX 架构套件实测数据,通过动态电力分配与电网协同调度最大化算力产出。云服务商 Lambda 在 HGX B200 集群上验证 DSX MaxLPS,在相同电力预算下将集群 Token 吞吐量提升 24%,每瓦性能提高 23%。同时结合电网响应系统,可在外部电力紧张时自动降低功耗并保持高优先级推理作业稳定运行。