跳到正文

#部署/工程

今日 7 条
今天9月29日周二
  1. IT之家35

    新华三发布 UniPoD S81000 X1 超节点,单域支持 40 张国产 GPU

    新华三发布机架级全互联智算产品 UniPoD S81000 X1 超节点,单 Scale-Up 域最大支持 40 张国产加速卡。该超节点采用一级 CLOS 全互联与无光模块的纯电直连设计,任意两卡间 P2P 带宽达 448GB/s。整机 40 卡聚合为 5760GB 统一编址显存池,支持 FP8 精度,总算力达 28P FLOPS,并兼容 19 英寸标准机柜。

  2. MIT Technology Review · AI23

    让 AI 成为资产而非开销

    随着 AI 从孤立实验走向生产级工作负载,企业需从按 token 计费的按需消费模式转向投资可优化的专用算力,使 AI 成为可预测的生产性资产。德勤《2026 企业 AI 现状》指出,2025 年员工接触 AI 的比例增长 5%,至少 40% 的 AI 项目投入生产的企业比例预计在 6 个月内翻倍。企业应测算实际工作负载的利用率交叉点,通过持续运营创造业务价值。

  3. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

  4. AWS Machine Learning Blog46

    在 SageMaker AI 上利用 vLLM-Omni 构建实时语音应用 – 第 1 部分

    AWS 发布教程指导开发者利用 vLLM-Omni v1.5 深度学习容器(DLC),在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型。该方案基于 HTTP/2 全双工 WebSocket 建立持久双向连接,实现输入文本流与 24 kHz PCM 音频块流的实时互传。部署还支持配置 ml.g6.xlarge 等机型的实例池,并提供配套 Gradio 交互示例。

9月28日周一
  1. 量子位44

    华为全联接大会归来,正重新定义AIDC基础设施

    华为在全联接大会AIDC基础设施峰会上介绍了源网荷储AIDC 1.0解决方案,从供电、储能和液冷等全链路推进算电协同。方案包括单柜容量达1280kVA的泰山UPS、支持800V等多制式的恒山直流UPS,以及与华为昇腾服务器实现冷电联动的TMU液冷系统。同时推出的电力模块5.0实现占地减少40%,交付时间由7天缩短至3天。

9月26日周六
  1. AWS Machine Learning Blog55

    AWS 详解 NarrateAI 在 Amazon Bedrock 上的大模型生产级质量保证实践

    AWS 团队详细介绍了在 Amazon Bedrock 上构建的商业智能助手 NarrateAI,通过五项工程技术实现约 99% 的数字准确率并支持实时流式响应。该系统采用自适应流水线编排将单次查询调用减少 72%,配合跨账户与多模型故障转移避免限流,并通过段落级流式并行评估将校验延迟降低 86.8%。此外,架构结合正则匹配与语义分析的两阶段级联校验,在保障数据准确性的同时控制了推理成本。

9月25日周五
  1. AWS Machine Learning Blog28

    Datacor 如何利用 Amazon Quick Sight 构建自助式租赁分析服务

    工业软件商 Datacor 将 Amazon Quick Sight 的生成式 BI 功能集成至 TrackAbout 方案,为工业气体与焊接分销商提供自助式租赁数据分析服务。用户无需依赖 IT 提交工单,即可通过自然语言提问与交互式仪表板直接洞察机队利用率和收入回收趋势。该方案目前支撑着客户对 2750 万件资产及每月超 72.5 万份账单的高效分析。

  2. AWS Machine Learning Blog34

    使用 Amazon SageMaker HyperPod 与 Qumulo 实现多区域训练

    AWS 推出结合 Amazon SageMaker HyperPod 与 Qumulo 的多区域训练方案,使计算与数据集分置不同 AWS 区域时无需复制全量数据。在 1.02B 参数 LLaMA v3 及 16 块 H100 GPU 实测中,跨区域集群经 NeuralCache 预热后吞吐量达到与本地集群相同的 115–117 samples/sec,GPU 利用率收敛至 98–100%。

9月24日周四
  1. GitHub Blog · AI & ML49

    GitHub Copilot 应用如何渲染超大 PR

    GitHub Copilot 应用重构了 PR 视图,成功实现包含 2,200 个文件、超 100 万行代码变更及 400 多个行内评论的极限 PR 高性能渲染。团队将文档高度拆分为确定的代码几何与动态块几何,代码行借助虚拟化技术在界面上仅同时挂载约 100 行。评审评论等不可预测高度的内容则通过惰性测量与视口锚定修正,有效解决了滚动跳动问题。

  2. AWS Machine Learning Blog60

    如何通过 Amazon Bedrock 搭配开放权重模型构建 AI 编码智能体

    AWS 介绍了如何将终端开源编码智能体 OpenCode 与 Amazon Bedrock 托管的开放权重模型结合,构建安全且按用量计费的本地开发工作流。配置支持在单会话内按任务分配模型,例如调用 Kimi K3 进行深度推理与架构排查,分配 GPT-OSS 120B 或 Nemotron 3 Super 120B 执行高吞吐代码生成。

    推荐理由:原文提供了将规划与生成分工路由到不同开源模型的具体配置,便于开发者搭建兼顾隐私与成本的终端编程工作流。

  3. Microsoft Research60

    微软研究院:把物理 AI 推理卸载出机器人可提升任务表现与续航

    微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。

    推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。

  4. Google DeepMind61

    Google 推出 Private AI Compute 安全服务端内存架构,实现跨设备持久 AI 记忆

    Google 宣布为 Private AI Compute 平台引入服务端安全持久内存架构,在保持端侧隐私标准的同时支持跨设备保留长期 AI 上下文。该架构结合硬件安全飞地、端到端加密通道和仅由设备端持有的解密密钥,云端仅在隔离内存中临时解密处理并即时重新加密,确保数据对包括 Google 在内的第三方不可见。

    推荐理由:原文解决了传统云端隐私计算无状态导致无法跨设备保留上下文的问题,展示了云端大模型在严格硬件加密下维持长期记忆的可行路径。

9月23日周三
  1. NVIDIA Blog25

    Sakeena Fiza 助力 NVIDIA 硬件实现规模化成功

    NVIDIA 数据中心系统验证工程师 Sakeena Fiza 在硬件量产前进行极限测试与故障排查,保障系统从机架到 AI 工厂的大规模稳定运行。验证工作跨越固件、硬件、机械与散热等环节,需排查包含近 50 万个元件的整机架潜在隐患,其团队还曾完成 NVIDIA Rubin GPU 在全球的首次系统级枚举。

  2. OpenAI News60

    GPT-6 改进提示词缓存机制

    OpenAI 介绍了 GPT-6 在提示词缓存(prompt caching)上的优化机制,旨在降低推理延迟与成本。该更新支持更高的缓存命中率,并引入了全新诊断工具、显式断点以及精细控制能力。

    推荐理由:材料指出了 GPT-6 提示词缓存的命中率优化与显式断点控制,有助于开发者降低调用延迟与成本。

9月22日周二
  1. NVIDIA Blog46

    NVIDIA 推出 DSX Ready 认证计划,规范 AI 工厂电力与散热产品

    NVIDIA 推出 NVIDIA DSX Ready 认证计划,为符合其 DSX AI 工厂参考设计的第三方电力与散热方案提供标准化验证。该计划首发涵盖电池储能系统(BESS)与冷量分配单元(CDU)两大类别,首批通过认证的厂商包括 Tesla、Hitachi Energy、LG 与 Vertiv 等。后续该计划还将扩展至更多基础设施和软件类别,旨在降低集成风险并加速 AI 工厂部署。

  2. NVIDIA Blog49

    NVIDIA:为什么规模化部署物理 AI 需要全层级安全

    面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。

  3. NVIDIA Blog35

    从赋能到落地:埃及 AI 生态迈向生产级规模

    埃及 AI 生态正迈向规模化生产阶段,NVIDIA 深度学习培训机构在埃及的学员基数在一年内增长超十倍,在非洲已累计培训超 85,000 名开发者。非洲一年内已宣布或上线 4 座 AI 工厂且在建新增容量达 656 兆瓦,包括 Cassava 投资可达 7.2 亿美元的算力部署,以及由超 50 台 NVIDIA HGX B300 系统驱动的本土 AI 云。