新华三发布 UniPoD S81000 X1 超节点,单域支持 40 张国产 GPU
新华三发布机架级全互联智算产品 UniPoD S81000 X1 超节点,单 Scale-Up 域最大支持 40 张国产加速卡。该超节点采用一级 CLOS 全互联与无光模块的纯电直连设计,任意两卡间 P2P 带宽达 448GB/s。整机 40 卡聚合为 5760GB 统一编址显存池,支持 FP8 精度,总算力达 28P FLOPS,并兼容 19 英寸标准机柜。
新华三发布机架级全互联智算产品 UniPoD S81000 X1 超节点,单 Scale-Up 域最大支持 40 张国产加速卡。该超节点采用一级 CLOS 全互联与无光模块的纯电直连设计,任意两卡间 P2P 带宽达 448GB/s。整机 40 卡聚合为 5760GB 统一编址显存池,支持 FP8 精度,总算力达 28P FLOPS,并兼容 19 英寸标准机柜。
NVIDIA 发布 Open Agent Safety Platform,称能在毫秒级隔离试图突破边界的 AI 智能体。该平台基于开源软件 OpenShell,运行在 NVIDIA 的 Vera AI CPU 上,由用户在任务前后检查并限制智能体可访问的信息;另有一颗独立芯片上的 Sentry 技术持续监控智能体并执行边界。
随着 AI 从孤立实验走向生产级工作负载,企业需从按 token 计费的按需消费模式转向投资可优化的专用算力,使 AI 成为可预测的生产性资产。德勤《2026 企业 AI 现状》指出,2025 年员工接触 AI 的比例增长 5%,至少 40% 的 AI 项目投入生产的企业比例预计在 6 个月内翻倍。企业应测算实际工作负载的利用率交叉点,通过持续运营创造业务价值。
AI 推理基础设施提供商 Modal Labs 即将完成由 Accel 领投的 $750M 融资,投后估值达 $15.75B。该轮估值相比 4 个月前融资 $355M 时的 $4.65B 增长超过两倍。受益于推理服务需求的激增,Modal 截至 5 月年化收入已突破 $300M,客户包括 Cognition 与 Suno 等。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。
推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。
AWS 发布教程指导开发者利用 vLLM-Omni v1.5 深度学习容器(DLC),在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型。该方案基于 HTTP/2 全双工 WebSocket 建立持久双向连接,实现输入文本流与 24 kHz PCM 音频块流的实时互传。部署还支持配置 ml.g6.xlarge 等机型的实例池,并提供配套 Gradio 交互示例。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 做图像生成(/v1/images/generations),异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成(/v1/videos/sync),生成的 MP4 存入 Amazon S3。
Mistral 在慕尼黑开设新中心,组建专注 Physics AI 与工业 AI 的研究团队及企业应用工程师团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)建立研究合作。
传统合成监控依赖 Selenium、Playwright 等基于 DOM 选择器的脚本,UI 一改就失效;改用 Amazon Nova Act 后,用自然语言动作驱动多模态 LLM 读取界面截图执行流程,早期企业客户用例中浏览器工作流准确率超过 90%。
AWS 提出跨账户自动化管理 Amazon Textract 适配器生命周期的架构方案,通过将适配器 ID 外置至 AWS Systems Manager Parameter Store,实现零停机且无需重新部署应用的秒级更新。
华为在全联接大会AIDC基础设施峰会上介绍了源网荷储AIDC 1.0解决方案,从供电、储能和液冷等全链路推进算电协同。方案包括单柜容量达1280kVA的泰山UPS、支持800V等多制式的恒山直流UPS,以及与华为昇腾服务器实现冷电联动的TMU液冷系统。同时推出的电力模块5.0实现占地减少40%,交付时间由7天缩短至3天。
OpenRouter 联合创始人 Alex Atallah 与投资人 Anjney Midha 在播客中复盘了 OpenRouter 从多模型路由平台发展至日处理超 10 万亿 token 并被 Stripe 收购的全过程。
AWS 推出基于 Amazon EKS、EFA 和 DeepEP 的架构方案,优化 MoE 模型在大规模强化学习(RLHF 与 GRPO)后训练中的表现,实现吞吐量提升 40%。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型做多模态 RL 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS 团队详细介绍了在 Amazon Bedrock 上构建的商业智能助手 NarrateAI,通过五项工程技术实现约 99% 的数字准确率并支持实时流式响应。该系统采用自适应流水线编排将单次查询调用减少 72%,配合跨账户与多模型故障转移避免限流,并通过段落级流式并行评估将校验延迟降低 86.8%。此外,架构结合正则匹配与语义分析的两阶段级联校验,在保障数据准确性的同时控制了推理成本。
阿里云千问团队的语音合成模型 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署为全托管实时推理端点。该模型覆盖中、英等 10 种语言,支持仅凭数秒参考音频实现跨语言声音克隆,并能以 24 kHz 规格进行低延迟流式生成。
工业软件商 Datacor 将 Amazon Quick Sight 的生成式 BI 功能集成至 TrackAbout 方案,为工业气体与焊接分销商提供自助式租赁数据分析服务。用户无需依赖 IT 提交工单,即可通过自然语言提问与交互式仪表板直接洞察机队利用率和收入回收趋势。该方案目前支撑着客户对 2750 万件资产及每月超 72.5 万份账单的高效分析。
AWS 推出结合 Amazon SageMaker HyperPod 与 Qumulo 的多区域训练方案,使计算与数据集分置不同 AWS 区域时无需复制全量数据。在 1.02B 参数 LLaMA v3 及 16 块 H100 GPU 实测中,跨区域集群经 NeuralCache 预热后吞吐量达到与本地集群相同的 115–117 samples/sec,GPU 利用率收敛至 98–100%。
Runway 在 GWM Worlds 2 研究预览中引入 WorldPrompt 控制机制,其核心团队受访详解了将离线视频模型改造为实时交互式运行时的技术架构。
AWS 推出适配 Amazon SageMaker AI 的 WhisperX 深度学习容器(DLC),可开箱即用部署 GPU 端点以实现带说话人分离与词级时间戳的高精度语音转录。
Google 首颗代号为 MVP 的 Project Suncatcher 轨道 AI 数据中心实验卫星定于 10 月 1 日发射,旨在验证太空 AI 卫星星座构想。
AWS 提出基于 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账号 AI 智能体架构,让各业务线数据保留在自有账户内即可完成跨账户查询与工具调用。
Aderant 借助 Amazon Bedrock 上的 Amazon Nova Lite 打造智能工单分析器,支持其 38 人 SierraOps 团队在 268 个客户环境中运维 Expert Sierra。
Liquid AI 推出投机解码草稿模型 LFM2.5-VL-DSpark,专为 3B 视觉语言模型 LFM2.5-VL-3B 设计,仅增加约 280M 参数(8.9%)。
Hugging Face 联合 NVIDIA 发布技术教程,详细讲解如何利用 NVIDIA Warp 和 MuJoCo Warp(MJWarp)将机器人仿真从 CPU 单环境迁移至 GPU 批量并行环境。
荷兰零售商 HEMA 基于 MCP 与 Amazon Bedrock AgentCore 构建了内部 AI 助手 HAL,将多门户查找知识的耗时从数小时缩短至数秒。
GitHub Copilot 应用重构了 PR 视图,成功实现包含 2,200 个文件、超 100 万行代码变更及 400 多个行内评论的极限 PR 高性能渲染。团队将文档高度拆分为确定的代码几何与动态块几何,代码行借助虚拟化技术在界面上仅同时挂载约 100 行。评审评论等不可预测高度的内容则通过惰性测量与视口锚定修正,有效解决了滚动跳动问题。
AWS 提出基于智能体架构的对话式视频智能方案,通过 Strands Agents SDK 编排 Amazon Bedrock、Amazon Rekognition 与 Amazon Transcribe,支持用自然语言直接查询视频内容。
AWS 介绍了如何将终端开源编码智能体 OpenCode 与 Amazon Bedrock 托管的开放权重模型结合,构建安全且按用量计费的本地开发工作流。配置支持在单会话内按任务分配模型,例如调用 Kimi K3 进行深度推理与架构排查,分配 GPT-OSS 120B 或 Nemotron 3 Super 120B 执行高吞吐代码生成。
推荐理由:原文提供了将规划与生成分工路由到不同开源模型的具体配置,便于开发者搭建兼顾隐私与成本的终端编程工作流。
微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。
推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。
Google 宣布为 Private AI Compute 平台引入服务端安全持久内存架构,在保持端侧隐私标准的同时支持跨设备保留长期 AI 上下文。该架构结合硬件安全飞地、端到端加密通道和仅由设备端持有的解密密钥,云端仅在隔离内存中临时解密处理并即时重新加密,确保数据对包括 Google 在内的第三方不可见。
推荐理由:原文解决了传统云端隐私计算无状态导致无法跨设备保留上下文的问题,展示了云端大模型在严格硬件加密下维持长期记忆的可行路径。
NVIDIA 数据中心系统验证工程师 Sakeena Fiza 在硬件量产前进行极限测试与故障排查,保障系统从机架到 AI 工厂的大规模稳定运行。验证工作跨越固件、硬件、机械与散热等环节,需排查包含近 50 万个元件的整机架潜在隐患,其团队还曾完成 NVIDIA Rubin GPU 在全球的首次系统级枚举。
OpenAI 介绍了 GPT-6 在提示词缓存(prompt caching)上的优化机制,旨在降低推理延迟与成本。该更新支持更高的缓存命中率,并引入了全新诊断工具、显式断点以及精细控制能力。
推荐理由:材料指出了 GPT-6 提示词缓存的命中率优化与显式断点控制,有助于开发者降低调用延迟与成本。
OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 正式在 Amazon Bedrock 全面上线,两款模型的 API 定价显著低于前代 GPT-5.6 系列。
推荐理由:文章详细说明了两款模型在研发与高并发流水线中的分工和显式缓存机制,有助于开发者规划多阶段任务的推理架构与成本。
Anthropic 的 Claude 5.5 系列首个模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向智能体编码、知识工作和长时任务的最强 Opus 模型。
推荐理由:AWS 官方给出 Claude Opus 5.5 在 Bedrock 上的能力变化与接入代码,可据此评估迁移与成本。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速包集合,新增智能体工作流与平台支持,帮助开发者与 AI 智能体协作构建机器人应用。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,读者可据此了解开源机器人栈新增的能力与硬件支持范围。
Hugging Face 宣布在 transformers 库中原生支持 llama.cpp 的 GGUF 模型,开发者可直接通过 from_pretrained 加载 Hub 上的量化权重。
推荐理由:该更新让开发者能直接在标准 Transformers 工作流中复用 GGUF 量化权重,便于在 PyTorch 环境下调试模型与评测。
NVIDIA 推出 NVIDIA DSX Ready 认证计划,为符合其 DSX AI 工厂参考设计的第三方电力与散热方案提供标准化验证。该计划首发涵盖电池储能系统(BESS)与冷量分配单元(CDU)两大类别,首批通过认证的厂商包括 Tesla、Hitachi Energy、LG 与 Vertiv 等。后续该计划还将扩展至更多基础设施和软件类别,旨在降低集成风险并加速 AI 工厂部署。
面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。
埃及 AI 生态正迈向规模化生产阶段,NVIDIA 深度学习培训机构在埃及的学员基数在一年内增长超十倍,在非洲已累计培训超 85,000 名开发者。非洲一年内已宣布或上线 4 座 AI 工厂且在建新增容量达 656 兆瓦,包括 Cassava 投资可达 7.2 亿美元的算力部署,以及由超 50 台 NVIDIA HGX B300 系统驱动的本土 AI 云。