跳到正文

全部动态

今日 9 条
今天9月29日周二
  1. Microsoft Research58

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院推出面向复杂生物学研究的 AI 系统 Quine,由生物多模态世界模型与交互式实验调度框架组成。在与 Broad 研究所合作的胰腺癌研究中,系统在一个周末内预测并筛选出能诱导肿瘤细胞状态转换的候选化合物,并在湿实验中完成验证。微软同步启动了 Quine Fellows 访问计划,并计划未来通过 Microsoft Discovery 等产品逐步扩大访问权限。

  2. Hugging Face Blog50

    ProvenanceGuard:面向 MCP 智能体的溯源感知核查

    ProvenanceGuard 是针对 MCP 智能体推出的生成后事实核查层,专门解决事实正确但归因来源错误的“跨来源混淆”问题。该方案在无需重新训练模型的情况下,通过读取包含工具输出与来源 ID 的 MCP 轨迹,逐项核对声明与其归属来源是否匹配。在 361 项专家测试声明中,它成功拦截了 139 项违规声明中的 138 项,来源识别准确率达 86%。

  3. AWS Machine Learning Blog63

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 的 Grok 4.7 模型已正式登陆 Amazon Bedrock,提供 500K token 上下文窗口并支持 low 至 xhigh 四档推理强度调节。该模型主打长任务自我验证与代码及专业知识工作,在 Bedrock 上通过跨区域推理配置文件提供服务。调用端兼容 OpenAI SDK 与 AWS Converse API,同时支持隐式提示词缓存和 Bedrock Guardrails。

    推荐理由:该集成提供了跨区域推理与四档推理强度控制,开发者可直接在云端现有合规框架内调用长上下文模型。

  4. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

  5. AWS Machine Learning Blog46

    在 SageMaker AI 上利用 vLLM-Omni 构建实时语音应用 – 第 1 部分

    AWS 发布教程指导开发者利用 vLLM-Omni v1.5 深度学习容器(DLC),在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型。该方案基于 HTTP/2 全双工 WebSocket 建立持久双向连接,实现输入文本流与 24 kHz PCM 音频块流的实时互传。部署还支持配置 ml.g6.xlarge 等机型的实例池,并提供配套 Gradio 交互示例。

9月28日周一
9月26日周六
  1. GitHub Blog · AI & ML59

    GitHub Copilot 初学者指南:如何利用画布构建自定义工作流

    GitHub Copilot app 推出画布(canvases)双向交互功能,支持用户与 AI 智能体在共享界面中实时协同处理工作流。用户在会话中运行 `/create-canvas` 并用自然语言描述需求,即可直接生成看板、清单或仪表板等工具面板,无需手写代码或手动排版。生成的画布支持双方实时同步更新,可作为扩展保存共享,也可直接复用 Awesome Copilot 的社区模板。

  2. AWS Machine Learning Blog55

    AWS 详解 NarrateAI 在 Amazon Bedrock 上的大模型生产级质量保证实践

    AWS 团队详细介绍了在 Amazon Bedrock 上构建的商业智能助手 NarrateAI,通过五项工程技术实现约 99% 的数字准确率并支持实时流式响应。该系统采用自适应流水线编排将单次查询调用减少 72%,配合跨账户与多模型故障转移避免限流,并通过段落级流式并行评估将校验延迟降低 86.8%。此外,架构结合正则匹配与语义分析的两阶段级联校验,在保障数据准确性的同时控制了推理成本。

9月25日周五
  1. AWS Machine Learning Blog28

    Datacor 如何利用 Amazon Quick Sight 构建自助式租赁分析服务

    工业软件商 Datacor 将 Amazon Quick Sight 的生成式 BI 功能集成至 TrackAbout 方案,为工业气体与焊接分销商提供自助式租赁数据分析服务。用户无需依赖 IT 提交工单,即可通过自然语言提问与交互式仪表板直接洞察机队利用率和收入回收趋势。该方案目前支撑着客户对 2750 万件资产及每月超 72.5 万份账单的高效分析。

  2. AWS Machine Learning Blog34

    使用 Amazon SageMaker HyperPod 与 Qumulo 实现多区域训练

    AWS 推出结合 Amazon SageMaker HyperPod 与 Qumulo 的多区域训练方案,使计算与数据集分置不同 AWS 区域时无需复制全量数据。在 1.02B 参数 LLaMA v3 及 16 块 H100 GPU 实测中,跨区域集群经 NeuralCache 预热后吞吐量达到与本地集群相同的 115–117 samples/sec,GPU 利用率收敛至 98–100%。

  3. GitHub Blog · AI & ML60

    GitHub 撰文探讨为何聊天窗口往往不是最佳的 AI 交互界面

    GitHub 官方博客发文指出纯文本对话在具体任务中往往效率低下且浪费模型 token,主张利用可定制的轻量全栈界面替代传统聊天窗口。文章以 GitHub Copilot app 中的 canvas 为例,展示了支持双向通信、本地代码执行与自动化开发流的交互形态。作者建议让智能体去构建交互成本更低的小工具,从而帮助开发者更彻底地脱离重复盯盘的执行流程。

    推荐理由:原文通过具体案例对比了纯对话与定制全栈界面的差异,说明了让智能体构建持久化小工具以减少模型消耗的可行路径。

  4. Google Research64

    Google 发布长视频连贯生成多智能体框架研究

    Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。

    推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。

  5. Google DeepMind74

    Google DeepMind 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。

    推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。

9月24日周四
  1. NVIDIA Blog67

    开放科学如何协助科研人员应对下一场大流行病:NVIDIA 与 DeepMind 等公开病毒蛋白质复合物数据集

    NVIDIA 联合 Google DeepMind 及欧洲生物信息学研究所(EMBL-EBI)等机构,在 AlphaFold 数据库中公开了涵盖超过 2800 种病毒的蛋白质复合物三维预测结构,并同步开源了 GPU 加速的 BioNeMo 结构预测工作流。

    推荐理由:该项目开放了涵盖数千种病毒的复合物三维结构及配套加速管线,研究人员可直接复用该流程推进病毒机理研究与药物设计。

  2. GitHub Blog · AI & ML49

    GitHub Copilot 应用如何渲染超大 PR

    GitHub Copilot 应用重构了 PR 视图,成功实现包含 2,200 个文件、超 100 万行代码变更及 400 多个行内评论的极限 PR 高性能渲染。团队将文档高度拆分为确定的代码几何与动态块几何,代码行借助虚拟化技术在界面上仅同时挂载约 100 行。评审评论等不可预测高度的内容则通过惰性测量与视口锚定修正,有效解决了滚动跳动问题。

  3. AWS Machine Learning Blog60

    如何通过 Amazon Bedrock 搭配开放权重模型构建 AI 编码智能体

    AWS 介绍了如何将终端开源编码智能体 OpenCode 与 Amazon Bedrock 托管的开放权重模型结合,构建安全且按用量计费的本地开发工作流。配置支持在单会话内按任务分配模型,例如调用 Kimi K3 进行深度推理与架构排查,分配 GPT-OSS 120B 或 Nemotron 3 Super 120B 执行高吞吐代码生成。

    推荐理由:原文提供了将规划与生成分工路由到不同开源模型的具体配置,便于开发者搭建兼顾隐私与成本的终端编程工作流。

  4. Microsoft Research60

    微软研究院:把物理 AI 推理卸载出机器人可提升任务表现与续航

    微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。

    推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。