DeepSeek Harness 桌面端预览版 v0.2 发布,支持插件安装与自动化任务
DeepSeek Harness 桌面端预览版 v0.2 正式发布,上线 macOS 和 Windows 安装包,新增插件安装与自动化任务管理。新版本支持在插件管理界面直接输入 npm 包名安装插件,内置可按计划定时执行的自动化任务插件,并优化了文件内容预览与代码修改差异展示。此外,用户在实验性创造模式下可通过对话让其编写和修改插件,官方后续还将建设插件市场并适配新模型。
DeepSeek Harness 桌面端预览版 v0.2 正式发布,上线 macOS 和 Windows 安装包,新增插件安装与自动化任务管理。新版本支持在插件管理界面直接输入 npm 包名安装插件,内置可按计划定时执行的自动化任务插件,并优化了文件内容预览与代码修改差异展示。此外,用户在实验性创造模式下可通过对话让其编写和修改插件,官方后续还将建设插件市场并适配新模型。
美国众议员 Ro Khanna 致信 DeepSeek、阿里巴巴、月之暗面(Moonshot AI)及美国国家情报总监办公室(ODNI),呼吁中美签署条约以遏制 AI 灾难性风险。信件要求三家中国企业提供超级智能与递归自我改进(RSI)的安全防护资料,询问是否设置了“紧急开关”并接受非政府机构核查。他同时要求情报部门评估 AI 失控风险,为后续制定双边监管协议提供依据。
网易云音乐鸿蒙版正式上线,腾讯旗下 AI 助手 QClaw 宣布将于 12 月 24 日停运,任正非重申华为不造车并将继续帮助东风造好车。同时,外媒曝出 DeepSeek 年化收入运行率达约 10 亿美元,谷歌面向企业发布 Gemini 3.8 Live Avatar 实时 AI 虚拟形象,清华团队亦公开 Puro-2B 训练方案。
Steve Yegge 宣布关闭 Gas Town 并承认昂贵代码智能体订阅仅换来该项目,同时 Databricks 向约 3,500 名工程师推广 GPT-6 Astra 后编码总支出增加了约 60%。此外,OpenAI 正式发布了模型失准事件追踪披露框架及 6 起案例报告,小米公布了 MiMo-V2.6 的实时强化学习训练与成本看板。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,其 Vera Rubin NVL72 系统在 Qwen3-VL 上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上达到 2.5 倍。
初创团队 Good Start Labs 通过将策略游戏构建为强化学习训练环境,验证了 AI 模型在游戏中习得的推理与目标执行能力可以迁移至实际工作任务。其实验显示,在铁路策略游戏《1830》中训练的终端智能体能显著提升 Finance-Agent 金融研究基准表现,而微调《外交》游戏的模型在客户支持基准上也有所改进。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic 视频理解,官方称可将视频分析的 token 消耗最多降低 88%、成本最多降低 66%,准确率最多提升 7%。
推荐理由:Google DeepMind 公布 agentic 视频理解在长视频上的 token 与成本变化,并给出 API 开启方式。
IBM Research 基于 ALTK-Evolve 在 AppWorld 基准上测试了八款模型,发现智能体记忆并非直接全量注入最佳,而是需要根据模型能力分级校准。
推荐理由:测试表明智能体记忆注入并非越多越好,较弱模型适合核心经验配合动态检索,强模型则更能吸收完整准则库。
IBM Research 公布 ALTK-Evolve 与智能体上下文工程框架 ACE 的对比评测,展示在保持或提升任务准确率的同时大幅缩减推理 Token 消耗。
英国 AI 安全研究所(AISI)分析显示,GLM-5.2 与 DeepSeek-V4-Pro 等开源模型在网络安全能力上与闭源前沿模型的差距已缩小至 4 到 7 个月。