Airbnb 扩大 GPT-6 Astra 及 OpenAI 前沿模型的访问权限
Airbnb 正在扩大对 GPT-6 Astra 及 OpenAI 前沿模型的访问范围。该举措旨在协助其工程团队排查与解决 Bug、设计系统架构,并加快软件交付速度。
Airbnb 正在扩大对 GPT-6 Astra 及 OpenAI 前沿模型的访问范围。该举措旨在协助其工程团队排查与解决 Bug、设计系统架构,并加快软件交付速度。
OpenAI 与 Grab 联合推出区域性计划“GO Forward with AI”。该计划旨在帮助东南亚的 30,000 名合作伙伴建立并掌握实用的 AI 技能。
Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。
推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。
Anthropic 与 OpenAI 相继发布新模型,共同点是能力小幅提升、使用成本大幅下降。Anthropic 称相比 Opus 5,Opus 5.5 在默认设置下处理典型工作负载可节省接近 40% 成本,因为 token 单价下降且完成任务所用 token 更少;该模型在网络安全、生物学等高风险领域能力突出,相关请求可能被自动透明地路由到旧模型。
Google 研究员 John Platt 在 Latent Space 访谈中介绍了科研辅助系统 ERA,该系统通过大语言模型结合类似蒙特卡洛树搜索的机制,自动迭代实验代码以最大化科学评分目标。
OpenAI 介绍了 GPT-6 在提示词缓存(prompt caching)上的优化机制,旨在降低推理延迟与成本。该更新支持更高的缓存命中率,并引入了全新诊断工具、显式断点以及精细控制能力。
推荐理由:材料指出了 GPT-6 提示词缓存的命中率优化与显式断点控制,有助于开发者降低调用延迟与成本。
微软周二宣布主导了一项全行业联合行动,成功打击了名为 EvilTokens 的订阅制诈骗平台,该平台在数月内利用 AI 聊天机器人盗取了 12000 个微软账户。EvilTokens 自 2 月起在 Telegram 上以 1500 美元首付款加每月 500 美元订阅费运营,其核心 AI 聊天机器人可自动化分析受害者收件箱中的信任关系与付款授权,并能伪造可信联系人草拟欺诈邮件诱导转账。
加拿大不列颠哥伦比亚省起诉 OpenAI,指控其模型缺陷与未向警方预警的行为助长了枪手的暴力意图,并要求 OpenAI 承担包括出资新建学校在内的巨额赔偿。诉状指出 OpenAI 关闭了阻断相关聊天的功能,且模型规范要求在涉及暴力对话时默认假定善意而不探究意图,涉嫌违反其公开承诺的安全预警职责。原告还要求法院下令对 OpenAI 实施定期独立审计,以确保高风险暴力对话能及时移交执法部门。
推荐理由:诉讼聚焦 AI 厂商对暴力意图识别及向执法机构预警的法律责任,展示了模型安全规范在应对现实危害时面临的司法问责风险。
Simon Willison 发布 llm 0.36。此外,读者可按每月 10 美元赞助获取月度简报,订阅当月重要大语言模型进展的精选邮件摘要。
OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 正式在 Amazon Bedrock 全面上线,两款模型的 API 定价显著低于前代 GPT-5.6 系列。
推荐理由:文章详细说明了两款模型在研发与高并发流水线中的分工和显式缓存机制,有助于开发者规划多阶段任务的推理架构与成本。
TikTok 创作者 @therealcornpop 指出,用 AI 写 TikTok 和 YouTube 脚本很容易被识破:不只是"不是 X,而是 Y"这类 AI 腔、三段式和断句式碎拍写法,更在于内容缺少观点,没有明确的个人声音。
OpenAI 推出 GPT-6 Sol 与 Luna 两款新模型,旨在将前沿智能引入日常工作。两款模型在能力和成本之间分别提供了不同的平衡选择。
Anthropic 的 Claude 5.5 系列首个模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向智能体编码、知识工作和长时任务的最强 Opus 模型。
推荐理由:AWS 官方给出 Claude Opus 5.5 在 Bedrock 上的能力变化与接入代码,可据此评估迁移与成本。
Simon Willison 发布了 llm-anthropic 0.29。该动态归属于 LLM 与 Anthropic 相关分类,并附带每月 10 美元的精选大语言模型进展邮件订阅支持。
LLM 命令行工具新增 llm-typesafe 0.1a0 插件,正式接入 TypeSafe AI 的 Jev 模型。用户通过命令行安装并配置 API key 后,可调用 Jev 执行是/否判断(noul)、多项选择分类(choice)以及按标准评分(score)等结构化任务。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速包集合,新增智能体工作流与平台支持,帮助开发者与 AI 智能体协作构建机器人应用。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,读者可据此了解开源机器人栈新增的能力与硬件支持范围。
Parallel 采用 GPT-6 Astra 支持其 AI 智能体调研与整合劳动力市场数据。与先前模型相比,该方案将数据研究与综合处理的时间及成本均缩减了一半。
Anthropic 的 Claude Mythos 宣称比安全专家更擅长发现软件漏洞,OpenAI 与 Hugging Face 的黑客事件后 Anthropic 和 Meta 也袒露类似情况。网络安全专家认为事件更多源于 OpenAI 忽视基本安全实践,而非模型失控;数学家则指 OpenAI 的 Astra 并未带来深刻突破,并指控其抄袭。
小米推出 MiMo-V2.6 系列原生全模态模型,其中总参数量 1.02T、激活参数 42B 的 MiMo-V2.6-Pro 登顶 Artificial Analysis 开源权重评测榜。
OpenAI 阐述了针对前沿模型及安全防护措施开展第三方 AI 安全评估的优先级与原则。该方案强调评估过程必须具备严格性、安全性和独立性,旨在规范对前沿模型及其安全防护体系的审查。
英国人工智能安全研究所与 EvalEval 联盟合作,通过 Evaluation Cards 平台与统一规范公开发布评测运行记录与配置细节。公开数据覆盖 Claude Opus 4/4.5/4.6 及 GPT-5/5.2/5.4 等 6 款前沿模型,涉及 FrontierMath、Humanity's Last Exam 等 5 项基准。
oMLX 创建者兼维护者 Jun Kim 正式加入 Hugging Face,全职投入支持 Apple MLX 社区与本地 AI 生态。oMLX 将从个人业余项目升级为获得资金支持的完全维护项目,继续保持 Apache 2.0 开源协议;未来重点之一是简化流程,加速将 transformers 模型定义转换为能在 MLX 上运行的参考实现。
Hugging Face 宣布在 transformers 库中原生支持 llama.cpp 的 GGUF 模型,开发者可直接通过 from_pretrained 加载 Hub 上的量化权重。
推荐理由:该更新让开发者能直接在标准 Transformers 工作流中复用 GGUF 量化权重,便于在 PyTorch 环境下调试模型与评测。
TypeSafe AI 发布 Jev,这是他们称为 System One 模型的新类别,只接受文本输入,返回类别、是/否判断、评分及其置信度,而非文本输出。Jev 只按输入计费、输出免费,首个模型输入价格为每百万 token $0.042,低于 OpenAI GPT-5 Nano 的 $0.05/百万。
TypeSafe AI 发布首个大型可编程模型 Jev,定位为供代码调用的 System 1 模型,按每美元智能优化并取名自杰文斯悖论。其核心方法是未发表的新技术 RLCD(面向校准决策的强化学习),目标是给出带有认知诚实概率的答案,而非 RLHF 的人类偏好反馈或 RLVR 的可验证输出。
NVIDIA 推出 NVIDIA DSX Ready 认证计划,为符合其 DSX AI 工厂参考设计的第三方电力与散热方案提供标准化验证。该计划首发涵盖电池储能系统(BESS)与冷量分配单元(CDU)两大类别,首批通过认证的厂商包括 Tesla、Hitachi Energy、LG 与 Vertiv 等。后续该计划还将扩展至更多基础设施和软件类别,旨在降低集成风险并加速 AI 工厂部署。
面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。
埃及 AI 生态正迈向规模化生产阶段,NVIDIA 深度学习培训机构在埃及的学员基数在一年内增长超十倍,在非洲已累计培训超 85,000 名开发者。非洲一年内已宣布或上线 4 座 AI 工厂且在建新增容量达 656 兆瓦,包括 Cassava 投资可达 7.2 亿美元的算力部署,以及由超 50 台 NVIDIA HGX B300 系统驱动的本土 AI 云。
微软在《Nature》发表小分子逆合成预测模型 RetroChimera 并开源代码与权重,通过学习重排序策略融合了 Transformer 生成式模型与图神经网络模板模型。在盲测中,化学专家对其单步反应预测的评价超过先前模型与文献记录反应,在 10 个高难度目标分子的多步合成测试中成功规划出 9 个。项目代码已按 MIT 协议托管于 GitHub,并接入 Microsoft Foundry。
NVIDIA 强调 AI 安全是需在模型、工作流及运行时全栈设立强制边界的工程问题,并开源了安全运行时 OpenShell。OpenShell 独立于智能体自身的推理决策提供沙箱执行环境,从底层管控文件、网络和系统资源访问。Cisco 的 DefenseClaw 与 JFrog 已接入该架构,分别提供治理层以及技能扫描和策略控制支持。
新研究将大语言模型的 Transformer 块剪枝建模为约束二进制优化与伊辛玻璃问题,通过最小化能量确定最优删除组合。该方法利用 Hessian 矩阵捕捉层间耦合相互作用,无需逐一运行基准测试即可低成本评估海量配置。在 Llama-3.3-70B-Instruct 的 50% 压缩测试中,其 MMLU 得分比现有最佳块删除方法高出近 23 个百分点。
RAND 发布报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,以保留地缘政治优势并确保人类存续,核心包括构建人机生态系统、AI 安全架构、改造国安体系及提升社会应对能力。研究人员还将人类脑组织培育进刻意清除脑细胞的小鼠体内,作为研究载体。
《麻省理工科技评论》联合调查发现美墨边境超1050人在AI监控塔附近死亡,暴露出算法未检出目标、设备损坏及警员忽视警报等系统性漏洞。文章针对边境虚拟墙的失效提出4条政策建议:全面审计监控塔附近的死亡情况、修正移民死亡与遗骸的追踪机制、准确记录监控技术促成抓捕的真实案例,以及将每次死亡事件按潜在监控失效开展专项调查。
《MIT 科技评论》联合调查显示,2015 年至 2026 年初,有超过 1050 人在美国海关与边境保护局部署的监控塔探测范围内死亡。调查指出,包括 Anduril 制造的 AI 自主监控塔在内的设备,经常因算法漏检、掩体伪装、地形盲区以及边境巡逻人员未能及时响应而失效。尽管美国政府计划继续斥资数十亿美元扩建上千座 AI 监控塔,但相关监管部门至今缺乏追踪系统真实有效性与死亡案例的内部审计机制。
Higgsfield AI 借助 GPT-6 Astra 在一天内上线了全新视频功能。该能力降低了小型企业制作视频广告的门槛,并帮助团队更快将全新创意工具推向市场。
OpenAI 正在与独立的数学与人工智能咨询小组(Advisory Group on Mathematics and Artificial Intelligence)展开合作。该小组将负责指导新兴 AI 成果的审核评估与对外沟通传播工作。
《麻省理工科技评论》公布了一项历时 15 个月的调查方法,团队通过整合近 4000 起移民遗骸记录与数百座边境监控塔数据,构建出美墨边境“虚拟墙”附近的死亡分布地图。调查过程中借助 Anthropic 的 Claude 模型解析了数千页警方报告并提取坐标,并结合卫星历史影像与高程数据测算塔架存在时间与视线遮挡情况。
NVIDIA 在纽约气候周展示了 5 家利用其 AI 技术加速清洁能源转型的代表企业。ThinkLabs AI 基于 CUDA 将电网互联评估时间从 30-45 天缩减至 2 分钟;Redwood Materials 在 Blackwell 平台上运行 AI 层调度回收电池供电。
OpenAI 提出了一条迈向全球共享 AI 标准的实施路径,呼吁在模型评估、信息报告和安全治理等方面展开跨组织协同,以提升 AI 的整体安全性。
OpenAI Academy 拓展了全新学习路径,面向员工、开发者、管理者、教育工作者及学生开放。该系列路径旨在帮助不同群体构建并展示实用的 AI 技能。