OpenAI 如何在澳大利亚做得更好
OpenAI 就涉及澳大利亚政府网站的安全事件正式致歉。针对相关事件,OpenAI 概述了更严格的防护措施与支持方案,旨在进一步加强澳大利亚的网络防御能力。
OpenAI 就涉及澳大利亚政府网站的安全事件正式致歉。针对相关事件,OpenAI 概述了更严格的防护措施与支持方案,旨在进一步加强澳大利亚的网络防御能力。
OpenAI 针对前沿 AI 训练的安全论证(safety cases)提出了早期指南。该指南主要涵盖技术安全保障、运营实践,以及对模型未对齐(misalignment)事件的调查方法。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,用户只需提供 GitHub 仓库,智能体便会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并研判崩溃。
Google 宣布为 Private AI Compute 平台引入服务端安全持久内存架构,在保持端侧隐私标准的同时支持跨设备保留长期 AI 上下文。该架构结合硬件安全飞地、端到端加密通道和仅由设备端持有的解密密钥,云端仅在隔离内存中临时解密处理并即时重新加密,确保数据对包括 Google 在内的第三方不可见。
推荐理由:原文解决了传统云端隐私计算无状态导致无法跨设备保留上下文的问题,展示了云端大模型在严格硬件加密下维持长期记忆的可行路径。
OpenAI 阐述了针对前沿模型及安全防护措施开展第三方 AI 安全评估的优先级与原则。该方案强调评估过程必须具备严格性、安全性和独立性,旨在规范对前沿模型及其安全防护体系的审查。
面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。
NVIDIA 强调 AI 安全是需在模型、工作流及运行时全栈设立强制边界的工程问题,并开源了安全运行时 OpenShell。OpenShell 独立于智能体自身的推理决策提供沙箱执行环境,从底层管控文件、网络和系统资源访问。Cisco 的 DefenseClaw 与 JFrog 已接入该架构,分别提供治理层以及技能扫描和策略控制支持。
OpenAI 推出《澳大利亚青年安全蓝图》(Australian Youth Safety Blueprint),这是一份包含六大支柱的路线图。该方案旨在打造更安全的 AI 体验,在保护年轻人群体的同时为其赋能。
Mistral 与 HUMAIN 宣布战略合作,涵盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施满足本地算力需求,双方还计划在沙特制定联合市场策略,面向金融、制造、电信、网络安全和公共部门等受监管行业推广主权 AI。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,将由 CodeMender 通过限定访问试点向政府和可信合作伙伴提供。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比与限政府合作伙伴的试点安排,可了解攻防两侧能力变化。
Google DeepMind 与 Isomorphic Labs 联合公布生物韧性方案,旨在防止 AI 模型遭滥用并协同应对未来疫情等生物威胁。过去 12 个月双方已达成超 15 项合作,在预防、检测与响应中开放 Gemini、AlphaFold 与 AlphaEvolve 等技术,同时探索将 SynthID 水印用于生物序列筛选并加速疫苗研发。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 设立最高 $10M 的技术研究资助计划,面向全球征集多智能体 AI 安全研究提案。
Google DeepMind 与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,与首尔大学、KAIST 及三个 AI Bio 创新中心探索科研合作。
Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。