跳到正文

#编码

今日 12 条
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML74

    GitHub Copilot 推出 Project HydraFusion 多模型编排预览

    GitHub Copilot 推出 Project HydraFusion 研究预览版,通过在跨厂商多模型间进行运行时编排来优化编码任务。系统会根据任务能力信号在单模型直出、级联升级和模型间交叉审查三种执行模式中动态选择,以平衡质量、成本与延迟。

    推荐理由:原文给出了单模型、级联和交叉审查三套编排机制及评测对比,为工程团队降低高阶模型调用成本提供了可借鉴范式。

9月4日周五
9月3日周四
  1. Hugging Face Blog68

    使用 TRL 与 OpenEnv 训练代码模型绘制水彩画

    Hugging Face 博客公开了基于 TRL 与 OpenEnv 训练代码模型生成水彩画的开源复现方案与完整工程流程。该方案使用 Qwen 模型结合 p5.brush 绘图库,在 TRL 的 GRPOTrainer 中将无头渲染结果交由 HPSv3 美学模型与视觉模型成对评判打分,成功引导模型学会调用特定绘图函数呈现水彩质感。

    推荐理由:文章开源了用强化学习与审美偏好训练代码模型绘制水彩画的完整流程,为非确定性审美任务的强化学习对齐提供了可复现的工程参考。

  2. Google DeepMind57

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 与自主漏洞修复能力

    Google DeepMind 宣布启动面向政府与受信任合作伙伴的 Fairwind 计划,提供自主发现和修复网络安全漏洞的高级防御能力。该计划结合专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 框架,可在几分钟内为组织生成并验证可直接部署的安全补丁。目前全球已有超 650 家伙伴参与,覆盖公共部门、关键基础设施运营商与核心技术平台。

  3. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月4日周二
  1. Microsoft Research74

    微软研究院开源可扩展智能体框架 Orchard

    微软研究院开源了可扩展智能体框架 Orchard,其核心组件 Orchard Env 基于 Kubernetes 构建,提供可复用的隔离沙箱服务。框架支持直接在 Codex、OpenClaw 等真实部署 harness 中完成端到端强化学习与评估,并同步开源了 Orchard-SWE、Orchard-GUI 和 Orchard-Claw 三项训练方案与数据集。

    推荐理由:原文展示了如何通过可复用沙箱环境和真实 Harness 直接训练小参数模型并在代码及 GUI 任务中取得高成功率。

7月27日周一
7月26日周日
  1. Berkeley AI Research43

    教 LLM 更新信念以实现高效长周期交互

    针对大语言模型在长周期交互中自我摘要导致的性能损耗,研究团队提出 ABBEL 框架,用受监督的自然语言“信念状态”替代完整交互历史。该框架将自编码重构等信念评分作为辅助强化学习奖励,以监督状态内容。在 CollabBench 评测中,ABBEL-rec-BG 仅用 50 步训练便追回与全上下文模型约 50% 的差距,训练步数减少 50% 且显著降低峰值 token 占用。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。

    推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。

7月6日周一
7月1日周三
5月29日周五
5月28日周四
  1. Mistral AI59

    Mistral AI 举办 AI Now Summit 2026:发布工业工程 AI 技术栈与长程智能体 Vibe

    Mistral AI 在 AI Now Summit 2026 上推出面向工业工程的 AI 技术栈,并宣布与 Airbus、BMW 和 ASML 展开深度合作。其长程生产力智能体 Vibe 支持日常日程管理、深度研究以及从需求到合并 PR 的全流程编程任务。此外,位于法国 Les Ulis 的 10 MW 推理专用数据中心预计于 2026 年 Q3 启用,以提升算力自主掌控力与数据安全性。

5月26日周二
  1. Import AI61

    Anthropic 联合创始人 Jack Clark 论直面 AI 奇点与内部研发变革

    Anthropic 联合创始人 Jack Clark 在牛津大学演讲中指出,面对 AI 技术的持续加速,个人与社会应主动正视并探索奇点带来的深远重塑。他透露 Anthropic 内部在 Opus 4.6 发布后大部分代码已转由 Claude 生成,人类员工正在向监控与验证层迁移,单名研究员已能调遣 9 个合成智能体协同推进研究。

5月22日周五
5月20日周三
  1. Google Research73

    Google 推出科研代码生成系统 ERA 与 Computational Discovery 工具

    Google 在《Nature》发表论文介绍科研编程系统 ERA(Empirical Research Assistance),并宣布通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。

    推荐理由:该研究展示了将大模型与树搜索结合优化科研代码的具体路径,为自动化计算实验与科学发现提供了可参考的工程框架。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

5月6日周三
  1. Google DeepMind64

    Google DeepMind 展示 AlphaEvolve 一年成果:从 DNA 测序到 TPU 设计

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。

    推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。

4月30日周四
3月31日周二
  1. Mistral AI65

    Mistral AI 分享 Spaces CLI 设计实践:如何让命令行工具兼顾人类与智能体

    Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。

    推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。

3月25日周三
  1. Google Research67

    Google 推出 Vibe Coding XR:结合 Gemini 与 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 原型工作流,结合 Gemini 的推理能力与开源 XR Blocks 框架,支持通过自然语言在 60 秒内生成具备物理感知与手势交互的 Android XR 应用。

    推荐理由:原文展示了大语言模型结合 WebXR 框架快速构建空间交互原型的技术链路,开发者可参考其上下文工程设计与桌面端仿真方案。

3月17日周二
3月11日周三
  1. Mistral AI63

    Mistral 构建 Rails 自动化测试智能体实践:实现 RSpec 测试自主生成与修正

    Mistral AI 分享了基于开源编程助手 Vibe 构建 Rails 自动化测试智能体的实践,能在 CI/CD 中无需人工干预自主编写、校验与改进 RSpec 测试用例。

    推荐理由:文章详细展示了结合上下文规范与执行工具闭环让智能体自测自改的方法,为大型代码库落地自动化测试提供了可复用范式。

1月28日周三
  1. Mistral AI75

    Mistral AI 发布终端编码智能体 Mistral Vibe 2.0

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选意图澄清、斜杠命令技能以及统一智能体模式。该版本已上线 Le Chat Pro 和 Team 计划并支持自带 API key 或超额按量付费,Devstral 2 同步开放付费 API 访问。

    推荐理由:新版将子智能体编排与交互澄清引入终端开发流,为开发者提供了更具可控性的终端编程自动化实践。

12月9日周二
  1. Mistral AI82

    Mistral AI 发布代码模型家族 Devstral 2 与终端工具 Mistral Vibe CLI

    Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。

    推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。

7月30日周三
7月11日周五
6月4日周三
  1. Mistral AI60

    Mistral AI 推出企业级 AI 编码助手 Mistral Code

    Mistral AI 正式推出面向企业研发团队的 AI 编码助手 Mistral Code,已在 JetBrains 和 VSCode 开放内测。该产品基于开源项目 Continue 构建,由 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四款模型驱动,支持云端或本地隔离环境部署。

    推荐理由:产品采用单一厂商全栈交付模式并支持本地私有化部署,为受合规监管的企业提供了可自主微调的端到端编码方案。

5月28日周三
  1. Mistral AI65

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 推出首个代码专用嵌入向量模型 Codestral Embed,主要面向代码检索与代码语义理解场景。该模型在 API 上的代号为 codestral-embed-2505,价格为 $0.15 per M tokens,Batch API 提供 50% 折扣,支持 8192 tokens 上下文窗口。

    推荐理由:该模型支持按相关性截断维度与量化压缩,开发者可据此在代码检索与代码智能体场景中平衡存储开销与召回质量。

5月21日周三
  1. Mistral AI83

    Mistral AI 发布开源软件工程智能体模型 Devstral

    Mistral AI 联合 All Hands AI 发布专为软件工程设计的智能体模型 Devstral,采用 Apache 2.0 协议开源。该模型在 SWE-Bench Verified 基准上取得 46.8% 的成绩,可在单张 RTX 4090 或 32GB 内存的 Mac 上本地部署,同时已开放 API 接入,价格为每百万输入 tokens $0.1、输出 tokens $0.3。

    推荐理由:该模型以可单卡本地运行的轻量体积在代码评测中超过部分大参数开源基座,为本地智能体开发提供了开箱即用的开源选项。

5月7日周三
  1. Mistral AI76

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 正式推出企业级模型 Mistral Medium 3,主打前沿性能与高性价比。该模型在综合基准测试中达到 Claude Sonnet 3.7 90% 以上的表现,并在编码与理科任务中超越 Llama 4 Maverick,API 定价为每 1M token 输入 $0.4、输出 $2。

    推荐理由:原文对比了同代前沿模型的定价与基准表现,并给出了本地四卡及云端部署门槛,适合评估企业级替代方案的成本效益。