跳到正文

#编码

今日 7 条
今天9月29日周二
  1. 量子位58

    匿名模型 Space Bunny 登顶调用双榜后的编码能力实测

    匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。

  2. TechCrunch · AI79

    Anthropic 发布 Sonnet 5.5:速度提升 30%,主打高性价比与智能体编码能力

    Anthropic 正式推出中端模型 Sonnet 5.5,运行速度比前代提升 30% 且 token 消耗与调用成本显著降低。基准测试显示其在智能体编码任务上的表现优于 Opus 5.5,同时具备与 Opus 5 相当的网络安全能力并适配相同的安全防护标准。此外,Anthropic 计划在未来数周内发布轻量级模型 Haiku 的新版本。

    推荐理由:该版本在提升30%速度的同时控制了调用成本,在智能体编码基准上优于更高阶版本,为开发者提供了更均衡的模型选型参考。

  3. 爱范儿72

    神秘匿名模型 Space Bunny 实测:草图直接生成 3D 网页,分词特征指向 MiniMax

    爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。

  4. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

  5. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

9月23日周三
9月3日周四
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。

    推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

3月17日周二
12月9日周二
  1. Mistral AI82

    Mistral AI 发布代码模型家族 Devstral 2 与终端工具 Mistral Vibe CLI

    Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。

    推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。

7月11日周五
5月28日周三
  1. Mistral AI65

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 推出首个代码专用嵌入向量模型 Codestral Embed,主要面向代码检索与代码语义理解场景。该模型在 API 上的代号为 codestral-embed-2505,价格为 $0.15 per M tokens,Batch API 提供 50% 折扣,支持 8192 tokens 上下文窗口。

    推荐理由:该模型支持按相关性截断维度与量化压缩,开发者可据此在代码检索与代码智能体场景中平衡存储开销与召回质量。

5月21日周三
  1. Mistral AI83

    Mistral AI 发布开源软件工程智能体模型 Devstral

    Mistral AI 联合 All Hands AI 发布专为软件工程设计的智能体模型 Devstral,采用 Apache 2.0 协议开源。该模型在 SWE-Bench Verified 基准上取得 46.8% 的成绩,可在单张 RTX 4090 或 32GB 内存的 Mac 上本地部署,同时已开放 API 接入,价格为每百万输入 tokens $0.1、输出 tokens $0.3。

    推荐理由:该模型以可单卡本地运行的轻量体积在代码评测中超过部分大参数开源基座,为本地智能体开发提供了开箱即用的开源选项。

5月7日周三
  1. Mistral AI76

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 正式推出企业级模型 Mistral Medium 3,主打前沿性能与高性价比。该模型在综合基准测试中达到 Claude Sonnet 3.7 90% 以上的表现,并在编码与理科任务中超越 Llama 4 Maverick,API 定价为每 1M token 输入 $0.4、输出 $2。

    推荐理由:原文对比了同代前沿模型的定价与基准表现,并给出了本地四卡及云端部署门槛,适合评估企业级替代方案的成本效益。