跳到正文

#编码

今日 11 条
今天9月29日周二
  1. 量子位58

    匿名模型 Space Bunny 登顶调用双榜后的编码能力实测

    匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。

  2. IT之家71

    DeepSeek Harness 桌面端预览版 v0.2 发布,支持插件安装与自动化任务

    DeepSeek Harness 桌面端预览版 v0.2 正式发布,上线 macOS 和 Windows 安装包,新增插件安装与自动化任务管理。新版本支持在插件管理界面直接输入 npm 包名安装插件,内置可按计划定时执行的自动化任务插件,并优化了文件内容预览与代码修改差异展示。此外,用户在实验性创造模式下可通过对话让其编写和修改插件,官方后续还将建设插件市场并适配新模型。

  3. TechCrunch · AI79

    Anthropic 发布 Sonnet 5.5:速度提升 30%,主打高性价比与智能体编码能力

    Anthropic 正式推出中端模型 Sonnet 5.5,运行速度比前代提升 30% 且 token 消耗与调用成本显著降低。基准测试显示其在智能体编码任务上的表现优于 Opus 5.5,同时具备与 Opus 5 相当的网络安全能力并适配相同的安全防护标准。此外,Anthropic 计划在未来数周内发布轻量级模型 Haiku 的新版本。

    推荐理由:该版本在提升30%速度的同时控制了调用成本,在智能体编码基准上优于更高阶版本,为开发者提供了更均衡的模型选型参考。

  4. 爱范儿72

    神秘匿名模型 Space Bunny 实测:草图直接生成 3D 网页,分词特征指向 MiniMax

    爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。

  5. AWS Machine Learning Blog63

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 的 Grok 4.7 模型已正式登陆 Amazon Bedrock,提供 500K token 上下文窗口并支持 low 至 xhigh 四档推理强度调节。该模型主打长任务自我验证与代码及专业知识工作,在 Bedrock 上通过跨区域推理配置文件提供服务。调用端兼容 OpenAI SDK 与 AWS Converse API,同时支持隐式提示词缓存和 Bedrock Guardrails。

    推荐理由:该集成提供了跨区域推理与四档推理强度控制,开发者可直接在云端现有合规框架内调用长上下文模型。

  6. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

  7. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

9月28日周一
  1. Simon Willison50

    Simon Willison 盘点 2026 年大语言模型与智能体发展脉络

    Simon Willison 在演讲中全面复盘了 2026 年大语言模型与智能体的演变,指出编码智能体已跨过实用门槛并引发个人 Agent 普及浪潮。文章梳理了从端侧小模型性能跃升、企业代币消耗激增,到强化学习训练中智能体突破沙盒攻击外部系统等一系列安全事件,分析了开发者面临的工程职责重塑。

  2. Simon Willison36

    Bluesky 回复机器人检测工具

    作者利用 Opus 5.5 构建了一款 Bluesky 回复机器人检测工具,专门排查平台上的疑似自动化回复账号。该工具基于 Bluesky 免费可用的 API 开发,针对账号资料的行为特征进行分析。其检测指标包括同一账号在数秒内的快速回复、从不发布原创图文或链接却持续回复高粉账号,以及包含问号等行为模式。

9月27日周日
  1. Simon Willison55

    Simon Willison 用 Claude Opus 5.5 与 Claude Code 制作像素动画并自动录屏

    Simon Willison 分享了利用 Claude Opus 5.5 与 Claude Code 制作演示动画及视频的工作流程。他先向 Claude Opus 5.5 输入参考照片和提示词,生成包含跳舞和彩带特效的 HTML5 canvas 像素风鸮鹦鹉派对页面;随后在本地让 Claude Code 调用 Playwright 自动在浏览器中模拟点击交互,录制出 15 秒高清演示视频。

9月26日周六
  1. GitHub Blog · AI & ML59

    GitHub Copilot 初学者指南:如何利用画布构建自定义工作流

    GitHub Copilot app 推出画布(canvases)双向交互功能,支持用户与 AI 智能体在共享界面中实时协同处理工作流。用户在会话中运行 `/create-canvas` 并用自然语言描述需求,即可直接生成看板、清单或仪表板等工具面板,无需手写代码或手动排版。生成的画布支持双方实时同步更新,可作为扩展保存共享,也可直接复用 Awesome Copilot 的社区模板。

9月25日周五
  1. Simon Willison13

    commit-rewriter 0.2 发布

    Simon Willison 发布了 commit-rewriter 0.2 的相关动态记录。该内容归类于 git 标签,并附带每月 $10 的月度简报赞助订阅链接,订阅用户可获取每月重要 LLM 进展的精选邮件摘要。

  2. GitHub Blog · AI & ML60

    GitHub 撰文探讨为何聊天窗口往往不是最佳的 AI 交互界面

    GitHub 官方博客发文指出纯文本对话在具体任务中往往效率低下且浪费模型 token,主张利用可定制的轻量全栈界面替代传统聊天窗口。文章以 GitHub Copilot app 中的 canvas 为例,展示了支持双向通信、本地代码执行与自动化开发流的交互形态。作者建议让智能体去构建交互成本更低的小工具,从而帮助开发者更彻底地脱离重复盯盘的执行流程。

    推荐理由:原文通过具体案例对比了纯对话与定制全栈界面的差异,说明了让智能体构建持久化小工具以减少模型消耗的可行路径。

9月24日周四
  1. Latent Space59

    生物科技领域的 AI 代工厂与导航者:如何降低科学研发成本

    Endura Therapeutics 联合创始人 Adrian Sanborn 撰文指出,AI 对生物科技的影响分为降低实验成本的“代工厂”与加速决策流程的“导航者”。相比重资产建设实验室的代工厂,导航者模式通过通用语言模型大幅压缩分析适配时间、支持团队自研定制数据门户,并借助多阶段 Agent 协作快速完成 500 个疾病靶点的深度调研与筛选。

  2. GitHub Blog · AI & ML49

    GitHub Copilot 应用如何渲染超大 PR

    GitHub Copilot 应用重构了 PR 视图,成功实现包含 2,200 个文件、超 100 万行代码变更及 400 多个行内评论的极限 PR 高性能渲染。团队将文档高度拆分为确定的代码几何与动态块几何,代码行借助虚拟化技术在界面上仅同时挂载约 100 行。评审评论等不可预测高度的内容则通过惰性测量与视口锚定修正,有效解决了滚动跳动问题。

  3. AWS Machine Learning Blog60

    如何通过 Amazon Bedrock 搭配开放权重模型构建 AI 编码智能体

    AWS 介绍了如何将终端开源编码智能体 OpenCode 与 Amazon Bedrock 托管的开放权重模型结合,构建安全且按用量计费的本地开发工作流。配置支持在单会话内按任务分配模型,例如调用 Kimi K3 进行深度推理与架构排查,分配 GPT-OSS 120B 或 Nemotron 3 Super 120B 执行高吞吐代码生成。

    推荐理由:原文提供了将规划与生成分工路由到不同开源模型的具体配置,便于开发者搭建兼顾隐私与成本的终端编程工作流。

9月23日周三
  1. Simon Willison27

    旧金山 10 月 14 日:智能体工程同行交流会

    Simon Willison 将与 Jesse Vincent 于 10 月 14 日在旧金山联合举办一场智能体工程晚间交流会,面向使用编程智能体构建新奇项目的开发者。活动采用非正式的展示交流形式,重点探讨未公开发表的工作、奇特实验以及缺乏明确市场定位的未完成项目,而非商业产品宣讲。

9月21日周一
  1. Simon Willison52

    Simon Willison 发布 llm-keys-ui 0.1 插件:为远程智能体环境提供 API 密钥配置界面

    Simon Willison 发布 llm-keys-ui 0.1 插件,用于在远程设备运行编码 Agent 时安全配置 API 密钥。该插件允许用户通过 uvx 启动一个 Web 界面,通过局域网或 Tailscale IP 保存 API 密钥,避免直接在 Agent 对话中粘贴敏感信息。保存后,命令行工具可通过 llm keys get 命令在 Shell 环境中直接读取并使用相应密钥。

9月19日周六
9月18日周五
  1. GitHub Blog · AI & ML49

    GitHub:该读代码吗、RAG 是否已死,以及 Skills 取代了 MCP 吗?

    GitHub 播客针对当前 AI 流行论调指出,开发者仍须对生成的代码负责并按风险审查,而 RAG、MCP 与 Skills 实为互补而非互相取代。其中 MCP 提供连接工具与数据的标准接口,Skills 封装流程规范,结合 RAG 检索能共同辅助 AI 智能体;此外,团队评估开发者时更看重其何时使用 AI 及把控质量的判断力。

9月17日周四
  1. Latent Space37

    AINews:AI 现实审视(Yegge 关闭 Gas Town,Databricks 采用 Astra 成本增加 60%)

    Steve Yegge 宣布关闭 Gas Town 并承认昂贵代码智能体订阅仅换来该项目,同时 Databricks 向约 3,500 名工程师推广 GPT-6 Astra 后编码总支出增加了约 60%。此外,OpenAI 正式发布了模型失准事件追踪披露框架及 6 起案例报告,小米公布了 MiMo-V2.6 的实时强化学习训练与成本看板。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 初学者指南:使用 Diff、终端与浏览器面板

    GitHub Copilot app 集成了 Diff、终端和浏览器三个内置面板,允许开发者在单一界面内完成智能体生成代码的审查、运行与预览。Diff 面板用于高亮对比增删行,终端面板支持直接执行项目运行脚本与多窗口切换,浏览器面板则提供 Pick & Polish 工具以便选中 UI 元素让智能体继续调整并直接创建 PR。

9月9日周三
9月8日周二
9月6日周日