跳到正文

#评测/基准

今日 6 条
今天9月29日周二
  1. 量子位58

    匿名模型 Space Bunny 登顶调用双榜后的编码能力实测

    匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。

  2. 爱范儿72

    神秘匿名模型 Space Bunny 实测:草图直接生成 3D 网页,分词特征指向 MiniMax

    爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。

  3. Latent Space75

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24/2026-9/25/2026 期间消息,指出 Opus 5.5 本周发布后社区反响积极,尤其在生成讲解视频上表现突出。Opus 5.5 以 88.4% 登顶 SimpleBench,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%,但弱于 GPT-6 Astra。

9月28日周一
9月23日周三
  1. Simon Willison88

    Claude Opus 5.5 与 GPT-6 Sol、Luna 实测体验及价格战分析

    Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。

    推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。

9月22日周二
9月16日周三
  1. Hugging Face Blog66

    IBM Research 提出 Consistency Analyzer:把智能体的一致性差距从 24.4 点减半到 12.0 点

    IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer,用于衡量并改善智能体在重复运行下的不稳定问题。

    推荐理由:原文提出 Pass^k 与一致性差距的度量,并给出把差距减半的检测与修复方法,可用于判断智能体上线后的可靠性。

8月28日周五
8月27日周四
  1. Google DeepMind61

    Google DeepMind 试点双盲 AI 评测以应对基准测试污染

    Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。

    推荐理由:文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。

8月21日周五
  1. Hugging Face Blog71

    Hugging Face 量化语音识别模型的基准过拟合现象

    Hugging Face 针对语音识别模型刷榜和基准过拟合现象提出三种量化测试,并评估了 11 个主流开源 ASR 模型。实测显示部分基准高分模型会直接复现参考文本里的历史标注错误,在音频数字被静音时仍有 30% 至 40% 的概率猜出被抹去的数字,甚至依赖背景声学线索切换不同数据集的拼写习惯。

    推荐理由:该研究量化了语音模型利用声学线索迎合测试集的过拟合行为,为评估模型真实泛化能力提供了实用检测方法。

8月19日周三
8月17日周一
8月13日周四
  1. Hugging Face Blog76

    Hugging Face 总结复现 ICML 2,200 篇论文的经验与发现

    Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。

    推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。

  2. Microsoft Research47

    MindTopo 揭示 VLM 的空间推理能力

    新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。

8月11日周二
7月27日周一
7月16日周四
  1. Hugging Face Blog34

    新模型迭出下专攻巴西葡语的 DharmaOCR 依然保持优势

    专攻巴西葡萄牙语的 OCR 模型 DharmaOCR 在葡语基准测试中取得 0.925 分,大幅超越更新的 Mistral OCR4(0.798)与 Unlimited-OCR(0.7587)。该模型先通过监督微调将全部参数专门对齐巴西葡语的词汇与文档结构,再结合 DPO 抑制重复与不连贯输出,从而在复杂文档提取中实现了更高的稳定性和更低的退化率。

7月15日周三
7月1日周三
4月9日周四
  1. Google Research43

    ConvApparel:衡量与弥合用户模拟器的真实度差距

    Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。

4月3日周五
  1. Google Research53

    Google Research 提出评估大语言模型行为倾向与人类对齐的测试框架

    Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。

3月17日周二
4月9日周三