联想 ThinkStation P4 塔式液冷工作站使用体验
该体验聚焦联想 ThinkStation P4 工作站的实际表现。该机型为全新塔式液冷工作站,主打静音与高能表现。
该体验聚焦联想 ThinkStation P4 工作站的实际表现。该机型为全新塔式液冷工作站,主打静音与高能表现。
爱范儿发布荣耀 Magic9 Pro Max 首发评测。原文正文目前仅包含版权许可与声明信息,未提供该机型的具体规格参数与详细测试内容。
匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。
爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。
爱范儿对即将上线的新一代视频生成模型 Kling 4.0 进行了首发实测,该版本重点强化了复杂运镜稳定性与叙事可控性。模型原生支持最长 30 秒生成与 21:9 画幅,提供 10-bit HDR 规格输出以适配专业调色流程,并支持 9 种语言的口型与多声道音频同步。
AINews 汇总 9/24/2026-9/25/2026 期间消息,指出 Opus 5.5 本周发布后社区反响积极,尤其在生成讲解视频上表现突出。Opus 5.5 以 88.4% 登顶 SimpleBench,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%,但弱于 GPT-6 Astra。
GPT-6 Astra 完成一份包含 50 个工作表的税务工作簿的速度是 GPT-5.6 Sol 的两倍。此外,该模型对用户意图具备更强的理解能力,让 Basis 在实际业务场景的应用中更具信心。
OpenAI 推出评测基准 MentalHealthBench。该基准由领域专家参与构建,专门用于在真实的心理健康对话场景中,评估 AI 回复的有效性与安全性。
Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。
推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。
英国人工智能安全研究所与 EvalEval 联盟合作,通过 Evaluation Cards 平台与统一规范公开发布评测运行记录与配置细节。公开数据覆盖 Claude Opus 4/4.5/4.6 及 GPT-5/5.2/5.4 等 6 款前沿模型,涉及 FrontierMath、Humanity's Last Exam 等 5 项基准。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,其 Vera Rubin NVL72 系统在 Qwen3-VL 上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上达到 2.5 倍。
IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer,用于衡量并改善智能体在重复运行下的不稳定问题。
推荐理由:原文提出 Pass^k 与一致性差距的度量,并给出把差距减半的检测与修复方法,可用于判断智能体上线后的可靠性。
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 印地语与印度英语语音评测集。该数据集包含 4,888 位说话人及 12 项人口统计学元数据,涵盖公有与私有切分,支持按地区、年龄和设备等多维度排查识别错误。
Google DeepMind 宣布试点双盲 AI 评测方案,利用密码学安全环境防止前沿专有模型在测试前获取题目,以解决基准测试污染问题。团队联合新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试。该机制通过技术与密码学保障替代单纯的合同与日志约束,提升模型能力评测的完整性与可信度。
推荐理由:文章介绍了通过密码学安全环境防止基准测试数据污染的试点方案,为解决模型预先窥题和评估失真提供了工程化参考。
Hugging Face 针对语音识别模型刷榜和基准过拟合现象提出三种量化测试,并评估了 11 个主流开源 ASR 模型。实测显示部分基准高分模型会直接复现参考文本里的历史标注错误,在音频数字被静音时仍有 30% 至 40% 的概率猜出被抹去的数字,甚至依赖背景声学线索切换不同数据集的拼写习惯。
推荐理由:该研究量化了语音模型利用声学线索迎合测试集的过拟合行为,为评估模型真实泛化能力提供了实用检测方法。
IBM Research 基于 ALTK-Evolve 在 AppWorld 基准上测试了八款模型,发现智能体记忆并非直接全量注入最佳,而是需要根据模型能力分级校准。
推荐理由:测试表明智能体记忆注入并非越多越好,较弱模型适合核心经验配合动态检索,强模型则更能吸收完整准则库。
研究团队推出含 70 款纯文本游戏的 DiG-bench 基准,评估 AI 自主探索隐藏规则的能力,Opus 5 与 Fable 5 表现最佳但在最高难度 Tier 7 成功率仅 20%。
Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。
推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。
新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。
IBM Research 公布 ALTK-Evolve 与智能体上下文工程框架 ACE 的对比评测,展示在保持或提升任务准确率的同时大幅缩减推理 Token 消耗。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
专攻巴西葡萄牙语的 OCR 模型 DharmaOCR 在葡语基准测试中取得 0.925 分,大幅超越更新的 Mistral OCR4(0.798)与 Unlimited-OCR(0.7587)。该模型先通过监督微调将全部参数专门对齐巴西葡语的词汇与文档结构,再结合 DPO 抑制重复与不连贯输出,从而在复杂文档提取中实现了更高的稳定性和更低的退化率。
语音 AI 基准 Real World VoiceEQ 正式发布,基于超过 100 万项人类真实评分,全面评测 40 多款主流专有及开源语音模型的实际交互质量。
IBM Research 推出企业级 Java 框架迁移评测基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE 与 Quarkus 之间的跨框架重构能力。
Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。
Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。
Google 与康奈尔大学测试了 GPT-4o、Claude 3.5、Gemini Advanced Pro 1.5 和 NotebookLM 等 6 款大语言模型解答高温超导前沿问题的表现。
Mistral AI 发布了使用大模型作为裁判(LLM as a Judge)评测 RAG 系统的实践指南,结合 RAG Triad 框架从上下文相关性、事实依据性和回答相关性三个维度进行评估。