跳到正文

#数据/训练

今日 0 条
9月28日周一
9月26日周六
9月25日周五
  1. AWS Machine Learning Blog34

    使用 Amazon SageMaker HyperPod 与 Qumulo 实现多区域训练

    AWS 推出结合 Amazon SageMaker HyperPod 与 Qumulo 的多区域训练方案,使计算与数据集分置不同 AWS 区域时无需复制全量数据。在 1.02B 参数 LLaMA v3 及 16 块 H100 GPU 实测中,跨区域集群经 NeuralCache 预热后吞吐量达到与本地集群相同的 115–117 samples/sec,GPU 利用率收敛至 98–100%。

9月16日周三
  1. NVIDIA Blog42

    曼彻斯特大学利用 NVIDIA Earth-2 预测全英国空气污染

    曼彻斯特大学研究团队利用 NVIDIA Earth-2 旗下的 CorrDiff 与 StormCast 生成式框架,成功构建了覆盖全英国的空气污染预测模型。该模型在英国 Isambard-AI 超算的单个 8-GPU 节点上仅用 2 天完成训练,分辨率达 2-3 平方公里,并可在桌面级 DGX Spark 系统上运行推理与训练。团队后续计划开源相关训练数据与工作流。

9月11日周五
9月4日周五
9月3日周四
  1. Hugging Face Blog65

    通过 100 步 GRPO 微调 350M 模型提升结构化输出能力

    Hugging Face 发布实践指南,展示使用 TRL 库仅需 500 条样本和 100 步 GRPO 训练微调 LFM2.5-350M,即可将其在 IFStruct 结构化输出基准上的通过率从 22.6% 提升至 29.7%。

    推荐理由:原文给出了基于 TRL 和 GRPO 的低成本微调方案与奖励函数设计,便于开发者用轻量算力提升小模型的结构化输出合规率。

  2. Hugging Face Blog68

    使用 TRL 与 OpenEnv 训练代码模型绘制水彩画

    Hugging Face 博客公开了基于 TRL 与 OpenEnv 训练代码模型生成水彩画的开源复现方案与完整工程流程。该方案使用 Qwen 模型结合 p5.brush 绘图库,在 TRL 的 GRPOTrainer 中将无头渲染结果交由 HPSv3 美学模型与视觉模型成对评判打分,成功引导模型学会调用特定绘图函数呈现水彩质感。

    推荐理由:文章开源了用强化学习与审美偏好训练代码模型绘制水彩画的完整流程,为非确定性审美任务的强化学习对齐提供了可复现的工程参考。

8月26日周三
8月21日周五
  1. Google Research45

    Google:移动数据如何让大语言模型更深入理解地点

    Google 推出 ME-POIs 框架,将聚合匿名的移动模式与文本描述融合,让大语言模型生成兼顾地点语义与动态功能的向量嵌入。在未见地点测试中,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提高 24.7%。其空间多尺度传播机制还能迁移周边特征,有效缓解长尾商户的数据稀疏问题。

  2. Microsoft Research44

    微软研究院扩大 Skala 接入生态,加速迈向预测性 DFT

    微软研究院发布深度学习密度泛函 Skala 1.1 并扩大生态集成,目前已上线 CP2K,且正集成至 Psi4、FHI-aims、ORCA 和 VASP。该版本训练数据达前代 2.5 倍,以 meta-GGA 的计算成本在 GMTKN55 基准 55 个类别中斩获 32 项第一,加权平均误差为 2.8 kcal/mol。微软还同步推出了持续追踪计算性能的动态基准。

8月10日周一
7月31日周五
  1. Microsoft Research70

    微软发布 Echoverse:面向计算机操作智能体的深度演进环境

    微软研究院提出 Echoverse,为计算机操作智能体构建十二个训练世界,包括十个深度领域环境和两个能力环境,分别针对日期选择器与嵌套筛选等单一控件。在全部十二个世界上训练的 9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4 的 80.7%。

    推荐理由:微软公布 Echoverse 十二个计算机操作智能体训练世界与数据库锚定评分机制,并开源其中四个世界及代码与任务。

7月16日周四
  1. Hugging Face Blog34

    新模型迭出下专攻巴西葡语的 DharmaOCR 依然保持优势

    专攻巴西葡萄牙语的 OCR 模型 DharmaOCR 在葡语基准测试中取得 0.925 分,大幅超越更新的 Mistral OCR4(0.798)与 Unlimited-OCR(0.7587)。该模型先通过监督微调将全部参数专门对齐巴西葡语的词汇与文档结构,再结合 DPO 抑制重复与不连贯输出,从而在复杂文档提取中实现了更高的稳定性和更低的退化率。

  2. Google Research44

    Google Research 揭秘扩散模型的创造力来源

    Google Research 在 ICLR 2026 发表的研究揭示,扩散模型的“创造力”并非随机巧合,而是源于神经网络训练中的得分平滑(score smoothing)现象。由于权重衰减等正则化效应,模型学到的是平滑后的近似得分函数,避免了单纯记忆复刻训练数据。这种平滑机制促使去噪过程在训练数据点之间实现插值,从而稳定生成逼真的全新样本。

7月6日周一
6月30日周二
  1. Hugging Face Blog35

    为什么专业化不可避免:优化理论、生物学、市场与机器学习给出同一答案

    围绕 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,Dharma AI 撰文指出,优化理论、演化生物学、竞争市场与机器学习共同预测:在有限资源下,专注于特定领域的系统会胜过追求通用性的系统。

6月11日周四
  1. Google Research45

    Google 提出用于审计机器遗忘的新框架

    Google 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于灵敏且准确地审计机器学习模型的“机器遗忘”。该框架引入相对距离检验与核正则化方法,利用 KL、卡方及 Hockey-stick 等 f-散度精准捕捉局部数据偏移与隐私泄露,同时在理论上证明能在任意样本量下控制假阳性。

5月27日周三
5月19日周二
4月30日周四
4月22日周三
4月16日周四
  1. Google Research52

    Google 提出合成数据生成框架 Simula:基于第一性原理与机制设计

    Google 推出合成数据生成与评估框架 Simula,通过基于推理的第一性原理将全流程解耦为全局多样性、局部多样性、复杂化与双批评质量检查四个独立可控维度。实验使用 Gemini 2.5 Flash 作为教师模型向 Gemma-3 4B 进行蒸馏,在网络安全、法律推理、数学等领域最高生成 512K 规模数据并显著超越基线。

  2. Google Research50

    Google 发布神经形态生成模型 MoGen,利用合成神经元加速大脑连接组重建

    Google Research 推出神经形态生成模型 MoGen,通过点云流匹配技术生成逼真的 3D 神经元形态,以合成数据加速大脑神经连接图谱重建。实验显示,在 PATHFINDER 重建模型的训练中加入 MoGen 数据后,小鼠轴突重建错误率降低了 4.4%,在完整小鼠大脑规模下相当于节省 157 人年的人工校对成本。

4月1日周三
  1. Google Research48

    Google Research:构建更好的 AI 评测基准需要多少标注人员?

    Google Research 研究发现,AI 评测中每个样本配备 1 至 5 名标注人员的通用做法不足以捕捉人类真实分歧。若要捕捉观点差异等细节,单样本通常需超过 10 名标注人员;若只评估多数票准确率,增加样本量则比增加标注人员更有效。团队指出依据指标优化配比仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已在 GitHub 开源。

3月18日周三
  1. Mistral AI51

    Mistral AI 发布企业模型定制系统 Forge

    Mistral AI 发布企业模型构建系统 Forge,支持企业利用内部代码库、文档和运营记录等专有数据定制模型与智能体。该系统覆盖预训练、后训练和强化学习全流程,兼容稠密与 MoE 架构及多模态输入,并具备 Agent-first 设计支持智能体自动调优。目前 ASML、爱立信和欧洲空间局等机构已接入该系统在自身基础设施中构建领域专用模型。

3月17日周二
  1. Mistral AI73

    Mistral AI 与 NVIDIA 达成战略合作并加入 Nemotron 联盟

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron 联盟,双方将联合研发前沿开源 AI 模型。Mistral AI 贡献专有模型架构、多模态能力和微调工具,结合 NVIDIA 的算力与合成数据流水线,共同构建基于 NVIDIA DGX Cloud 训练的开源基础模型,为后续 NVIDIA Nemotron 4 系列提供支撑。

    推荐理由:原文披露了两家机构联合开发前沿开源模型的技术分工与路径,读者可借此评估算力与模型架构结合对开源生态的影响。

3月12日周四
3月7日周六
  1. Google Research49

    WAXAL:面向非洲语言语音技术的大规模开源资源

    Google Research 联合非洲机构推出开源语音数据集 WAXAL,覆盖 26 个以上国家超 1 亿人使用的 27 种子撒哈拉非洲语言。该资源采用 CC-BY-4.0 许可开源,包含约 1,846 小时用于 ASR 的自然无脚本转录语音数据,以及超 565 小时用于 TTS 的高保真录音数据,旨在支持开发全双工对话系统并促进低资源语音技术研发。

9月1日周一
  1. Berkeley AI Research18

    word2vec 究竟学到了什么:伯克利 AI 研究给出闭式理论解释

    伯克利 AI 研究提出一套定量理论,证明 word2vec 在随机初始化且初始权重趋近于零的训练条件下,其学习问题可化简为非加权最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示就是 PCA。该理论给出特征向量的闭式表达式,仅由语料共现统计与超参数决定,并按序逐步提升嵌入矩阵的秩,每一步对应一个可解释的主题级概念。

8月1日周五
  1. Mistral AI47

    通过微调释放 Pixtral-12B 在卫星图像领域的潜力

    Mistral AI 展示了通过微调技术提升视觉语言模型 Pixtral-12B 在卫星图像分类上的表现。在包含 8,000 训练样本和 2,000 测试样本的 Aerial Image Dataset 基准测试中,微调有效解决了基础模型对细分类别的区分难题并减少了标签幻觉。开发者可通过 Mistral 微调 API 或 LaPlateforme UI 快速完成模型适配。