Open ASR Leaderboard 新增首个全球南方语言评测集 Monsoon
Voice Arena 与 Hugging Face 合作在 Open ASR Leaderboard 上新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。
推荐理由:Open ASR Leaderboard 首次纳入印地语与印度英语评测集,读者可了解多语言语音评测如何按说话人属性拆解误差。
Voice Arena 与 Hugging Face 合作在 Open ASR Leaderboard 上新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。
推荐理由:Open ASR Leaderboard 首次纳入印地语与印度英语评测集,读者可了解多语言语音评测如何按说话人属性拆解误差。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模周期从数周缩短至数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可据此判断自主地理空间建模的可行边界。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最佳 GluFormer 变体高 5.8 个百分点,糖尿病风险与 β 细胞功能障碍评估全部领先。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自己领域是否值得自训。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。
推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附 9 项基准对比,可据此判断 4-bit 部署的精度取舍。
Google Research 提出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 的 585 个多步任务上测试八款模型后发现,Agent 记忆不是开关而是需要按模型校准的剂量。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在所有场景中均上升,最高增幅 105%。
Google Research 提出 PhotoScan,一个可从标准 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用自家 Hub 七个月数据勾勒开源模型格局,可看到中美模型规模、下载与点赞背离及智能体流量的具体分布。
Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。
推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。
Google Research 提出知识画像(knowledge profiling)框架,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的编码失败与召回失败。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成、结构化预测与病灶定位,并用强化学习 DAPO 在多任务中奖励临床正确性。
Hugging Face 的 ALTK-Evolve 在 AppWorld 上以更少 token 追平或超越 ACE:DeepSeek-V3.2 上 TGC 89.3、每任务 263K token,ACE 为 80.4、634K;gpt-oss-120b 上两者准确率基本持平(56.0 对 54.8),但 ALTK-Evolve 仅需约七分之一成本。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。
Hugging Face 博客指出,AI 的下一个真正瓶颈是 GPU 利用率而非模型智能。GPU 按日历小时计费,却只在计算小时产出,企业自建集群后问题从"能否买到加速器"变成"能否让它们保持忙碌"。文章以航空业停场飞机作类比,强调集群即使满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并不持续。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督,替代完整交互历史作为智能体工作上下文。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的科研人员。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,用户无需机器人即可用手持设备录制操作演示,并自动转换为 LeRobot 格式数据集。
推荐理由:原文给出了一套无需机器人即可采集操作数据的开源方案,读者可据此判断数据采集门槛与开源生态的衔接方式。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。研究用一维 +1/-1 示例和两层 ReLU 网络实验验证,即使没有显式正则化,梯度训练的隐式正则化也能产生该效应。
Hume 发布 Real World VoiceEQ 基准,用于评估语音交互的人类质量,覆盖 40 多个专有与开源语音模型、15+ 评估维度和 60+ 指标,涵盖 ASR、TTS、S2S 与语音理解。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康信号上的规模化路径。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试后,目标路段车速中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体合成。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的当前形态。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天)。图像统一以 JPEG quality 92 编码。
Mistral 发布 Leanstral 1.5,采用 Apache-2.0 许可,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 均为新 SOTA。
推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与成本对比,可据此判断开源证明模型的实用边界。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。毕业生去向包括 OpenAI、Mistral AI、Physical Intelligence、Amazon 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位,部分人仍在探索下一步。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,指出优化理论、进化生物学、竞争市场与机器学习共同预测同一结论:专业化不可避免。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。
OpenAI 推出 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个无需重训练、单次前向传播即可从数据点集合同时估计分布密度与 score 的模型。
Google Research 在 COLM 2026 发表的论文揭示,推理能让 LLM 召回原本几乎无法获取的参数化知识,且这一效果并非来自复杂问题的分解。
NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%。
推荐理由:原文给出同一 from_pretrained() API 下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。
Hugging Face 博客提出 MosaicLeaks,用 1001 条多跳研究链测试深度研究智能体的隐私泄漏,其外部查询日志可被拼凑出私有企业信息。测试中智能体频繁泄漏,仅优化任务表现会加剧泄漏;其 Privacy-Aware Deep Research(PA-DR)RL 训练方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄漏从 34.0% 降至 9.9%。