微软研究院在 Nature 发表逆合成模型 RetroChimera 并开源
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成对两者预测排序。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成对两者预测排序。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常达 v0.23 的数十倍。v1 将单一 crate 拆为工作区,引入无分配合并、基于 SIMD 的 bitcannon 分词、侵入式链表合并循环、线程本地词缓存和原生多线程并行。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
IBM 研究团队在 Hugging Face 博客介绍 ALTK-Evolve 新增的一致性指南,用于解决智能体同一任务多次运行结果不稳定的问题。
推荐理由:原文用 Pass^k 与 Mean@k 的差值量化智能体运行不一致,并给出可复用的诊断与改进流程。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 式标注器、背景移除、PNG Info 与图生视频。
推荐理由:原文展示了用 Gradio Workflow 重建 A1111 全部管线并暴露 REST 与 MCP 接口的做法,可据此判断节点式工作流的落地形态。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传递,无需 NCCL。
H Company 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单个双向 Transformer 同时处理文本 token 和 32×32 图像 patch,从零以掩码离散扩散目标预训练,不依赖预训练视觉塔或因果语言模型。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型用 p5.brush 写 JavaScript 画水彩画的创意,参考图池、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes,通过一条 add 命令把本机已有会话索引为可召回的记忆。
推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与跨智能体召回机制,可据此判断多机多智能体协作的落地方式。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。微调可在免费版 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。团队用 360 万个合成甲烷羽流训练模型,并在地球引擎上开放全球羽流数据库,同时在 Kaggle 发布训练模型与合成数据、在 GitHub 发布推理库。
Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:Hugging Face 把浏览器端 GPU 算子做成可版本化、可测试的独立仓库,并给出与 ORT WebGPU 的实测对比,便于判断浏览器推理的底层现状。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自己领域是否值得自训。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。
推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。
Import AI 470 收录三项研究:METR 分析显示 AI 在网络安全领域带来显著加速,数学研究小幅加速,AI 研究本身则未见可测加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基座提升 8.1。Hawkeye 则用于构建更好的 GPU kernel。
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾或相关词已被静音,在 LibriSpeech 上部分模型复现被静音数字的比例约为 30–40%。
推荐理由:通过三项探针量化 ASR 模型的基准优化行为,并给出可复用的检测脚本与榜单入口。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
DiG-bench(Discovery in Games)发布,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,目前公开 21 款。Opus 5 与搭配 Claude Code 的 Fable 5 表现最佳,仅二者能在 Tier 7 通关部分任务,而人类玩家可达 100%。Inherent 还发布 Faraday,用小型开源模型监督前沿模型以提升科研表现。
Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。
推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。
Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体复现 ICML 2026 论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文复现的可行路径与人类角色的具体分工。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和影像源,输出 Cloud-Optimized GeoTIFF。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助手等隐私敏感应用。
推荐理由:Meta 开源 30B 多模态模型,主打本地智能体场景,并给出与同级模型的基准对比和部署路径。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出约一天预警提前量,相当于气象领域约十年的进展。
推荐理由:WeatherNext 在气旋路径与强度预测上取得约一天预警提前量,并开源模型权重与代码,读者可据此了解 AI 天气预报的当前进展与可用入口。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略并输出校准后的安全分数,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源安全分类器把审核策略放进推理时的自然语言问题里,可据此判断小模型在内容审核上的替代空间。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库提供服务。
推荐理由:原文给出实时生成式手术仿真器的蒸馏与推理优化路径,读者可据此判断世界模型进入交互闭环的工程门槛。
Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格 4-bit 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式与量化工具链,读者可据此判断消费级 GPU 跑扩散模型的内存与延迟取舍。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,用户无需机器人即可用手持设备录制操作演示,并自动转换为 LeRobot 格式数据集。
推荐理由:原文给出了一套无需机器人即可采集操作数据的开源方案,读者可据此判断数据采集门槛与开源生态的衔接方式。
DharmaOCR 在葡萄牙语专项基准上得分 0.925,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现,模型作者无需移植即可获得高速推理。
推荐理由:原文给出 vLLM 的 transformers 后端在多种 Qwen3 模型上追平手写实现,读者可据此判断是否省去移植成本。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的当前形态。
SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境中调度运行。
推荐理由:原文给出零出口费存储与跨云调度的组合方式,读者可据此判断数据与 GPU 分离时的成本结构。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天)。图像统一以 JPEG quality 92 编码。