超越聊天机器人:用模型自身失败样本做 DPO,降低 OCR 文本退化
DharmaOCR 团队将 DPO 用于结构化 OCR 任务,用模型自身产生的重复循环失败样本构建偏好对,在全部测试的视觉语言模型家族中均降低文本退化,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
DharmaOCR 团队将 DPO 用于结构化 OCR 任务,用模型自身产生的重复循环失败样本构建偏好对,在全部测试的视觉语言模型家族中均降低文本退化,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
Import AI 459 聚焦三项研究:英国 AI 安全研究所的论文指出用 AI 监督 AI 训练的自动化对齐并非万能方案;另有工作提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的尝试。同期还介绍了美国 AI 经济年增速约 2,000%、2025 年名义 AI GDP 约 2500 亿美元的测算研究。
Hugging Face 发布 PyTorch 性能分析系列第一篇,介绍如何用 torch.profiler 分析矩阵乘法加偏置的算子。文章基于 PyTorch 2.13 与 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,并演示 torch.compile 带来的变化。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可据此判断工业设计流程的算力与迭代节奏会如何变化。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等行业的基础 Physics AI 研究。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据而无需重新划分网格,以及面向大型多物理过程的端到端深度学习代理模型 NeuralDEM。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件上传到 Hub Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的部署成本。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,在保持 v1 性能的同时将计算成本最多降低 3 倍。该系列包含 Base、Tiny 和 Nano 三种规模,权重与训练代码已开放。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文同日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,可据此判断科研编码自动化的落地边界。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模从 17m 到 1b,基于 Ettin ModernBERT 编码器构建。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究,帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选基因通路。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与耗时对比,可了解 AI 智能体参与科研假设生成的实际方式。
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果,定向破坏工程与物理仿真。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:原文给出三类科学智能体实验工具与 Science Skills 的开放入口,可据此判断科研工作流的可迁移用法。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研和气候领域推出新项目。合作探索 AI 辅助临床的“三方护理”、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的视障跑者助手。
剑桥大学教授 Clare Bryant 利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白,与多个她感兴趣的信号通路相关。她随后加入未发表数据反复迭代,将假说从候选蛋白细化到具体氨基酸,团队正构建含氨基酸突变的细胞系验证。她表示,原本需两到三年实验才能锁定精确氨基酸,如今有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合分散的衰老生物学发现并生成可验证假设。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设经实验验证,或为靶向联合疗法铺路。Co-Scientist 还从肝生物学与药理学证据中筛出值得关注的机制和候选联合疗法,以应对潜在药物配对的组合爆炸。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从已有药物文献中筛选可重定位治疗肝纤维化的候选药。
推荐理由:斯坦福团队用 Co-Scientist 筛选抗纤维化药物,实验显示其候选药物表现优于研究者自选,可了解 AI 辅助药物重定位的实际验证方式。
Google DeepMind 与 Google Research 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天以 80% 置信度预测飓风 Melissa 将以五级强度登陆牙买加,三日前置信度接近 100%。
推荐理由:原文给出AI气象模型在真实飓风预警中的提前量与置信度数据,可观察AI预报在业务决策中的实际位置。
IBM 在 Hugging Face 发布两款 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 与 granite-embedding-311m-multilingual-r2,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)及 9 种编程语言代码检索。
OpenAI 的 Parameter Golf 活动吸引 1000+ 名参与者、收到 2000+ 份提交,围绕 AI 辅助机器学习研究、编码智能体、量化和新型模型设计展开,且全程受严格约束。
Hugging Face 博客发布技术文章,解析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章梳理了 Amazon EC2 P5(H100/H200)与 P6(B200/B300)实例的算力规格,并指出预训练、后训练与推理正走向融合的基础设施需求:紧耦合加速计算、高带宽低延迟网络与分布式存储。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构与分解策略由外部预设,而非模型自主决定。
Import AI 作者 Jack Clark 认为,到 2028 年底有 60% 以上概率出现无需人类参与的 AI 研发,即前沿模型能自主训练出自己的后继版本。
Google Research 公布其开放科学成果:十余年开源工具与数据集已服务全球超 25 万名研究人员和开发者。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
OpenAI 发布一套新框架,分析 921 种职业和 1.48 亿个美国岗位,识别哪些角色面临自动化风险、重组、增长或受 AI 影响较小。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
OpenAI 介绍如何用 ChatGPT 探索数据集、生成洞察并创建可视化,进而把分析结果转化为可执行的决策。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,并已将模拟器在 GitHub 开源。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为有稳定性承诺的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。
推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型与迁移成本。
Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,通过掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、收入等指标。
NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。
推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。