NASA 与 IBM 发布开源月球基础模型,基于 17 年轨道器数据
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
Google 发布 Gemini 4 Argon,官方称其在 18 项测试中 13 项领先,知识与长文本能力明显强于编程和 Agent 能力。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型集合,在 Hugging Face 上提供权重,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,单次前向即可预测,无需训练与特征工程,并给出四个基准的排名与效率对比。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。
Google Research 发布 TimesFM-3,这是其首个原生支持多变量预测的时间序列基础模型,参数 330M,在超过 1 万亿时间点的真实与合成时间序列语料上预训练。
推荐理由:原文给出 330M 参数、1 万亿时间点预训练与三项基准排名,可据此判断多变量零样本预测的当前水位。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Leanstral 1.5,采用 Apache-2.0 许可,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 均为新 SOTA。
推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与成本对比,可据此判断开源证明模型的实用边界。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,在保持 v1 性能的同时将计算成本最多降低 3 倍。该系列包含 Base、Tiny 和 Nano 三种规模,权重与训练代码已开放。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模从 17m 到 1b,基于 Ettin ModernBERT 编码器构建。
IBM 在 Hugging Face 发布两款 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 与 granite-embedding-311m-multilingual-r2,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)及 9 种编程语言代码检索。
Falcon-H1-Arabic 阿拉伯语模型家族发布,包含 3B、7B、34B 三个参数规模,采用 Mamba 与 Transformer 注意力并行的 Falcon-H1 混合架构。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时,并能在单个 TPU 上不到一分钟生成数百种可能天气情景。
推荐理由:官方给出 8 倍生成速度、1 小时分辨率与 99.9% 变量超越前代等指标,可据此判断 AI 天气预报的可用性边界。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
Hugging Face 发布开源训练管线 kimina-prover-rl,用于 Lean 4 形式化定理证明,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容 verl 框架。
Falcon-H1 系列发布六个开源模型,参数规模从 0.5B 到 34B,每个尺寸均提供 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用注意力与 SSM 并行混合架构覆盖 0.5B 到 34B 六个尺寸,可对照其长上下文吞吐与同尺寸 Transformer 模型的取舍。
阿联酋 TII 发布 7B 参数的 Falcon-Arabic,基于 Falcon 3 架构,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及至多 4 倍大的阿拉伯语 LLM,训练采用扩展 32,000 个阿拉伯语 token 的词表与 100% 原生阿拉伯语数据。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,每种规模各有 base 与指令微调版本。
语言技术实验室发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作 BERT 类模型的直接替换。
推荐理由:ModernBERT 以 8k 上下文和更快推理替换 BERT 类编码器,读者可据此判断 RAG 与代码检索的升级空间。
阿布扎比 TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五个基础模型,参数均在 100 亿以下。
推荐理由:Falcon3 给出五个开源模型的训练路径与基准对比,可据此判断小参数模型的效率取舍。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解数据套利、多语言偏好训练与模型合并如何组合成多语言能力。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 135M 到 1.7B 三档小模型的训练数据配方与评测对比,可据此判断端侧小模型的取舍。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于 Hugging Face 专家支持计划合作,在多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。该模型用于专利撰写、无效检索和新颖性比对,借助 Hugging Face Inference Endpoints 与 TEI,嵌入吞吐从约 300 个/秒提升至约 2700 个/秒。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码大语言模型,无需人工标注或从 GPT-4 等专有模型蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,其开源流程与评测对比可供代码模型训练参考。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,采用 Apache 2.0 许可,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开源模型。
推荐理由:Mistral AI 借首款开源模型发布同时交代了开源路线与商业部署计划,可看清其早期定位。
TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:梳理 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径,可了解开源大模型的落地方式。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,对西班牙语、法语、阿拉伯语等多数语言是首个超过 100B 参数的语言模型。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言并公开训练中间检查点,为研究大模型内部机制提供了少见的开放样本。