NASA 与 IBM 发布开源月球基础模型,基于 17 年轨道器数据
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
有用户用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类发明史短片,把人类历史压缩成一天 24 小时,全程由代码实时渲染,未使用任何视频生成模型。
9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本并提供本地部署量化模型。
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
MiniMax 于 9 月 28 日上线 M3.1-Flash-Preview,百万 token 上下文、原生多模态,在 MiniMax Code 首发并可通过 API 订阅套餐调用。
阿里巴巴 TaoLive AIGC 团队开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可按文本描述连续生成含对白、歌声或环境音的视频,支持分钟级续写和 480p、768p、1080p 横竖屏输出。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,不生成文本而是在预设选项中做选择并给出置信度,可本地运行。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,之后才向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。
推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。
Google 发布 Gemini 4 Argon,官方称其在 18 项测试中 13 项领先,知识与长文本能力明显强于编程和 Agent 能力。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部工程师广泛使用,尚未对外开放。在软件工程基准 DeepSWE v1.1 上,Gemini 4 Argon 得分 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
智东西将美团 LongCat 团队 9 月 25 日上线的预览版模型 LongCat-2.5-Preview 接入 Claude Code,连续测试复刻 Meta Muse App、制作 SpaceX 星舰升空动画和开发 3D 赛车游戏三个 Coding 任务,三项均完成可实际运行的项目。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型集合,在 Hugging Face 上提供权重,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,单次前向即可预测,无需训练与特征工程,并给出四个基准的排名与效率对比。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 用同一套权重覆盖 GUI、代码、MCP 与 API 四类接口,并公开全部评测轨迹,便于对照其成本与能力取舍。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型分别面向规模化与高复杂度任务,并给出语音智能体基准成绩与开发者接入渠道。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。