Mistral 发布 Robostral Navigate 具身导航模型
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证未见集上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点、比最佳多传感器方案高 4.5 个百分点。
推荐理由:原文给出单目 RGB 相机下的导航成功率与训练方法,读者可据此判断紧凑模型做具身导航的可行边界。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
226 条精选近 30 天 17 条共收录 269 条
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证未见集上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点、比最佳多传感器方案高 4.5 个百分点。
推荐理由:原文给出单目 RGB 相机下的导航成功率与训练方法,读者可据此判断紧凑模型做具身导航的可行边界。
OpenAI 发布新一代语音模型 GPT-Live,用于实现更自然的人机交互,目前已接入 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型并接入 ChatGPT Voice,读者可据此了解语音交互能力的代际更新。
Mistral 发布 Leanstral 1.5,采用 Apache-2.0 许可,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 均为新 SOTA。
推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与成本对比,可据此判断开源证明模型的实用边界。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。
PaddleOCR 发布 PP-OCRv6 通用 OCR 模型家族并上线 Hugging Face,提供 tiny、small、medium 三档,参数从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别精度及多后端接入方式,便于按部署场景选型。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文下稳定支撑长程工作,并采用 MIT 开源许可。
推荐理由:GLM-5.2 把 1M 上下文与编码智能体能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存与质量取舍,便于判断本地低并发场景是否值得换用。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉与音频直接接入 LLM 主干,读者可据此判断本地多模态智能体的硬件门槛。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略和可审计推理统一到一次推理调用中。
推荐理由:NVIDIA 在 4B 小模型上把多模态、多语言、自定义策略与可审计推理合并进单次推理,并公开训练数据集。
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学、基因组分析和实验工作流能力。
推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学方向能力,读者可据此了解该模型在生物推理与基因组分析上的定位。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 给出跨环境与跨框架的鲁棒性提升,并首次提供量化权重,读者可据此判断本地部署计算机使用智能体的可行路径。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数混合专家(MoE)模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升超过 2 倍,模型已在 Hugging Face 开放下载,技术报告发布于 arXiv。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,可据此判断轻量模型在路由与 RAG 场景的部署取舍。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。
OpenAI 称其模型解决了已有 80 年历史的单位距离问题,推翻离散几何中的一项重要猜想,被视为 AI 驱动数学的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的能力边界。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化方向。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。