跳到正文
  1. Google Research66

    Google 发布基于 TEE 的联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。

  2. NVIDIA Blog60

    NVIDIA 推出 DGX Spark 64GB 配置,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,预装 DGX OS 与 NVIDIA AI 软件栈。

    推荐理由:原文给出 64GB 新配置的价格、上市时间和双机集群方式,可据此判断本地跑大模型的门槛变化。

  1. Hugging Face Blog62

    Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

    Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 即可在本地生成,无需额外配置。

    推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的对比数据,便于判断本地推理的新选择。

  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。

  1. Google DeepMind78

    Google DeepMind 发布手语转文本模型 SL2T,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 和 Live Transcribe 中上线手语听写功能,首批支持美国手语(ASL)转英文。

    推荐理由:官方披露了 SL2T 的训练规模、手语到文本的翻译路径与隐私处理方式,可据此判断手语 AI 从实验室走向消费级产品的技术取舍。

  1. Mistral AI65

    Mistral AI 发布 Shieldstral 3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略并输出校准后的安全分数,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源安全分类器把审核策略放进推理时的自然语言问题里,可据此判断小模型在内容审核上的替代空间。

  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康信号上的规模化路径。

  1. Google Research62

    Google 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 发布新架构,将多 token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已上线 Pixel 9 和 10 系列。

    推荐理由:Google 把多 token 预测接到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。

  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉与音频直接接入 LLM 主干,读者可据此判断本地多模态智能体的硬件门槛。

  1. Hugging Face Blog72

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:Holo3.1 给出跨环境与跨框架的鲁棒性提升,并首次提供量化权重,读者可据此判断本地部署计算机使用智能体的可行路径。

  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。

    推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。

  1. Google DeepMind85

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。

    推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖从手机到工作站的四种尺寸,读者可据此判断本地部署与微调的选择空间。

  1. Hugging Face Blog62

    Transformers.js v4 发布并上线 NPM

    Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。

    推荐理由:原文给出 WebGPU 运行时重写、构建提速与包体积变化等具体数据,可据此判断浏览器端本地推理的工程成熟度。

  1. Mistral AI80

    Mistral 发布 Mistral 3 系列,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。

  1. Hugging Face Blog60

    AnyLanguageModel 发布:为 Apple 平台本地与远程 LLM 提供统一 API

    Hugging Face 发布 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的替代方案,只需替换 import 语句即可保持同一套 API。

    推荐理由:面向 Apple 平台的统一 LLM 调用接口,用同一套 API 在本地开源模型与云端模型间切换,可降低实验成本。

  1. Hugging Face Blog62

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。

  1. Hugging Face Blog62

    Falcon-H1 发布 0.5B 至 34B 混合架构开源模型系列

    Falcon-H1 系列发布六个开源模型,参数规模从 0.5B 到 34B,每个尺寸均提供 base 与 instruct 版本,采用 Apache 2.0 许可。

    推荐理由:Falcon-H1 用注意力与 SSM 并行混合架构覆盖 0.5B 到 34B 六个尺寸,可对照其长上下文吞吐与同尺寸 Transformer 模型的取舍。

  1. Hugging Face Blog76

    Hugging Face 与 Yaak 发布 L2D 开源自动驾驶数据集

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。

    推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。

  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM2 视频理解模型,含 2.2B、500M 和 256M 三个尺寸

    Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。

    推荐理由:Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。