跳到正文
4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月27日周一
4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

4月23日周四
  1. Hugging Face Blog60

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以自家 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下本地模型托管、消息契约与工具调用循环的架构取舍。

4月22日周三
  1. OpenAI News62

    OpenAI 发布 Privacy Filter 开放权重模型

    OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。

    推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。

4月21日周二
  1. Hugging Face Blog33

    QIMMA قِمّة:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。

4月16日周四
4月9日周四
  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。

    推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。

  2. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

4月3日周五
4月2日周四
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式搭载在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可在 Hugging Face 开放。

    推荐理由:IBM 发布面向企业文档的紧凑视觉语言模型,给出表格、图表与 KVP 抽取的基准对比,可据此判断小模型在文档流水线中的位置。

  2. Mistral AI34

    Mistral AI 推出 Spaces:一款为人类与 AI 智能体打造的 CLI

    Mistral AI 发布 Spaces CLI,可一条命令完成项目脚手架、开发环境启动与部署,内置 `spaces init`、`spaces dev` 等命令。该工具为每个交互式提示词提供对应的 flag 与 `-y` 参数,使 AI 智能体无需处理 ANSI 转义码即可自主操作,并在每次初始化时生成 context.json 与 AGENTS.md 供智能体读取项目上下文。

  3. Hugging Face Blog62

    Hugging Face 发布 TRL v1.0 后训练库

    Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为有稳定性承诺的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。

    推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型与迁移成本。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR 的 XR Blocks 框架结合,把自然语言提示直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 把 Gemini 与 XR Blocks 组合成自然语言生成 XR 应用的流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发门槛的变化。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 语言与 70ms 延迟等具体指标,并附与 ElevenLabs 的人工对比结果。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4 开源模型

    Mistral AI 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可配置推理强度与部署门槛。

  2. Mistral AI62

    Mistral 发布开源 Lean 4 代码智能体 Leanstral

    Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出了与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

3月13日周五
3月11日周三
3月10日周二
  1. Hugging Face Blog62

    Hugging Face Hub 推出 Storage Buckets 可变对象存储

    Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,可通过浏览器、Python 或 hf CLI 管理,地址形如 hf://buckets/username/my-training-bucket。

    推荐理由:原文给出可变对象存储的定位与 Xet 去重、预热的机制,读者可据此判断它是否适合训练中间产物的存放。

3月9日周一
3月7日周六
  1. Google Research38

    Google SpeciesNet:用 AI 识别野生动物,一年间在全球保护项目落地

    Google 开源的 SpeciesNet 模型可识别相机陷阱图像中近 2,500 个动物类别,训练数据达 6,500 万张标注图像,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可处理 25 万张以上。该模型一年前作为开源工具发布,已被哥伦比亚、爱达荷、澳大利亚和坦桑尼亚塞伦盖蒂等地的研究团队用于识别美洲狮、麋鹿、鹤鸵和狮子等物种。

3月5日周四
3月4日周三
2月19日周四
  1. Hugging Face Blog60

    IBM 与 UC Berkeley 用 IT-Bench 和 MAST 诊断企业级智能体为何失败

    IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。

    推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。

2月18日周三
2月13日周五
  1. Hugging Face Blog66

    Hugging Face 发布 CUDA kernel Agent 技能,Claude 与 Codex 端到端生成可用内核

    Hugging Face 发布 cuda-kernels Agent 技能,让 Claude Code、Codex 等编码智能体自动编写生产级 CUDA kernel,并完成 PyTorch 绑定与基准测试。

    推荐理由:Hugging Face 把 CUDA kernel 开发经验打包成 Agent 技能,并给出两个真实模型的实测数据,可迁移到其他领域知识封装。

2月11日周三
2月10日周二
2月9日周一
2月6日周五
2月5日周四