跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

130 条精选近 30 天 9 条共收录 231 条

更新

精选归档 · 第 5 页

6月3日周二第 81–100 条
5月21日周三
5月7日周三
4月29日周二
  1. Hugging Face Blog62

    Meta 发布 Llama Guard 4 与 Llama Prompt Guard 2

    Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个 Llama Prompt Guard 2 模型(86M 和 22M 参数),模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。

    推荐理由:Meta 发布 Llama Guard 4 多模态安全模型与 Prompt Guard 2,读者可了解其架构裁剪方式与相对前代的性能变化。

4月16日周三
  1. OpenAI News80

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 的系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的工具调用范围,可据此了解新模型在推理之外的能力边界。

4月5日周六
  1. Hugging Face Blog88

    Meta 发布 Llama 4 Maverick 与 Scout,上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数)两款原生多模态 MoE 模型,均为 17B 激活参数,权重已上线 Hugging Face 的 meta-llama 组织。

    推荐理由:Meta 发布 Llama 4 两款 MoE 多模态模型,Hugging Face 同步给出架构细节与部署方式,便于判断长上下文与端侧部署取舍。

3月18日周二
  1. Hugging Face Blog66

    NVIDIA 在 GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 与 Isaac GR00T N1

    NVIDIA 在 GTC 2025 上发布三款面向物理 AI 的开源成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。

    推荐理由:NVIDIA 在 GTC 2025 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。

3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持 128k 上下文与多模态理解

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,采用 Apache 2.0 许可。

    推荐理由:Mistral 官方给出小模型在文本、多模态与长上下文上的对比数据,可据此判断端侧部署的选型空间。

3月12日周三
  1. Hugging Face Blog82

    Google 发布 Gemma 3 开源多模态模型,覆盖 1B 至 27B 四种尺寸

    Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。

    推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。

3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 OCR API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可读取图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出与 Google Document AI、Azure OCR、Gemini 系列的横向基准对比,可据此判断文档解析在 RAG 流程中的选型空间。

3月4日周二
2月20日周四
2月17日周一
  1. Mistral AI62

    Mistral 发布 24B 区域语言模型 Mistral Saba

    Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,基于中东和南亚地区精选数据集训练。该模型支持阿拉伯语和多种印度语系语言,在南印度语系如泰米尔语上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。

    推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖和本地部署方式。

2月7日周五
1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉语言模型支持

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像可在 agent.run 时通过 images 参数一次性传入,也可借助 step_callbacks 在每步把截图写入 ActionStep 的 observation_images 动态注入。

    推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,并附可运行的浏览器智能体示例代码。

1月23日周四
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM-256M 与 500M 模型

    Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个基座模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。

    推荐理由:官方披露了 256M 与 500M 两个新模型在视觉编码器、数据配比和 tokenization 上的取舍,可据此判断小模型多模态的可行边界。

12月9日周一
  1. OpenAI News80

    OpenAI 视频生成模型 Sora 上线 sora.com

    OpenAI 的视频生成模型 Sora 已在 sora.com 开放使用,支持生成最高 1080p 分辨率、最长 20 秒的视频,并提供宽屏、竖屏和方形画幅。用户可导入自有素材进行延展、重混和融合,也可直接由文本生成全新内容。

    推荐理由:OpenAI 官方公布 Sora 的开放入口与分辨率、时长、画幅等关键规格,读者可据此判断可用范围。

  2. OpenAI News62

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位是为用户提供更丰富的叙事与创意表达工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型来源,可据此了解其视频生成能力边界。

12月5日周四
  1. Hugging Face Blog62

    Google 发布 PaliGemma 2 视觉语言模型,提供 3B 到 28B 三种规格

    Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 2 提供 3B 到 28B 多规格与三种分辨率,读者可据此判断微调选型空间。

11月26日周二
  1. Hugging Face Blog60

    Hugging Face 发布 2B 视觉语言模型 SmolVLM

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。

    推荐理由:原文给出 2B 视觉语言模型的显存占用、吞吐对比和完整开源训练流程,便于判断端侧多模态的落地空间。