跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

130 条精选近 30 天 9 条共收录 231 条

更新

精选归档 · 第 6 页

11月18日周一第 101–120 条
  1. Mistral AI66

    Mistral 为 le Chat 加入联网搜索、Canvas 与图像生成

    Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。

10月24日周四
10月1日周二
9月25日周三
  1. Hugging Face Blog80

    Llama 3.2 发布:多模态视觉模型与 1B/3B 端侧文本模型上线 Hugging Face

    Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 11B 和 90B 两个尺寸的视觉模型(各含 base 与指令微调版)以及 1B、3B 端侧文本模型,均已上线 Hugging Face Hub。

    推荐理由:Meta 与 Hugging Face 同步放出 10 个开放权重模型,含 11B/90B 视觉版与 1B/3B 端侧文本版,可据此判断本地多模态与端侧部署的可行边界。

9月17日周二
  1. Mistral AI70

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用 400M 参数从头训练的视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入。

    推荐理由:官方给出架构细节、MMMU 等基准对比和 Apache 2.0 许可,可据此判断开源多模态模型的当前水位。

5月24日周五
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。

5月13日周一
  1. OpenAI News82

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。

    推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。

4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。

4月15日周一
  1. Hugging Face Blog62

    Hugging Face 发布 8B 多模态模型 Idefics2

    Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的多模态模型,可接受任意文本与图像序列输入并生成文本回复,支持图像问答、文档信息抽取和基础算术。

    推荐理由:8B 参数、Apache 2.0 许可并同步放出多模态指令微调数据集,读者可据此判断开源多模态的可用起点。

4月11日周四
  1. Hugging Face Blog62

    视觉语言模型解析:从原理、选型到用 TRL 微调

    Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。

    推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

2月15日周四
  1. OpenAI News85

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。

    推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。

11月6日周一
9月25日周一