跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

130 条精选近 30 天 9 条共收录 231 条

更新

精选归档 · 第 7 页

8月22日周二第 121–130 条
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,仅使用公开数据和模型(LLaMA v1 与 OpenCLIP),提供 9B 和 80B 两个参数规模,各有基础版和指令微调版。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可据此了解开源多模态模型当时的能力边界与训练数据构成。

3月14日周二
  1. OpenAI News92

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。

    推荐理由:OpenAI 官方公布 GPT-4 的模型定位与多模态输入能力,可据此了解其与人类基准表现的差距。

  2. OpenAI News93

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,官方介绍其可在创意与技术写作任务中与用户生成、编辑和迭代内容,例如作曲、写剧本或学习用户的写作风格。

    推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑和迭代能力。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 与 Hugging Face 发布 ViT 和 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。

12月16日周五
12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态

    Hugging Face 在 Transformers 库中加入 Perceiver IO,这是首个可处理文本、图像、音频、视频、点云及其组合的 Transformer 类模型,并随附示例 Space 与 notebook。

    推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套架构如何用 latent 空间统一处理文本、图像、音频与光流。

3月4日周四
  1. OpenAI News60

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现一类神经元,无论概念以字面、符号还是概念形式呈现都会产生响应。这可能解释 CLIP 在分类出人意料的视觉变体时仍保持准确的原因,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念形式响应同一概念的多模态神经元发现,有助于理解模型的关联与偏见来源。

1月5日周二
  1. OpenAI News78

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 官方介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。

4月30日周四
  1. OpenAI News62

    OpenAI 发布音乐生成神经网络 Jukebox 并开源模型权重与代码

    OpenAI 发布 Jukebox,一个能生成音乐并以原始音频形式输出、包含初级演唱的神经网络,覆盖多种曲风和艺术家风格。OpenAI 同时公开了模型权重和代码,并提供用于查看生成样本的工具。

    推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可据此了解早期音乐生成模型的开源形态。

4月25日周四
  1. OpenAI News62

    OpenAI 发布 MuseNet 音乐生成神经网络

    OpenAI 发布 MuseNet,一个可生成 4 分钟乐曲、支持 10 种乐器的深度神经网络,能融合从乡村到莫扎特再到披头士的风格。MuseNet 并未被显式编程音乐知识,而是通过预测数十万份 MIDI 文件中的下一个 token 来学习和声、节奏与风格。它沿用了与 GPT-2 相同的通用无监督技术,即预测序列中下一个 token 的大规模 Transformer 模型,无论序列是音频还是文本。

    推荐理由:OpenAI 用与 GPT-2 同源的通用无监督技术生成音乐,可观察同一架构跨模态迁移的早期路径。