HuggingChat 推出 Community Tools,可将任意 Space 变成模型可调用工具
Hugging Face 在 HuggingChat 上线 Community Tools,用户可把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
Hugging Face 在 HuggingChat 上线 Community Tools,用户可把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
OpenAI 与 The Met 服装学院合作推出展览"Sleeping Beauties: Reawakening Fashion",借助 AI 展现艺术与创意潜力。该展览旨在通过 AI 丰富人们的生活体验。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布使用教程。示例基于 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
微软 6 月发布的 Florence-2 视觉语言模型提供 0.2B 和 0.7B 两个小尺寸版本,支持 captioning、目标检测、OCR 等任务,但官方模型不含 VQA 能力。作者在 DocVQA 上微调后,验证集 Levenshtein 相似度从 0 提升至 57.0,并开源了 Colab notebook 与演示 Space。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开放模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议其加入开源 re-ranker 模型以更低成本、更快、更好地为演示文稿匹配图文素材。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断检查并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,从而加速癌症患者获得治疗。
TII 发布第二代 Falcon 2 模型,包括 11B 基座语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:原文给出 Falcon 2 11B 的架构、训练数据与评测对比,可据此判断小尺寸开源模型与多模态路线的取舍。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。
推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。
OpenAI 发布最新旗舰模型 GPT-4o,同时把更多能力开放给 ChatGPT 免费用户。官方称此次发布包含新模型以及面向免费用户的功能扩展,具体能力与开放范围尚未在摘要中展开。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。官方称此次更新同时涉及新模型与免费层的能力范围。
推荐理由:OpenAI 官方发布 GPT-4o,并说明 ChatGPT 免费层将获得更多能力,可据此了解其模型与免费策略的同步变化。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的多模态模型,可接受任意文本与图像序列输入并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步放出多模态指令微调数据集,读者可据此判断开源多模态的可用起点。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。
推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。
推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。
OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。
推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 GPT-4 Turbo with Vision。开发者产品方面新增 Assistants API,并开放 DALL·E 3 API。
推荐理由:OpenAI 在 DevDay 一次性公布模型与开发者产品更新,可据此了解其 API 能力与定价方向的变化。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,仅使用公开数据和模型(LLaMA v1 与 OpenCLIP),提供 9B 和 80B 两个参数规模,各有基础版和指令微调版。
推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可据此了解开源多模态模型当时的能力边界与训练数据构成。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图工具箱扩展出视频、3D 与图像编辑能力。新增支持 DeepFloyd IF、Stability AI SDXL、OpenAI Shap-E 文生 3D,以及 VideoFusion、Text2Video-Zero 文生视频管线。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性,面临算力成本高、高质量数据集稀缺、视频描述模糊三大挑战。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。
推荐理由:OpenAI 官方公布 GPT-4 的模型定位与多模态输入能力,可据此了解其与人类基准表现的差距。
Be My Eyes 借助 GPT-4 改造视觉无障碍体验。该应用将 GPT-4 的视觉能力用于帮助视障用户理解图像内容。
OpenAI 发布 GPT-4,官方介绍其可在创意与技术写作任务中与用户生成、编辑和迭代内容,例如作曲、写剧本或学习用户的写作风格。
推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑和迭代能力。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可用它完成图像描述、带提示词图像描述、视觉问答和对话式提示四类图像到文本任务。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练方法等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 上手这些模型。
Hugging Face 公布其计算机视觉生态进展:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub。目前 Hub 上已有超 75 个 PaddlePaddle 模型,包括 UIE、ERNIE 3.0、Ernie-Layout 等,并支持 Inference API 与交互式 Widget。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。文档图像分类中,LayoutLMv3 和 Donut 等多模态模型在 RVL-CDIP 上可达 95% 准确率,优于 BERT-base 的 89% 和纯视觉 DiT 的 92%。
Hugging Face 在 Transformers 库中加入 Perceiver IO,这是首个可处理文本、图像、音频、视频、点云及其组合的 Transformer 类模型,并随附示例 Space 与 notebook。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套架构如何用 latent 空间统一处理文本、图像、音频与光流。
一个跨 12 个时区的团队用 RSICD、UCM 和 Sydney 三个遥感数据集微调了 OpenAI 的 CLIP,让模型能按文本描述检索卫星图像。训练采用对比学习,并用 Torchvision 图像增强和 Marian MT 回译文本增强抑制过拟合,评估显示增强后过拟合明显下降。模型已开放下载,并提供在线 demo。
OpenAI 在 CLIP 中发现一类神经元,无论概念以字面、符号还是概念形式呈现都会产生响应。这可能解释 CLIP 在分类出人意料的视觉变体时仍保持准确的原因,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念形式响应同一概念的多模态神经元发现,有助于理解模型的关联与偏见来源。