Infini-Attention 复现失败实验:压缩记忆为何越用越差
Hugging Face 团队复现 Google 的 Infini-Attention 后发现,随着记忆压缩次数增加,模型性能持续下降,该实验被判定为失败。团队认为 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案,并开源了训练 checkpoint 供测试。
Hugging Face 团队复现 Google 的 Infini-Attention 后发现,随着记忆压缩次数增加,模型性能持续下降,该实验被判定为失败。团队认为 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案,并开源了训练 checkpoint 供测试。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:原文给出跨模型统一工具调用接口与 Transformers 辅助函数,读者可据此判断迁移成本与复用方式。
阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。
推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。
Zico Kolter 加入 OpenAI 董事会,并将同时加入安全与安保委员会。OpenAI 表示,此举旨在以 AI 安全与对齐领域的专业能力强化公司治理。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入,创始人此前在 Apple 构建并扩展内部 ML 基础设施。XetHub 的技术让 Git 可扩展到 TB 级仓库,HF CTO Julien Chaumond 表示团队将帮助 Hub 把存储后端换成自研的 LFS 替代方案。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
乐天(Rakuten)将数据与 AI 结合,用于挖掘客户洞察并释放价值。该案例展示了通过 API 把数据接入 AI 能力,从而把数据转化为面向客户的价值。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行 base prompt、few-shot 提示或微调,并可自带数据集。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema,便于判断对现有集成方式的影响。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、commit 签名、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描。Enterprise Hub 用户还可使用 SAML 2.0 与 OIDC 协议的 SSO、Resource Groups 等高级控制。
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略增。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 内用标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
OpenAI 正在测试 SearchGPT,这是新搜索功能的临时原型,可提供快速及时的答案并附上清晰相关的来源。
推荐理由:OpenAI 官方披露搜索原型 SearchGPT 的测试状态,可据此了解其搜索产品的早期形态与定位。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。
推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。
OpenAI 开发并应用了基于规则奖励(RBRs)的新方法,让模型在无需大量人工数据采集的情况下对齐到安全行为。该方法旨在提升模型的安全表现,减少对人工标注数据的依赖。
Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。
推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
OpenAI 发布 GPT-4o mini,定位为更具成本效益的智能模型。原文正文抓取失败,仅标题可用。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基础版和指令微调版权重。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等可对比细节。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全与用户访问管理。
OpenAI 提出用证明者-验证者博弈提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证,对人和机器都更可信。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。
推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。
Mistral AI 发布专注 STEM 与复杂多步数学推理的 Mathstral 7B,基于 Mistral 7B 构建,与 Project Numina 合作产出。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 135M 到 1.7B 三档小模型的训练数据配方与评测对比,可据此判断端侧小模型的取舍。
Hugging Face 博客展示了如何借助 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集,微调领域专用嵌入向量模型,再搭建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。
OpenAI 与洛斯阿拉莫斯国家实验室达成研究合作,共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量报告,以便在训练前决定是否进一步过滤。该功能面向含 PII 的标注数据集和大规模预训练数据集,后者虽经过滤仍可能残留少量敏感信息。数据集所有者也可用报告验证发布前的 PII 过滤流程。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 300K+ 个 Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间无缝切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布使用教程。示例基于 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作开发了一套基于 RAG 的主权数据方案,用于支持 EduRénov 校园生态改造项目,首阶段已完成。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及行数区间检索,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性过滤。这些筛选可相互组合,并与语言、任务、许可证等已有过滤器及文本搜索栏搭配使用。