Hugging Face 开源多面手 Transformer 智能体 JAT:通用智能体训练数据集与模型发布
Hugging Face 发布 Jack of All Trades(JAT)项目,开源首个通用智能体训练数据集 JAT dataset 及基于 GPT-Neo 的 Transformer 智能体模型,可玩视频游戏、控制机器人并执行导航指令。
Hugging Face 发布 Jack of All Trades(JAT)项目,开源首个通用智能体训练数据集 JAT dataset 及基于 GPT-Neo 的 Transformer 智能体模型,可玩视频游戏、控制机器人并执行导航指令。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
Harvey 与 OpenAI 合作,为法律从业者构建了一个定制训练的模型。
Zelma 利用 GPT-4 让教育数据变得易于获取。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于复现 Phi-1.5 的预训练数据。
推荐理由:Hugging Face 公开了构建 250 亿 token 合成预训练数据集的完整流程与代码,可供复现和迁移。
Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。
推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。
Hugging Face 与 Argilla 联合发起 Data is Better Together 实验,通过 Argilla 与 Hugging Face Spaces 让社区协作构建偏好数据集,数天内吸引 350 名贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。
Hugging Face 发布 Matryoshka 嵌入模型入门博客,介绍这类模型可输出多种维度的有效嵌入,将重要信息前置以便截断后仍保持性能。
Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。
OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。
推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Hugging Face 博客给出 PatchTST 的上手示例:先在 Electricity 数据集上直接训练并评估预测性能,再用已训练模型在 ETTh1 数据集上做零样本预测,随后进行线性探测与微调。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 Wav2Vec2-BERT(facebook/w2v-bert-2.0)完成低资源 ASR。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了基于 MLP-Mixer 架构的轻量级时序模型 PatchTSMixer。
Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。
Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本,将 Pivotal Tuning 与 Prodigy 优化器结合,并给出配套参数配置。
推荐理由:汇总 SDXL Dreambooth LoRA 微调的社区实践,含 Pivotal Tuning 与 Prodigy 优化器的参数配置和对比实验。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
OpenAI 启动数据合作计划,与各方共同创建用于 AI 训练的开源和私有数据集。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接集成 Hugging Face 生态。
一项对比实验用 LoRA 微调 RoBERTa-large、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文分类任务上评测性能。实验在单张 48GB A6000 GPU 上进行,统一将最大序列长度设为 512 以保证公平比较,其中 RoBERTa-large 为 355M 参数基线,另两个模型均为 7B 参数规模。
Hugging Face 发布教程,展示如何用其 GitHub 组织前 10 个公开仓库的代码微调 StarCoder,训练出名为 HugCoder 的代码补全助手。
推荐理由:完整复现了从数据采集、QLoRA 微调到 VS Code 本地部署的全流程,并给出成本与效果对比,可迁移到自有代码库。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可对数据集做交互式可视化,无需复制或预处理数据。Spotlight 支持加载预测结果与嵌入向量,通过相似度图、混淆矩阵等布局定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查流程。
作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。用户通过 Spaces、AutoTrain 和 ChatUI 三个工具,选用 Meta Llama 2 7b 基础模型和 Alpaca 指令数据集完成微调,再部署为可分享的聊天应用。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,采用 Apache 2.0 许可,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开源模型。
推荐理由:Mistral AI 借首款开源模型发布同时交代了开源路线与商业部署计划,可看清其早期定位。
Hugging Face 发布博客,梳理 LLM 生产部署的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并给出在 2 节点、每节点 8 张 80GB A100 上的配置。
TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。该合作面向有模型定制需求的企业客户。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。
Hugging Face 用机器学习为 Hub 上缺少语言元数据的数据集自动检测语言,并通过 librarian-bots 提交 PR 补充元数据。Hub 现有约 5 万个公开数据集,但约 87% 未标注语言,仅约 13% 包含语言信息。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,利用 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Optimum Habana v1.7 在 Habana Gaudi2 上微调视觉语言模型 BridgeTower,相比 A100 提速 2.5 倍、相比 H100 提速 1.4 倍。这一提升依赖硬件加速的数据加载,通过 dataloader_num_workers 参数分配专用子进程即可启用,适用于各类受数据加载瓶颈制约的视觉模型。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层实现低资源语音识别。MMS 预训练检查点覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错误率。低资源语言推荐用 Adapter 训练替代全模型微调,更省内存且性能更好。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了 GPT-4 自动评估与 Scale AI 人类标注在开源指令模型上的偏好排序。