BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 的 PEFT 库新增了面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,用计算复杂度类别评估 LLM 推理能力。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Hugging Face 博客给出 PatchTST 的上手示例:先在 Electricity 数据集上直接训练并评估预测性能,再用已训练模型在 ETTh1 数据集上做零样本预测,随后进行线性探测与微调。
Hugging Face 发布教程,介绍如何用 🤗 Transformers 微调 Wav2Vec2-BERT(facebook/w2v-bert-2.0)完成低资源 ASR。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了基于 MLP-Mixer 架构的轻量级时序模型 PatchTSMixer。
Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。
Vectara 基于 Hugging Face 开源排行榜模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持社区提交新模型进行评估。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 transformers、PEFT、TRL 生态兼容,可将 LLM 微调速度提升约 2 倍并降低显存占用,精度相对标准 QLoRA 无下降。
推荐理由:原文给出 Unsloth 与 TRL 的集成方式和 59 次基准数据,读者可据此判断微调成本能降多少。
Hugging Face 发布 aMUSEd,一个基于掩码图像建模(MIM)的非扩散文生图模型,是对 Google MUSE 的开源复现,采用宽松许可证并以研究预览形式发布。
Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本,将 Pivotal Tuning 与 Prodigy 优化器结合,并给出配套参数配置。
推荐理由:汇总 SDXL Dreambooth LoRA 微调的社区实践,含 Pivotal Tuning 与 Prodigy 优化器的参数配置和对比实验。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型,在多数基准上超过 Llama 2 70B,推理速度快 6 倍,并在多数标准基准上追平或超过 GPT3.5。
推荐理由:官方给出稀疏 MoE 架构的参数量与推理成本对比,可据此判断开源模型在性价比上的位置。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,含基础版与 Instruct 版,支持 32k token 上下文,以 Apache 2.0 许可开放商用。
推荐理由:Hugging Face 官方给出 Mixtral 的架构说明、基准对比与量化部署路径,可据此判断 MoE 开源模型的落地成本。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 Llama 2 等 LLM 进行文本生成。用户可将 Llama-2-7b-hf 编译导出为 Neuron 格式,并选择 budget、latency、throughput 等不同配置,其中 7B 与 13B 模型均提供预编译版本,最大序列长度为 2048。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断前端部署与隐私场景的可行性。
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。
Hugging Face 推出目标检测排行榜(Object Detection Leaderboard),对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并详解了这些指标的计算方法及评估中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短超 10 倍,10 秒音频样本生成从 30 秒以上降至 1 秒。AudioLDM 2 提供 1.1B 和 1.5B 三种 checkpoint,可生成音效、人声和音乐。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
Hugging Face 博客演示如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,分三阶段将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Zama 展示如何借助全同态加密(FHE)在加密数据上运行大语言模型,并基于 Hugging Face transformers 库改造 GPT2 实现加密推理。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。
推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。
Hugging Face 与 Panel 合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。Panel 是 HoloViz 生态下的开源 Python 库,支持 Matplotlib、Plotly、Bokeh 等绘图库,可构建仪表盘和多页交互应用,并借助 Pyodide 与 WebAssembly 在浏览器中运行。