Hugging Face 将重新设计 Transformers 文档
Hugging Face 宣布将重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新文档将面向构建 AI 产品的开发者,采用代码优先和解决方案导向的方式,并用更灵活的结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Hugging Face 宣布将重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新文档将面向构建 AI 产品的开发者,采用代码优先和解决方案导向的方式,并用更灵活的结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Artificial Analysis 发布文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Mistral AI 推出非生产许可证 MNPL,允许开发者将自家技术用于非商业用途并支持研究工作,商业使用则需另循公平可持续的方式。Codestral 于同日在该许可证下发布,Mistral 表示仍会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 推出非生产许可证,读者可据此理解开源模型厂商在开放与商业化之间的授权取舍。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可同时测量吞吐量与延迟,帮助用户按需调优 LLM 部署。
TII 发布第二代 Falcon 2 模型,包括 11B 基座语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:原文给出 Falcon 2 11B 的架构、训练数据与评测对比,可据此判断小尺寸开源模型与多模态路线的取舍。
Hugging Face 与 Dell 联合推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署开源模型,将数周的工程工作缩短至几分钟。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure 模型库的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),用于评估和比较阿拉伯语大语言模型性能,服务全球超 3.8 亿阿拉伯语使用者。
Intel 在 OPEA 开放平台上展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署并由 lighteval 库评估。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有基础版和指令微调版,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器、GQA 与 8K 上下文带来的变化。
Ryght 正式公开发布面向生命科学知识工作者的免费安全平台 Ryght Preview,用于加速研究、分析与文档处理。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。
推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个开源模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,作为自有账号内的 API Endpoint。
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可上手。教程以在 Hugging Face Space 的 JupyterLab 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。文中还介绍了 Transformers 库、Hub 与 Spaces 的基本概念。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 与 Argilla 联合发起 Data is Better Together 实验,通过 Argilla 与 Hugging Face Spaces 让社区协作构建偏好数据集,数天内吸引 350 名贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布基于 Optimum Habana 的自定义 pipeline 类,可在 Intel Gaudi 2 AI 加速器上用几行代码运行 Llama 2 系列(7b、13b、70b)文本生成。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。
Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。
Upstage 在 Hugging Face 上发起 Open Ko-LLM Leaderboard,为韩语大模型提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA、Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,面向全球开发者开放生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云和硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 的 Vertex AI、TPU 等基础设施上构建自己的 AI。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
Mistral AI 开放其首个平台服务 la plateforme 的 beta 访问,提供三个对话端点和一个嵌入端点。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个对话端点和嵌入端点的模型、价格与基准表现,可据此判断其早期 API 能力边界。
Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。
Hugging Face 与 AMD 宣布在 AMD Instinct GPU 上实现开箱即用支持,所有 Transformers 模型和任务无需修改代码即可运行,示例代码与 NVIDIA GPU 上完全一致。
推荐理由:原文给出 AMD GPU 上无需改代码运行 Transformers 的支持范围与实测对比数据,可据此判断迁移成本。
Hugging Face 在 Hub 推理 API 中实现 LoRA 动态加载,让基础模型保持常驻、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应从 35 秒降到 13 秒。
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
一项对比实验用 LoRA 微调 RoBERTa-large、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文分类任务上评测性能。实验在单张 48GB A6000 GPU 上进行,统一将最大序列长度设为 512 以保证公平比较,其中 RoBERTa-large 为 355M 参数基线,另两个模型均为 7B 参数规模。
Hugging Face 发布教程,展示如何用其 GitHub 组织前 10 个公开仓库的代码微调 StarCoder,训练出名为 HugCoder 的代码补全助手。
推荐理由:完整复现了从数据采集、QLoRA 微调到 VS Code 本地部署的全流程,并给出成本与效果对比,可迁移到自有代码库。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包含众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,覆盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
Hugging Face 发布伦理与社会通讯第 5 期,回顾其今夏参与 E.U.、U.K.、U.S. 的 AI 监管讨论,CEO Clem 出席美国国会作证及参议院 AI Insight Forum,并提交对 E.U. AI Act 和 NTIA AI 问责制的建议。