Google 发布 CodeGemma 代码模型系列,含 2B 与 7B 三个版本
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
Hugging Face 联合 Intel Labs 与 UKP Lab 开发的 SetFit 少样本微调框架,借助 Optimum Intel 在 Intel Xeon CPU 上通过训练后静态量化(PTQ)可将推理速度提升 7.8 倍。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,可输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可上手。教程以在 Hugging Face Space 的 JupyterLab 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。文中还介绍了 Transformers 库、Hub 与 Spaces 的基本概念。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试套取虚构银行 XYZ001 客户的敏感信息,再投票选出隐私保护更强的模型。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于复现 Phi-1.5 的预训练数据。
推荐理由:Hugging Face 公开了构建 250 亿 token 合成预训练数据集的完整流程与代码,可供复现和迁移。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。
推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。
Hugging Face 发布教程,展示如何借助 Optimum Intel 与 IPEX 在英特尔 Xeon CPU 上加速 BGE 嵌入模型,并集成进 fastRAG 的 RAG 流程。优化聚焦 45M、110M、355M 参数的 BGE small、base、large 三款模型,通过 int8 量化、bf16 及 AMX 加速降低单条查询延迟并提升吞吐。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 与 Argilla 联合发起 Data is Better Together 实验,通过 Argilla 与 Hugging Face Spaces 让社区协作构建偏好数据集,数天内吸引 350 名贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布基于 Optimum Habana 的自定义 pipeline 类,可在 Intel Gaudi 2 AI 加速器上用几行代码运行 Llama 2 系列(7b、13b、70b)文本生成。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。
Hugging Face 发布 Matryoshka 嵌入模型入门博客,介绍这类模型可输出多种维度的有效嵌入,将重要信息前置以便截断后仍保持性能。
Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。
Upstage 在 Hugging Face 上发起 Open Ko-LLM Leaderboard,为韩语大模型提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA、Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 的 PEFT 库新增了面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,面向全球开发者开放生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,用计算复杂度类别评估 LLM 推理能力。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Hugging Face 博客给出 PatchTST 的上手示例:先在 Electricity 数据集上直接训练并评估预测性能,再用已训练模型在 ETTh1 数据集上做零样本预测,随后进行线性探测与微调。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Patronus 团队联合 Hugging Face 发布 Enterprise Scenarios Leaderboard,用于评估语言模型在真实企业场景中的表现。
Hugging Face 博客展示了在第四代 Intel Xeon 上通过 8bit/4bit 量化结合辅助生成(assisted generation),让 StarCoder-15B 推理加速超过 7 倍。
Hugging Face 推出 Hallucinations Leaderboard,通过 in-context learning 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、HaluEval 等基准上评测大语言模型的幻觉表现。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。