Hugging Face 专家支持案例:用 LLM-as-a-Judge 强化 Farmer.chat 的 RAG 应用
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解数据套利、多语言偏好训练与模型合并如何组合成多语言能力。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式精炼方法改进数据质量。初版 CinePile 于 2024 年 5 月推出,含约 30 万训练样本和 5000 测试样本,人类表现曾超最佳商业视觉模型 25%、开源模型 65%。2.0 版与 Hugging Face 合作,针对退化问题、视觉依赖和难度评估等局限进行优化。
Hugging Face 发布生成式 AI 服务 HUGS,基于 Text Generation Inference 和 Transformers 构建,提供零配置的优化推理微服务,可在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的优化推理部署压缩到零配置,读者可据此判断自托管开源模型的门槛与成本变化。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:原文给出了水印的配置参数、检测器训练流程与已知局限,读者可据此判断该方案在自家生成链路中的落地条件。
OpenAI 与 Lenfest Institute 联合推出 AI Collaborative and Fellowship 计划。该计划旨在支持新闻编辑室探索 AI 应用,具体参与方式、资助金额及时间安排尚未在原文中披露。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 作为第三方扫描器集成到其模型扫描套件中,用于检测 pickle 等序列化格式的任意代码执行漏洞。所有公开模型仓库在推送文件后将自动被 Guardian 扫描,无需用户操作。Hugging Face 表示目前已扫描数亿个文件,但由于平台有超过 100 万个模型仓库,扫描结果可能不会立即显示。
Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,加载模型时设置 device: 'webgpu' 即可启用。
推荐理由:官方发布说明列出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,已集成进 outlines 并放出 Python 绑定。
Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。
推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。
Keras 从 day 1 起就支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 3.2 版本,需要转换时会在运行中即时完成。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积后损失与全批量训练不一致,正确做法应是累积步内总损失除以全部非 padding token 数,而非各批次损失的平均值。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应,并借助 AI 研究助手来保护隐私。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准测试评估智能体完成机器学习工程工作的能力。
Hugging Face 与 AMD 合作验证了基于 Zen5 架构的第五代 EPYC(Turin)CPU 对 Hugging Face 生态的支持,在 Meta Llama 3.1 8B 推理测试中,128 核 Turin 相比 96 核 Genoa 在多数配置下吞吐量提升约 2 倍。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 与 Dask 结合,用 FineWeb-Edu 分类器对 FineWeb 数据集做教育价值打分,从本地 pandas 处理 100 行扩展到 Dask 在云端多 GPU 上并行处理 2.11 亿行。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:Gradio 5 把 SSR、低延迟流式和安全审计打包进稳定版,可据此判断现有 ML 演示应用是否需要升级。
OpenAI 与 Hearst 达成内容合作,将 Hearst 旗下品牌精选的生活方式与本地新闻内容引入 OpenAI 产品。
Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。
OpenAI 发布 canvas,一种在 ChatGPT 中写作和编码的新方式。官方页面仅给出这一介绍,未披露具体功能细节与开放范围。
推荐理由:OpenAI 官方公布 ChatGPT 的写作与编码新界面 canvas,可据此了解其交互形态的调整方向。
非凡研究 6 月报告显示,全球 1500 家活跃 AI 公司中 751 家位于中国,其中 103 家已出海扩张。腾讯云、华为、阿里等巨头聚焦东南亚与中东的云和 AI 基础设施,字节跳动七个月内推出 11 款海外应用,CapCut 月活超 3 亿、累计移动端收入达 1.25 亿美元。
OpenAI 宣布获得新一轮融资,用于推进让通用人工智能惠及全人类的使命,并扩大 AI 带来的效益。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 宣布微调 API 支持视觉能力,开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升视觉表现。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉定制能力的开放范围。
OpenAI 在 API 中推出 Prompt Caching,对模型近期已见过的输入自动提供折扣。官方说明该机制面向重复出现的输入内容,具体折扣幅度与适用条件未在摘要中给出。
推荐理由:OpenAI 在 API 层面对近期出现过的输入自动打折,读者可据此判断长提示词与重复上下文的成本变化。
OpenAI 在 API 平台上线模型蒸馏功能,可用大型前沿模型的输出微调出高性价比的小模型,全部流程在 OpenAI 平台上完成。
Altera 借助 GPT-4o 构建了一个智能体与人类协作的新领域。该方向聚焦于让 AI 智能体与人类协同工作,拓展人机协作的交互形式。
OpenAI 封禁了一批利用 AI 起草滥用举报和投诉的账号,这些举报针对越南公众人物及平台。
OpenAI 封禁了一批伊朗来源的 STORM-2035 账号,这些账号利用 AI 生成美国和英国选举相关内容并发布到多个网站。
OpenAI 封禁了一批与伊朗关联的 STORM-0817 账号,这些账号利用 AI 调试 Android 恶意软件、抓取社交平台内容并翻译工具。
OpenAI 封禁了一批通过一家以色列初创公司访问其模型、用于生成对话并在 X 上发送赌博网站链接的账号。这些账号借助该初创公司调用 OpenAI 模型,批量生成内容并附带赌博站点链接进行传播。
Hugging Face 推出 BenCzechMark,这是首个面向捷克语的大语言模型综合评测套件,包含 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套排行榜已收录 25 个以上不同规模的开源模型,任务覆盖阅读理解、事实知识、捷克语理解、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等,并采用 Acc、EM、AUROC、Ppl 等指标评估。
OpenAI 封禁了一个疑似源自美国的账号,该账号利用 AI 生成虚假的 ChatGPT 报错信息,声称能检测“俄罗斯水军”活动。
OpenAI 封禁了一批源自俄罗斯的"Stop News"账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰及西方国家开展影响力活动。