Hugging Face 与 Atla 推出 Judge Arena,用投票评测 LLM 裁判能力
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 的基准成绩与开放权重,读者可据此判断开源多模态模型与闭源前沿的差距。
OpenAI 在法国开设了其在欧洲大陆的首个办公室。这是 OpenAI 在欧洲大陆的第一处办公据点,此前其欧洲布局仅涉及其他地区。
雅诗兰黛集团借助 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察,以加速美妆创新。该案例展示了企业级 ChatGPT 在数据驱动决策与产品研发环节的具体用法。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,支持客户反馈分析、文档批量摘要与翻译、向量嵌入及数据标注等用途,适用于平台上的所有模型,每个工作区最多 100 万个进行中的请求。
Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现开放给用户按自身应用和安全标准使用。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语言包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Hugging Face 与 PyCharm 完成集成,开发者可在代码中右键选择 "Insert HF Model",直接调用 Hugging Face Hub 上的模型。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,社区用户可直接参与标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,目前仅支持公开数据集,私有数据集支持仍在征询反馈中。
OpenAI 发布 ChatGPT 搜索功能,可快速给出带相关网络来源链接的及时回答。
推荐理由:OpenAI 官方发布 ChatGPT 搜索功能,读者可了解其以链接形式给出实时网络来源的定位。
Promega 自上而下在全公司推广 ChatGPT,用于加速生产、销售和营销环节。该公司将 ChatGPT 引入制造、销售与营销等业务,以提升整体运营效率。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问场景,评估模型的事实准确性。
Decagon 与 OpenAI 合作,实现大规模、全自动的高性能客户支持。双方结合各自能力,让客户支持流程无需人工介入即可完成。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解数据套利、多语言偏好训练与模型合并如何组合成多语言能力。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式精炼方法改进数据质量。初版 CinePile 于 2024 年 5 月推出,含约 30 万训练样本和 5000 测试样本,人类表现曾超最佳商业视觉模型 25%、开源模型 65%。2.0 版与 Hugging Face 合作,针对退化问题、视觉依赖和难度评估等局限进行优化。
Hugging Face 发布生成式 AI 服务 HUGS,基于 Text Generation Inference 和 Transformers 构建,提供零配置的优化推理微服务,可在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的优化推理部署压缩到零配置,读者可据此判断自托管开源模型的门槛与成本变化。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:原文给出了水印的配置参数、检测器训练流程与已知局限,读者可据此判断该方案在自家生成链路中的落地条件。
OpenAI 与 Lenfest Institute 联合推出 AI Collaborative and Fellowship 计划。该计划旨在支持新闻编辑室探索 AI 应用,具体参与方式、资助金额及时间安排尚未在原文中披露。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 作为第三方扫描器集成到其模型扫描套件中,用于检测 pickle 等序列化格式的任意代码执行漏洞。所有公开模型仓库在推送文件后将自动被 Guardian 扫描,无需用户操作。Hugging Face 表示目前已扫描数亿个文件,但由于平台有超过 100 万个模型仓库,扫描结果可能不会立即显示。
Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,加载模型时设置 device: 'webgpu' 即可启用。
推荐理由:官方发布说明列出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,已集成进 outlines 并放出 Python 绑定。
Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。
推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。
Keras 从 day 1 起就支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 3.2 版本,需要转换时会在运行中即时完成。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积后损失与全批量训练不一致,正确做法应是累积步内总损失除以全部非 padding token 数,而非各批次损失的平均值。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应,并借助 AI 研究助手来保护隐私。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准测试评估智能体完成机器学习工程工作的能力。
Hugging Face 与 AMD 合作验证了基于 Zen5 架构的第五代 EPYC(Turin)CPU 对 Hugging Face 生态的支持,在 Meta Llama 3.1 8B 推理测试中,128 核 Turin 相比 96 核 Genoa 在多数配置下吞吐量提升约 2 倍。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 与 Dask 结合,用 FineWeb-Edu 分类器对 FineWeb 数据集做教育价值打分,从本地 pandas 处理 100 行扩展到 Dask 在云端多 GPU 上并行处理 2.11 亿行。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:Gradio 5 把 SSR、低延迟流式和安全审计打包进稳定版,可据此判断现有 ML 演示应用是否需要升级。
OpenAI 与 Hearst 达成内容合作,将 Hearst 旗下品牌精选的生活方式与本地新闻内容引入 OpenAI 产品。
Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。