Hugging Face 与 JFrog 合作提升 AI 模型安全扫描透明度
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,比仅做模块名模式匹配的 picklescan 更进一步,可减少误报并覆盖 Keras Lambda 层等更多文件格式的漏洞。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,比仅做模块名模式匹配的 picklescan 更进一步,可减少误报并覆盖 Keras Lambda 层等更多文件格式的漏洞。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
OpenAI 与九家美国国家实验室联合举办首届千人科学家 AI Jam Session,汇聚顶尖科学家参与。这是该类活动的首次举办。
Hugging Face 博客介绍如何用 Arize Phoenix 对基于 smolagents 构建的 Agent 进行追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Mercari 借助 GPT-4o mini 和 GPT-4 简化卖家上架流程、优化商品信息并提升销量,推出 AI Listing Support 和 Mercari AI Assistant 等功能。这些能力正在改变这一在线交易平台的售卖体验。
OpenAI 发布 GPT-4.5 系统卡,并推出该模型的研究预览版。OpenAI 称 GPT-4.5 是其目前规模最大、知识量最多的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡并放出研究预览,读者可据此了解这一代模型在规模与知识量上的定位。
Endex 基于 OpenAI 的推理模型 o1 和 o3-mini 构建自主金融分析师,用于打造金融分析的未来。
Hugging Face 与印度科学理工学院 IISc/ARTPARK 达成合作,提升开源多模态多语言数据集 Vaani 的可访问性与可用性。Vaani 目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖印度全部 773 个地区、54 种语言;目前已开源 790 小时转写音频,来自约 7 万名说话者。
OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评测,以及针对关键风险领域所构建的缓解措施概览。
推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解其外部红队与 Preparedness Framework 风险评测的做法。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的通信库,内置语音检测与轮次切换、Gradio WebRTC UI,并支持 WebSocket 和挂载到 FastAPI。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将潜空间扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以降低高分辨率图像和视频生成对消费级 GPU 的显存压力。
Google 发布 SigLIP 2 多语言视觉语言编码器系列,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local Loss 与 Masked Prediction Loss 等训练目标,在零样本分类、图文检索和视觉表征迁移上均优于前代。
Uber 客户至上部门 AI 与产品负责人 Jai Malkani 分享了 Uber 如何借助 AI 实现出色的即时服务体验。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。
推荐理由:Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已上线 demo。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成价值 100 万美元的真实自由职业软件工程任务。该基准以真实外包项目为题目,考察模型在实战软件工程中的能力与变现潜力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 或通过 HF 路由调用,PRO 用户每月获赠 2 美元推理额度。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,基于中东和南亚地区精选数据集训练。该模型支持阿拉伯语和多种印度语系语言,在南印度语系如泰米尔语上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。
推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖和本地部署方式。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 的新闻内容引入 ChatGPT。
Hugging Face Hub 新增 Fireworks.ai 作为推理服务商,可直接在模型页及整个 HF 生态中调用其无服务器推理。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上全部 3751 个模型,修复了答案格式、SymPy 解析和答案比对三类问题。
推荐理由:原文给出旧评测器失效的具体案例与重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
Fanatics Betting and Gaming 首席财务官 Andrea Ellis 分享了公司如何利用 AI 聚焦大局。这是一场围绕该博彩公司 AI 应用的对话。
Wayfair 首席技术官 Fiona Tan 分享了该公司如何用 AI 塑造零售业的未来。
Rogo 借助 OpenAI o1 扩展 AI 驱动的金融研究能力。o1 的推理能力被用于金融分析场景,帮助 Rogo 提升研究效率。
Hugging Face 博客实测了 10 亿次分类与嵌入推理的成本:在 nvidia-L4($0.8/hr)上,135M 的 DistilBERT 分类模型处理 10 亿输入需 $253.82,149M 的 gte-modernbert-base 嵌入需 $409.44,2.21B 的 ColQwen2 视觉嵌入则高达 $44,496.51。
Hugging Face 发布了一套用于构建视频生成数据集的开源工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过块(最大 64MB)和分片聚合,把 CAS 条目减少约 1000 倍,部分场景上传下载提速 2-3 倍。
推荐理由:Hugging Face 公开了 Xet 存储的块级聚合设计,读者可据此理解大文件去重为何不能只靠分块。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。
推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。
OpenAI 与 Schibsted Media Group 宣布达成内容合作,将把《卫报》(Guardian)的新闻与历史存档内容引入 ChatGPT。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构。新版回应社区对阿拉伯语专项任务、评测透明度与数据集多样性的批评。
OpenAI 在 Super Bowl 投放了其史上首支电视广告,旨在激发人们对 AI 的好奇心。广告传递的核心信息是:AI 能开启新的可能性、让生活更有成就感并提升生产力,正如此前所有工具对前人所做的那样。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
OpenAI 面向欧洲客户推出数据驻留功能,允许将数据存储在欧洲本地。该功能建立在 OpenAI 面向全球客户的企业级数据隐私、安全与合规体系之上。
OpenAI 宣布与加州州立大学(CSU)系统合作,将 ChatGPT 带给 50 万名学生和教职员工,这是迄今规模最大的一次 ChatGPT 部署。该合作旨在扩大 AI 在教育中的使用,并帮助美国培养具备 AI 能力的劳动力。
OpenAI 展示了用 ChatGPT 为美甲设计寻找灵感。用户可通过 ChatGPT 获取美甲创意与款式参考。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在真实数据分析场景中的明显差距。DABstep 同时提供数据集、任务、评测、实时排行榜与基线,仅需代码执行环境即可运行并自动评测。
Hugging Face 开源了复现 OpenAI Deep Research 的 Open DeepResearch 框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的对比数字与代码智能体的取舍依据。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出推理与微调命令。
推荐理由:原文给出两个机器人基础模型在 LeRobot 的移植细节与微调命令,读者可据此判断 VLA 模型的落地门槛。
OpenAI 展示如何基于 ChatGPT 构建自定义数学辅导工具,将 ChatGPT 用于个性化辅导场景。内容围绕 ChatGPT 与个性化辅导展开,说明如何把通用对话模型改造成面向数学学习的专属辅导助手。
OpenAI 发文介绍如何用 ChatGPT 钓大比目鱼。
OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。