Google 发布 PaliGemma 2 Mix 指令视觉语言模型
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已上线 demo。
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已上线 demo。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成价值 100 万美元的真实自由职业软件工程任务。该基准以真实外包项目为题目,考察模型在实战软件工程中的能力与变现潜力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 或通过 HF 路由调用,PRO 用户每月获赠 2 美元推理额度。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,基于中东和南亚地区精选数据集训练。该模型支持阿拉伯语和多种印度语系语言,在南印度语系如泰米尔语上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。
推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖和本地部署方式。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 的新闻内容引入 ChatGPT。
Hugging Face Hub 新增 Fireworks.ai 作为推理服务商,可直接在模型页及整个 HF 生态中调用其无服务器推理。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上全部 3751 个模型,修复了答案格式、SymPy 解析和答案比对三类问题。
推荐理由:原文给出旧评测器失效的具体案例与重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
Fanatics Betting and Gaming 首席财务官 Andrea Ellis 分享了公司如何利用 AI 聚焦大局。这是一场围绕该博彩公司 AI 应用的对话。
Wayfair 首席技术官 Fiona Tan 分享了该公司如何用 AI 塑造零售业的未来。
Rogo 借助 OpenAI o1 扩展 AI 驱动的金融研究能力。o1 的推理能力被用于金融分析场景,帮助 Rogo 提升研究效率。
Hugging Face 博客实测了 10 亿次分类与嵌入推理的成本:在 nvidia-L4($0.8/hr)上,135M 的 DistilBERT 分类模型处理 10 亿输入需 $253.82,149M 的 gte-modernbert-base 嵌入需 $409.44,2.21B 的 ColQwen2 视觉嵌入则高达 $44,496.51。
Hugging Face 发布了一套用于构建视频生成数据集的开源工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过块(最大 64MB)和分片聚合,把 CAS 条目减少约 1000 倍,部分场景上传下载提速 2-3 倍。
推荐理由:Hugging Face 公开了 Xet 存储的块级聚合设计,读者可据此理解大文件去重为何不能只靠分块。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。
推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。
OpenAI 与 Schibsted Media Group 宣布达成内容合作,将把《卫报》(Guardian)的新闻与历史存档内容引入 ChatGPT。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构。新版回应社区对阿拉伯语专项任务、评测透明度与数据集多样性的批评。
OpenAI 在 Super Bowl 投放了其史上首支电视广告,旨在激发人们对 AI 的好奇心。广告传递的核心信息是:AI 能开启新的可能性、让生活更有成就感并提升生产力,正如此前所有工具对前人所做的那样。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
OpenAI 面向欧洲客户推出数据驻留功能,允许将数据存储在欧洲本地。该功能建立在 OpenAI 面向全球客户的企业级数据隐私、安全与合规体系之上。
OpenAI 宣布与加州州立大学(CSU)系统合作,将 ChatGPT 带给 50 万名学生和教职员工,这是迄今规模最大的一次 ChatGPT 部署。该合作旨在扩大 AI 在教育中的使用,并帮助美国培养具备 AI 能力的劳动力。
OpenAI 展示了用 ChatGPT 为美甲设计寻找灵感。用户可通过 ChatGPT 获取美甲创意与款式参考。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在真实数据分析场景中的明显差距。DABstep 同时提供数据集、任务、评测、实时排行榜与基线,仅需代码执行环境即可运行并自动评测。
Hugging Face 开源了复现 OpenAI Deep Research 的 Open DeepResearch 框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的对比数字与代码智能体的取舍依据。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出推理与微调命令。
推荐理由:原文给出两个机器人基础模型在 LeRobot 的移植细节与微调命令,读者可据此判断 VLA 模型的落地门槛。
OpenAI 展示如何基于 ChatGPT 构建自定义数学辅导工具,将 ChatGPT 用于个性化辅导场景。内容围绕 ChatGPT 与个性化辅导展开,说明如何把通用对话模型改造成面向数学学习的专属辅导助手。
OpenAI 发文介绍如何用 ChatGPT 钓大比目鱼。
OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具面向需要跨来源梳理信息的深度研究场景,帮助咨询团队分析复杂行业动向。
Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。
OpenAI 封禁了一批利用 AI 生成文章、帖子和虚假互动来干预加纳 2024 年总统选举的账号。这些账号围绕该选举开展隐蔽影响力行动,相关内容由 AI 批量生成。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 撰写监控工具推销方案、分析文档并调试代码。相关行动被命名为“同行评审”(Operation "Peer Review")。
OpenAI 封禁了可能与公开报道的朝鲜(DPRK)相关威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件及加密货币攻击目标。
OpenAI 封禁了一批与伊朗有关联的账号,这些账号利用 AI 生成与 IUVM 和 STORM-2035 影响力活动相关的文章及社交帖子。
OpenAI 封禁了一批可能被用于协助欺诈性就业计划的账号,该计划带有公开报道过的朝鲜相关 IT 工作者活动的特征。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译消息,实施虚假评论招聘诈骗,要求受害者支付费用。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译并生成恋爱与投资诈骗对话。此类"杀猪盘"骗局借助 AI 批量生成话术,OpenAI 已对相关账号采取封禁措施。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 生成英文社交帖子和西班牙语文章。相关行动被命名为“Sponsored Discontent”。
OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,涵盖安全评估、外部红队测试以及 Preparedness Framework 评测。
推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness Framework 评测范围,可了解该模型的安全工作构成。
OpenAI 发布 o3-mini 模型,官方页面已上线,但正文内容抓取失败,暂无可确认的能力、参数或开放范围信息。
这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。