OpenAI 推理模型将用于美国国家实验室推动科学突破
OpenAI 最新一代推理模型将供美国国家实验室的顶尖科学家使用,以推动科学突破。该合作旨在加强美国在 AI 领域的领导地位。
OpenAI 最新一代推理模型将供美国国家实验室的顶尖科学家使用,以推动科学突破。该合作旨在加强美国在 AI 领域的领导地位。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face 发布 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补齐官方未公开的数据集和训练代码。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 数据与训练流程的三步计划,读者可据此了解开源推理模型缺哪几块拼图。
Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。
Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。
推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像可在 agent.run 时通过 images 参数一次性传入,也可借助 step_callbacks 在每步把截图写入 ActionStep 的 observation_images 动态注入。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,并附可运行的浏览器智能体示例代码。
OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采取的多层防护措施,包括针对提示词工程与越狱的模型和产品层缓解,以及隐私与安全保护。文档还介绍了外部红队测试、安全评估,以及持续完善这些防护的后续工作。
NVIDIA 推出 Python 工具包 KVPress,通过一系列 KV Cache 压缩技术降低长上下文 LLM 的显存占用。以 Llama 3-70B 在 bfloat16 下处理 1M tokens 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个基座模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。
推荐理由:官方披露了 256M 与 500M 两个新模型在视觉编码器、数据配比和 tokenization 上的取舍,可据此判断小模型多模态的可行边界。
德国全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。Bertelsmann 总部位于德国,业务覆盖媒体、服务与教育领域。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在生成回答时投入更多计算,以抵御对抗性攻击。该研究探讨了推理时计算与对抗鲁棒性之间的权衡关系。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成进 Hugging Face Hub 的“Deploy this model”按钮,实现一键部署。
OpenAI 及其战略合作伙伴公布 Stargate 基础设施计划,目标是构建 AGI 所需的基础设施。OpenAI 表示希望与数据中心建设产业链上的公司合作,覆盖电力、土地、施工到设备等环节。
OpenAI 宣布 Stargate 项目。原文未披露该项目的具体投资规模、合作方、建设地点或时间表等细节。
Mistral AI 宣布与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,让回答基于可靠、实时的信息。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2,300 条新闻专线,覆盖其全球 1,700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过 Rust 的 Backend trait 让 TGI 作为统一前端层接入不同推理引擎,用户可按模型、硬件和性能需求切换后端。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具约 5 行代码即可用 bitsandbytes 完成量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后模型还能回到 timm 使用。
OpenAI 宣布与 Axios 达成合作,进一步扩大其在新闻行业的合作版图。目前已有代表数百家新闻编辑室和内容品牌的出版商,通过 OpenAI 的合作与资助计划采用 AI 工具,ChatGPT 用户也可获取来自领先可靠出版物的信息。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。
Adebayo Ogunlesi 加入 OpenAI 董事会。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。
Hugging Face 发布分析文章指出,AI 智能体的风险随自主性等级上升而增加,建议不要开发能自行编写并执行代码的全自主智能体。文章按自主程度将智能体分为五级,从模型不影响程序流程的 Code ☆☆☆☆ 到模型自行编写并执行新代码的 Fully autonomous agent ★★★★,并认为半自主智能体在自主程度、可用任务和人类控制方式合适时,收益可能大于风险。
Hugging Face 推出 vdr-2b-multi-v1,一个面向多语言视觉文档检索的嵌入模型,可直接编码文档页面截图,无需 OCR 或分块流程。
Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2742 个模型的推理数据发现,社区微调模型普遍比其官方基础模型更低碳。70B 参数级别中,Qwen2.5 和 Llama3.1 的官方微调耗能约为基础模型的两倍,而 MoE 架构模型的排行榜得分与排放比整体偏低。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方发布轻量智能体库,给出代码写动作的设计取舍与开源模型对比,可据此判断自建智能体的成本。
OpenAI 发文解释其公司结构必须调整,以更好推进自身使命,方案是由营利性业务的成功来支持一个更强大的非营利组织。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。
推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。
NVIDIA 推出 LogitsProcessorZoo,一组模块化 logits 处理器,可在 Hugging Face Transformers 的 generate 方法中直接修改预测分数,实现控制序列长度、强制关键短语、引导多选题答案等任务。
OpenAI 发布面向 o1 模型的新对齐策略“审议式对齐”,直接教模型安全规范并让其对这些规范进行推理。该策略的核心是借助模型的推理能力来提升安全性。
Artificial Analysis 发布 Big Bench Audio,一个从 Big Bench Hard 改编的音频推理评测数据集,含 1000 道音频题,覆盖 Formal Fallacies、Navigate、Object Counting、Web of Lies 四类各 250 题。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作 BERT 类模型的直接替换。
推荐理由:ModernBERT 以 8k 上下文和更快推理替换 BERT 类编码器,读者可据此判断 RAG 与代码检索的升级空间。
IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。
推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。
阿布扎比 TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五个基础模型,参数均在 100 亿以下。
推荐理由:Falcon3 给出五个开源模型的训练路径与基准对比,可据此判断小参数模型的效率取舍。
Hugging Face 在 Google Cloud 的 N2 与 C4 实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载,C4 的文本嵌入吞吐量是 N2 的 10x 至 24x,文本生成吞吐量是 N2 的 2.3x 至 3.6x。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可借助 LLM 生成自定义数据集,目前支持文本分类和对话两类任务。
OpenAI 回应马斯克最新法律诉讼,称这是其不到一年内的第四次尝试。OpenAI 表示,马斯克 2017 年不仅想要、而且实际创建了 OpenAI 拟议的营利性新结构。
Hugging Face 与 Entalpic 联合推出开源项目 LeMaterial,并发布首个数据集 LeMat-Bulk,将 Materials Project、Alexandria 和 OQMD 三大材料数据库统一清洗为标准格式,含 6.7M 条数据和 7 种材料属性,采用 CC-BY-4.0 许可。
OpenAI 的视频生成模型 Sora 已在 sora.com 开放使用,支持生成最高 1080p 分辨率、最长 20 秒的视频,并提供宽屏、竖屏和方形画幅。用户可导入自有素材进行延展、重混和融合,也可直接由文本生成全新内容。
推荐理由:OpenAI 官方公布 Sora 的开放入口与分辨率、时长、画幅等关键规格,读者可据此判断可用范围。
OpenAI 发布面向产品团队的 AI 应用指南,帮助产品团队将 AI 投入实际工作。内容聚焦于把 AI 融入产品团队的日常工作流程。