OpenAI deep research 如何帮助 Bain & Company 理解复杂行业趋势
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具面向需要跨来源梳理信息的深度研究场景,帮助咨询团队分析复杂行业动向。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具面向需要跨来源梳理信息的深度研究场景,帮助咨询团队分析复杂行业动向。
Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。
OpenAI 封禁了一批利用 AI 生成文章、帖子和虚假互动来干预加纳 2024 年总统选举的账号。这些账号围绕该选举开展隐蔽影响力行动,相关内容由 AI 批量生成。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 撰写监控工具推销方案、分析文档并调试代码。相关行动被命名为“同行评审”(Operation "Peer Review")。
OpenAI 封禁了可能与公开报道的朝鲜(DPRK)相关威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件及加密货币攻击目标。
OpenAI 封禁了一批与伊朗有关联的账号,这些账号利用 AI 生成与 IUVM 和 STORM-2035 影响力活动相关的文章及社交帖子。
OpenAI 封禁了一批可能被用于协助欺诈性就业计划的账号,该计划带有公开报道过的朝鲜相关 IT 工作者活动的特征。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译消息,实施虚假评论招聘诈骗,要求受害者支付费用。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译并生成恋爱与投资诈骗对话。此类"杀猪盘"骗局借助 AI 批量生成话术,OpenAI 已对相关账号采取封禁措施。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 生成英文社交帖子和西班牙语文章。相关行动被命名为“Sponsored Discontent”。
OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,涵盖安全评估、外部红队测试以及 Preparedness Framework 评测。
推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness Framework 评测范围,可了解该模型的安全工作构成。
OpenAI 发布 o3-mini 模型,官方页面已上线,但正文内容抓取失败,暂无可确认的能力、参数或开放范围信息。
这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。
Hugging Face 发布首期 AI 艺术工具通讯,回顾 2024 年创意 AI 工具的关键进展。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出量化后单卡本地部署的具体门槛。
OpenAI 最新一代推理模型将供美国国家实验室的顶尖科学家使用,以推动科学突破。该合作旨在加强美国在 AI 领域的领导地位。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face 发布 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补齐官方未公开的数据集和训练代码。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 数据与训练流程的三步计划,读者可据此了解开源推理模型缺哪几块拼图。
Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。
Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。
推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像可在 agent.run 时通过 images 参数一次性传入,也可借助 step_callbacks 在每步把截图写入 ActionStep 的 observation_images 动态注入。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,并附可运行的浏览器智能体示例代码。
OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采取的多层防护措施,包括针对提示词工程与越狱的模型和产品层缓解,以及隐私与安全保护。文档还介绍了外部红队测试、安全评估,以及持续完善这些防护的后续工作。
NVIDIA 推出 Python 工具包 KVPress,通过一系列 KV Cache 压缩技术降低长上下文 LLM 的显存占用。以 Llama 3-70B 在 bfloat16 下处理 1M tokens 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个基座模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。
推荐理由:官方披露了 256M 与 500M 两个新模型在视觉编码器、数据配比和 tokenization 上的取舍,可据此判断小模型多模态的可行边界。
德国全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。Bertelsmann 总部位于德国,业务覆盖媒体、服务与教育领域。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在生成回答时投入更多计算,以抵御对抗性攻击。该研究探讨了推理时计算与对抗鲁棒性之间的权衡关系。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成进 Hugging Face Hub 的“Deploy this model”按钮,实现一键部署。
OpenAI 及其战略合作伙伴公布 Stargate 基础设施计划,目标是构建 AGI 所需的基础设施。OpenAI 表示希望与数据中心建设产业链上的公司合作,覆盖电力、土地、施工到设备等环节。
OpenAI 宣布 Stargate 项目。原文未披露该项目的具体投资规模、合作方、建设地点或时间表等细节。
Mistral AI 宣布与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,让回答基于可靠、实时的信息。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2,300 条新闻专线,覆盖其全球 1,700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过 Rust 的 Backend trait 让 TGI 作为统一前端层接入不同推理引擎,用户可按模型、硬件和性能需求切换后端。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具约 5 行代码即可用 bitsandbytes 完成量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后模型还能回到 timm 使用。
OpenAI 宣布与 Axios 达成合作,进一步扩大其在新闻行业的合作版图。目前已有代表数百家新闻编辑室和内容品牌的出版商,通过 OpenAI 的合作与资助计划采用 AI 工具,ChatGPT 用户也可获取来自领先可靠出版物的信息。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。
Adebayo Ogunlesi 加入 OpenAI 董事会。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。
Hugging Face 发布分析文章指出,AI 智能体的风险随自主性等级上升而增加,建议不要开发能自行编写并执行代码的全自主智能体。文章按自主程度将智能体分为五级,从模型不影响程序流程的 Code ☆☆☆☆ 到模型自行编写并执行新代码的 Fully autonomous agent ★★★★,并认为半自主智能体在自主程度、可用任务和人类控制方式合适时,收益可能大于风险。
Hugging Face 推出 vdr-2b-multi-v1,一个面向多语言视觉文档检索的嵌入模型,可直接编码文档页面截图,无需 OCR 或分块流程。
Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2742 个模型的推理数据发现,社区微调模型普遍比其官方基础模型更低碳。70B 参数级别中,Qwen2.5 和 Llama3.1 的官方微调耗能约为基础模型的两倍,而 MoE 架构模型的排行榜得分与排放比整体偏低。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方发布轻量智能体库,给出代码写动作的设计取舍与开源模型对比,可据此判断自建智能体的成本。