OpenAI 提出五种 AI 价值模型,驱动企业业务重塑
OpenAI 提出五种 AI 价值模型,帮助企业领导者按从员工熟练度到流程重塑的顺序推进 AI 落地,以构建持久的业务优势。
OpenAI 提出五种 AI 价值模型,帮助企业领导者按从员工熟练度到流程重塑的顺序推进 AI 落地,以构建持久的业务优势。
德甲俱乐部 VfL Wolfsburg 将 ChatGPT 推广为全俱乐部范围的能力,重点在于人而非试点项目,以此提升效率、创造力与知识共享,同时不丢失其足球身份。
OpenAI 上线 Adoption 新闻频道,提供将 AI 进展转化为业务优势的实用洞察与框架。该频道面向企业落地场景,内容聚焦实践方法与可复用框架。
OpenAI 推出 ChatGPT for Excel 以及新的金融应用集成,由 GPT-5.4 驱动,用于在受监管环境中加速建模、研究与分析。
推荐理由:OpenAI 把 ChatGPT 接入 Excel 并新增金融数据集成,读者可据此判断其在受监管场景中的可用边界。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 推出 Learning Outcomes Measurement Suite,用于长期评估 AI 在不同教育环境中对学生学习的影响。该套件面向多样化的教育场景,追踪 AI 对学习成果的作用。
Axios COO Allison Murphy 介绍了该公司如何用 AI 支持本地记者、简化新闻编辑室工作流程,并大规模交付高影响力的本地新闻报道。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内训练出一个文生图扩散模型。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。
推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。
OpenAI 发布 GPT-5.3 Instant,官方称其在日常对话中更顺畅、更实用。原文正文未能抓取,除标题外暂无更多细节。
OpenAI 发布 GPT-5.3 Instant 系统卡,但当前抓取仅保留标题,正文内容缺失。
OpenAI 公布其与美国国防部(Department of War)合同的细节,说明其中的安全红线、法律保护以及 AI 系统在涉密环境中的部署方式。材料仅提供摘要,未披露合同金额、期限或具体部署系统。
推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解其安全红线与法律保护如何界定。
OpenAI 与 Microsoft 发布联合声明,称双方将继续在研究、工程和产品开发方面紧密合作,延续多年的深度协作与共同成果。
OpenAI 宣布获得 1100 亿美元新投资,投前估值 7300 亿美元。其中软银出资 300 亿美元,NVIDIA 出资 300 亿美元,Amazon 出资 500 亿美元。
推荐理由:OpenAI 公布 1100 亿美元新融资与 7300 亿美元投前估值,并列出三家出资方,可据此观察其资本结构与算力合作走向。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作范围包括扩展 AI 基础设施、定制模型以及企业级 AI 智能体。
推荐理由:OpenAI 与 AWS 的合作把 Frontier 平台接入云基础设施,读者可据此观察企业级 AI 智能体的落地路径。
Amazon Bedrock 推出面向智能体的 Stateful Runtime Environment,为 OpenAI 驱动的多步 AI 工作流提供持久化编排、记忆与安全执行能力。
OpenAI 公布其心理健康安全工作的最新进展,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的动态。
Google DeepMind 发布图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 速度。
推荐理由:官方给出 Nano Banana 2 的能力清单与上线渠道,读者可据此判断 Pro 级图像能力下放到 Flash 速度后的可用范围。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 文件起草时间有望最多缩短 15%,助力基础设施审查现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma canvas 之间自由切换、快速迭代与交付。
Hugging Face 发布博客,介绍 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重构的加载、后端与专家并行设计,并给出 v4 与 v5 的加载耗时对比。
OpenAI 最新威胁报告剖析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦此类组合手法带来的识别与防护挑战。
OpenAI 任命 Arvind KC 为首席人力官,负责帮助公司规模化扩张、强化企业文化,并主导 AI 时代工作方式的演进。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 公开了其 AI 模型在 First Proof 数学挑战赛中的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
Hugging Face 宣布 GGML(llama.cpp 的创建方)加入 HF,Georgi Gerganov 及团队将获得长期可持续资源支持,继续推动本地 AI 开源发展。
推荐理由:Hugging Face 官方说明 GGML 与 llama.cpp 团队加入后的资源安排与开源承诺,可了解本地推理生态的走向。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出可直接复用的 CLI 命令、Skill 安装步骤与按模型规模划分的 GPU 成本表,读者可据此估算小模型微调开销。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,官方称推理表现超过 3 Pro 两倍以上。
推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,并列出消费端与开发者端的同步开放渠道,可据此判断升级幅度与可用范围。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,旨在扩大印度全国 AI 可及性,建设本地基础设施、赋能企业并提升劳动力技能。该计划聚焦本地基础设施、企业应用与人才培养三个方向。
IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。
Google DeepMind 的 Lyria 3 音乐生成模型以 beta 形式在 Gemini 应用上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、时长与 SynthID 音频验证能力,可据此判断音乐生成的使用边界。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此让 LLM 一次性生成可部署的交互组件。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞场景,覆盖发现、修复与攻击三类任务。
Google Research 提出 MapTrace,一套用 Gemini 2.5 Pro 与 Imagen-4 自动生成地图寻路数据的流水线,并开源 200 万条问答对。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿科学模型,并推出 3000 万美元的 Google.org Impact Challenge: AI for Science。
OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。两项功能面向企业安全场景,具体能力与开放范围原文未进一步说明。
推荐理由:OpenAI 为 ChatGPT 增加 Lockdown Mode 与 Elevated Risk 标签,读者可了解企业防御提示词注入的新手段。