Higgsfield 如何用 GPT-4.1、GPT-5 和 Sora 2 把简单创意变成电影级社交视频
Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者从简单输入直接生成电影级、适配社交平台的视频。该方案面向社交视频创作场景,强调以简单创意为起点完成成片输出。
Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者从简单输入直接生成电影级、适配社交平台的视频。该方案面向社交视频创作场景,强调以简单创意为起点完成成片输出。
Hugging Face 推出 AssetOpsBench,一个面向工业资产生命周期管理的 AI 智能体评测基准,覆盖 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式。
OpenAI 推出 Edu for Countries 新计划,帮助各国政府利用 AI 现代化教育系统并培养面向未来的劳动力。该计划面向政府层面,聚焦教育系统升级与未来劳动力建设。
OpenAI 最新报告揭示各国在先进 AI 采用上存在显著差异,并提出新举措帮助各国从 AI 中获取生产力收益。报告聚焦如何消除"能力过剩"(capability overhang),即模型能力与实际应用之间的落差。
OpenAI 与盖茨基金会联合启动 Horizon 1000,这是一项 5000 万美元的试点项目,旨在提升非洲医疗领域的 AI 能力,计划到 2028 年覆盖 1000 家诊所。
OpenAI 公布 Stargate Community 计划,以社区优先的方式建设 AI 基础设施,方案根据社区意见、能源需求与劳动力优先级因地制宜制定。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后 Hugging Face 发文回顾其对中国开源 AI 生态的催化作用。R1 以 MIT 许可开放推理路径与后训练方法,降低了技术、采用和心理三重门槛,并成为 Hugging Face 史上获赞最多的模型。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 工作流、摘要、搜索与语音功能。此次合作将 OpenAI 模型能力嵌入企业级工作流场景,覆盖摘要、搜索和语音等平台功能。
微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。
推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。
ChatGPT 正在推出年龄预测功能,用于判断账号用户是否年满 18 岁,并对青少年账号应用相应保护措施。OpenAI 表示该功能会随时间推移持续优化准确性。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face,Small 版为 2.3B 参数。
推荐理由:原文给出模型权重、训练方法和推理库,读者可据此判断实时交互视频生成的技术路线与可用性。
OpenAI 的商业模式随智能水平提升而扩展,覆盖订阅、API、广告、商业和算力,由 ChatGPT 采用率持续加深所驱动。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,并给出 18x 至 300x 的加速数据,可据此判断 4D 重建的实时化路径。
OpenAI 计划在美国为 ChatGPT 的免费和 Go 档测试广告,以扩大 AI 的可负担访问范围。OpenAI 表示测试将兼顾隐私、信任与回答质量。
推荐理由:OpenAI 首次说明 ChatGPT 免费与 Go 档的广告测试思路,可观察其商业化与访问扩张的平衡方式。
OpenAI 宣布 ChatGPT Go 已在全球上线,提供 GPT-5.2 Instant 的扩展访问、更高的使用额度和更长的记忆能力,定位为让先进 AI 在全球范围内更可负担。原文未披露具体价格、额度数值和上线地区清单。
推荐理由:OpenAI 官方公布 ChatGPT Go 的全球开放范围与三项能力变化,可据此判断低价档位的可用边界。
Google 研究团队开发了一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭 Pixel Watch 1 的 IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r 与 ICC 均超过 0.80。
OpenAI 投资 Merge Labs,支持连接生物智能与人工智能的新型脑机接口,目标是最大化人类能力、自主性与体验。
OpenAI 发起一项新的 RFP,旨在通过加速美国本土制造、创造就业并扩展 AI 基础设施来强化美国 AI 供应链。
OpenAI 发起、开源社区构建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API 设计,面向智能体场景。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 和 Spaces 上的早期访问版本试用。
推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解它如何替代 Chat Completion 格式并支持智能体循环。
OpenAI 宣布与 Cerebras 合作,新增 750MW 高速 AI 算力,用于降低推理延迟。该算力将让 ChatGPT 在实时 AI 工作负载下响应更快。
推荐理由:OpenAI 与 Cerebras 达成算力合作,读者可了解其新增算力规模与对推理延迟的直接影响。
Google Research 利用 Android Auto 采集的急刹车事件(HBE,减速度超过 -3m/s²)与弗吉尼亚州、加州十年公开碰撞数据,通过负二项回归验证了 HBE 频率与路段碰撞率之间存在统计显著的正相关。
Google 通过 HAI-DEF 项目发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在短提示词下更富表现力,并提升角色身份、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得迁移。
Zenken 在全公司范围部署 ChatGPT Enterprise,提升了销售业绩、缩短了准备时间并提高了提案成功率。AI 支持的工作流帮助这支精简团队实现更个性化、更有效的客户互动。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 与软银集团宣布与 SB Energy 合作,开发多吉瓦级 AI 数据中心园区,其中包括一座位于得克萨斯州、容量 1.2 GW 的设施,用于支持 Stargate 计划。
推荐理由:OpenAI 与软银、SB Energy 合作建设多吉瓦级 AI 数据中心,可了解 Stargate 计划的算力落地方式。
Datadog 采用 OpenAI 的 Codex 进行系统级代码审查。该实践将 Codex 用于跨系统的代码审查环节,而非仅限单点代码生成。
OpenAI 推出 OpenAI for Healthcare,提供安全的企业级 AI 并支持 HIPAA 合规。该产品旨在减轻行政负担并支持临床工作流程。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业规模化部署,强调智能体系统在生产环境中的稳定性。
Tolan 基于 GPT-5.1 打造了一款语音优先的 AI 伴侣,结合低延迟响应、实时上下文重建和记忆驱动的人格,实现自然对话。
OpenAI 发布 ChatGPT Health,这是一个独立体验,可安全连接用户的健康数据与应用。官方称其具备隐私保护,并采用由医生参与设计的方案。
推荐理由:OpenAI 官方给出 ChatGPT Health 的定位与隐私设计,读者可据此了解健康数据接入这一新方向。
NVIDIA 发布 Cosmos Reason 2,一款面向物理 AI 的开源推理视觉语言模型,在 Physical AI Bench 和 Physical Reasoning 榜单上位列开源模型第一。
推荐理由:NVIDIA 开源视觉语言推理模型 Cosmos Reason 2 的发布细节,含 256K 上下文与 2B/8B 规格,可对照上一代判断物理 AI 推理能力进展。
Falcon-H1-Arabic 阿拉伯语模型家族发布,包含 3B、7B、34B 三个参数规模,采用 Mamba 与 Transformer 注意力并行的 Falcon-H1 混合架构。
Hugging Face 博客发布教程,介绍如何用 NVIDIA DGX Spark 配合 Reachy Mini 复现 CES 2026 主题演讲中的桌面智能体,代码已开源。
OpenAI Grove 第二期已开放申请,这是一个为期 5 周的创始人项目,面向从仅有想法到已有产品的任何阶段参与者。入选者可获得 5 万美元 API 额度、AI 工具早期访问权限以及 OpenAI 团队的实操指导。
Google 发布 2025 年度研究回顾,梳理了 8 大突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出,Gemini 3 Flash 于 12 月上线,其中 Gemini 3 Pro 登顶 LMArena 排行榜,并在 MathArena Apex 上取得 23.4% 的 SOTA 成绩。
Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。
OpenAI 宣布全球使用其产品的客户已超过 100 万家。文章展示了 PayPal、Virgin Atlantic、BBVA、Cisco、Moderna 和 Canva 等公司如何借助 OpenAI 改变工作方式。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环有助于尽早识别新型攻击手法,并在 AI 智能体能力增强的同时强化浏览器智能体的防御。