H Company 发布 Holo2-235B-A22B Preview,UI 定位刷新 SOTA
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 3 步智能体模式达到 78.5%、OSWorld G 达 79.0%,创下新 SOTA。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 3 步智能体模式达到 78.5%、OSWorld G 达 79.0%,创下新 SOTA。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE 潜空间训练 100k 步,数据集为 MidJourneyV6 生成的 100 万张 256×256 合成图像。
OpenAI 公布 Sora 信息流的设计理念,通过个性化推荐激发创意、促进连接,并以家长控制和强护栏保障体验安全。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,将前沿智能引入企业数据,让 AI 智能体与洞察直接在 Snowflake 中运行。
OpenAI 发布 macOS 版 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:OpenAI 官方发布 Codex 桌面应用,读者可了解其多智能体并行与长任务编排的定位。
OpenAI 封禁了一批与代号 No Bell 行动相关的账号,该行动此前未被报道,疑似源自俄罗斯,利用 AI 生成针对美国及其盟友的批评内容,面向非洲受众传播。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动代号“Date Bait”。
OpenAI 封禁了一个与中国执法相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。该事件被 OpenAI 归入“Cyber Special Operations”类别。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点以及社会工程学手法。
OpenAI 宣布封禁一批利用 AI 支撑恋爱诈骗流程的账号,涉及外联、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了一批与 Rybar 网络相关、部分可能源自俄罗斯的账号,这些账号利用 AI 在网站和社交平台上开展多语言影响力活动。该行动代号为 "Fish Food"。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,专门针对诈骗受害者行骗。该行动代号 "False Witness"。
OpenAI 封禁了一批与代号“Trolling Stone”行动相关的账号,该行动此前未被公开报道。这些账号利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论内容。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:Google DeepMind 把 Genie 3 世界模型做成可交互原型,读者可据此了解世界模型从研究走向订阅制产品的路径。
OpenAI 披露其内部 AI 数据智能体,结合 GPT-5、Codex 与记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体面向内部数据分析场景,强调推理与结果可靠性。
OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 端目前没有变化。
推荐理由:OpenAI 官方给出 ChatGPT 中多款旧模型的退役时间,读者可据此安排现有工作流的模型迁移。
Taisei Corporation 的人力资源团队正在牵头推广 ChatGPT Enterprise,以推动全公司范围内的 AI 人才发展。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和用 backup nodes 替换模型。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了一种轻量方案。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,得出首批智能体系统的量化缩放原则,指出“智能体越多越好”常会触顶甚至降低表现。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助非政府组织和研究人员,推进 AI 时代的青年安全与福祉。
OpenAI 发布欧盟经济蓝图 2.0,以新数据、合作伙伴关系和多项举措推动欧洲 AI 应用、技能与增长。
OpenAI 说明了 AI 智能体打开链接时如何保护用户数据,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
Hugging Face 发布新工具 upskill,用 Claude Opus 4.5 等大模型生成并评测 agent skill,再交给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的可复用流程与评测命令,读者可据此降低推理成本。
Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的能力边界与成本。
Hugging Face 博客梳理中国开源 AI 生态自 2025 年 1 月“DeepSeek 时刻”以来的架构与硬件选择:Kimi K2、MiniMax M2、Qwen3 等头部模型几乎一致转向 MoE 架构,0.5B–30B 小模型与 100B–700B 大 MoE 形成“教师—学生”结构,Apache 2.0 成为默认许可证。
Hugging Face 团队推出阿联酋方言评测基准 Alyah(阿拉伯语意为"北极星"),包含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题。
Calvin Klein 与 Tommy Hilfiger 母公司 PVH 集团采用 ChatGPT Enterprise,将 AI 引入时装设计、供应链和消费者互动环节。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 on-policy 重要性采样比值偏离 1。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与挑选流程。
OpenAI 推出 Prism,一个内置 GPT-5.2 的免费 LaTeX 原生工作空间,让研究人员在同一处完成写作、协作与推理。
Indeed CRO Maggie Hulce 分享了 AI 如何改变求职、招聘与企业人才获取方式,同时服务于雇主和求职者。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等任务上超越现有 SOTA 基准,并首次为该多样性-效用权衡提供可证明的近似保证:所选子集价值至少为最优解的一半。
OpenAI 技术详解 Codex 智能体循环,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。
OpenAI 通过副本、缓存、限流和工作负载隔离,将 PostgreSQL 扩展至每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。
Praktika 利用 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,实现课程个性化、学习进度追踪,帮助学习者达到真实场景的语言流利度。
OpenAI 发布了一份数据驱动报告,聚焦各行业员工如何使用 ChatGPT,涵盖采用趋势、高频任务和部门使用模式。报告同时探讨了 AI 在职场中的未来走向。
Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,最终指向 NIXL 经 UCX 传输 KVCache 的依赖层。