在 Intel Gaudi 2 上加速蛋白质语言模型 ProtST
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
OpenAI 推出基于 GPT-4 的 CriticGPT,用于对 ChatGPT 的回答撰写批评意见,帮助人类训练师在 RLHF 过程中发现错误。
OpenAI 与 TIME 达成战略内容合作,将接入 TIME 101 年的档案内容,用于增强模型回答并提供 Time.com 报道链接。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。
推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于 Hugging Face 专家支持计划合作,在多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。该模型用于专利撰写、无效检索和新颖性比对,借助 Hugging Face Inference Endpoints 与 TEI,嵌入吞吐从约 300 个/秒提升至约 2700 个/秒。
Hugging Face 发布《伦理与社会通讯 #6》,聚焦 AI 数据质量,提出高质量数据应满足相关性、全面性、时效性和偏见缓解等要求。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据会导致"披萨加胶水"这类错误推荐。文中强调数据质量需贯穿 AI 开发全生命周期,并给出数据去重、内容过滤、人工反馈和治理框架等实践策略。
微软 6 月发布的 Florence-2 视觉语言模型提供 0.2B 和 0.7B 两个小尺寸版本,支持 captioning、目标检测、OCR 等任务,但官方模型不含 VQA 能力。作者在 DocVQA 上微调后,验证集 Levenshtein 相似度从 0 提升至 57.0,并开源了 Colab notebook 与演示 Space。
OpenAI 宣布收购 Rockset。该消息由 OpenAI 官方发布,具体交易金额与整合细节未在材料中披露。
推荐理由:OpenAI 官方宣布收购 Rockset,读者可据此了解其在数据检索与实时分析方向的布局动作。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。
OpenAI 发布训练一致性模型的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出一套整体性方法,用于构建面向真实世界内容审核的鲁棒自然语言分类系统。该方法针对不良内容检测,强调在真实场景中兼顾系统的稳健性与实用性。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划发布 DIBT/10k_prompts_ranked 数据集,由 385 多人参与完成 1 万条合成与人工提示词的质量排序,并已被用于训练 SPIN 等新模型。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下生成图像、音频和视频,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了图像、音频和视频生成领域的发展,但其迭代采样过程导致生成缓慢。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开放模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议其加入开源 re-ranker 模型以更低成本、更快、更好地为演示文稿匹配图文素材。
Paf 在全公司范围采用 ChatGPT Enterprise,工程师每天使用自定义 GPTs 加速日常开发任务。Paf 还将 ChatGPT Enterprise 引入 grit:lab 编程学院,让学员从第一天起就以 AI 增强的系统架构思维学习。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、营销和客户支持等业务团队。
Hugging Face 发布 BigCodeBench,包含 1140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每项任务平均 5.6 个测试用例、分支覆盖率 99%。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断检查并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,从而加速癌症患者获得治疗。
OpenAI 任命退役美国陆军上将 Paul M. Nakasone 加入董事会,他将加入董事会的安全与安保委员会。Nakasone 为持续扩大的董事会带来网络安全经验。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)训练器,作为 PPO 之外的在线 RLHF 训练算法。官方称 RLOO 只需加载策略模型、参考策略模型和奖励模型三份模型,显存占用比 PPO 少约 50-70%,1B 模型上速度是 PPO 的 2 倍、6.9B 模型上最高 3 倍。
推荐理由:原文给出 RLOO 与 PPO 在显存、速度和胜率上的对比数据,可据此判断在线 RLHF 训练的成本取舍。
OpenAI 与 Apple 宣布建立合作,将 ChatGPT 集成到 Apple 的各项体验中。目前公开信息仅为这一合作声明,具体集成方式与上线范围尚未披露。
推荐理由:OpenAI 与 Apple 宣布合作,读者可据此了解 ChatGPT 进入 Apple 生态这一商业动作的基本轮廓。
OpenAI 宣布 Sarah Friar 出任首席财务官(CFO),Kevin Weil 出任首席产品官(CPO)。Sarah Friar 此前任 Nextdoor CEO,Kevin Weil 曾在 Planet 与 Twitter 任职。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理,并介绍相关安全研究。
Hugging Face 宣布将重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新文档将面向构建 AI 产品的开发者,采用代码优先和解决方案导向的方式,并用更灵活的结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Hugging Face Embedding Container for Amazon SageMaker 正式可用(GA),AWS 客户可借此在 SageMaker 上部署嵌入向量模型,构建 RAG 等生成式 AI 应用。
Artificial Analysis 发布文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
OpenAI 利用可扩展的稀疏自编码器新技术,自动在 GPT-4 的计算过程中识别出 1600 万个模式。该方法旨在从模型内部提取可理解的概念。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三条路径:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。
Mistral AI 于 6 月 5 日至 30 日举办线上微调黑客松,参赛者需使用其全新微调 API 提交原创项目。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,须在 6 月 10 日前提交表单。评审按影响力、技术实现、创意和展示各占 25% 打分。
Hugging Face 联合 Cubzh 与 Gigax 发布 NPC-Playground,一个可在浏览器中直接体验的 3D 演示,让玩家与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi 处理器,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速,且采样质量与自回归采样相当。
Hugging Face 称本周早些时候发现其 Spaces 平台遭未授权访问,怀疑部分 Spaces secrets 可能被读取,已撤销其中涉及的若干 HF token 并邮件通知相关用户。
OpenAI 已终止与隐蔽影响力行动相关的账号,并称这些行动未借助其服务获得显著受众增长。
OpenAI 推出面向大学的平价产品 OpenAI for Education,旨在让高校负责任地将 AI 引入校园。该产品定位为可负担的教育方案,帮助大学在教学中规范使用 AI。
OpenAI 推出面向非营利组织的 OpenAI for Nonprofits 计划,为 ChatGPT Team 和 Enterprise 提供折扣价格,以提升其工具对非营利机构的可及性。
MavenAGI 推出基于 GPT-4 的 AI 客服智能体,Tripadvisor、Clickup 和 Rho 等公司已在使用,以节省时间并更好地服务客户。
Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。
推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。
Mistral AI 推出非生产许可证 MNPL,允许开发者将自家技术用于非商业用途并支持研究工作,商业使用则需另循公平可持续的方式。Codestral 于同日在该许可证下发布,Mistral 表示仍会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 推出非生产许可证,读者可据此理解开源模型厂商在开放与商业化之间的授权取舍。