Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及行数区间检索,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性过滤。这些筛选可相互组合,并与语言、任务、许可证等已有过滤器及文本搜索栏搭配使用。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断检查并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,从而加速癌症患者获得治疗。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)训练器,作为 PPO 之外的在线 RLHF 训练算法。官方称 RLOO 只需加载策略模型、参考策略模型和奖励模型三份模型,显存占用比 PPO 少约 50-70%,1B 模型上速度是 PPO 的 2 倍、6.9B 模型上最高 3 倍。
推荐理由:原文给出 RLOO 与 PPO 在显存、速度和胜率上的对比数据,可据此判断在线 RLHF 训练的成本取舍。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理,并介绍相关安全研究。
Hugging Face Embedding Container for Amazon SageMaker 正式可用(GA),AWS 客户可借此在 SageMaker 上部署嵌入向量模型,构建 RAG 等生成式 AI 应用。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三条路径:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。
Hugging Face 联合 Cubzh 与 Gigax 发布 NPC-Playground,一个可在浏览器中直接体验的 3D 演示,让玩家与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi 处理器,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速,且采样质量与自回归采样相当。
OpenAI 推出面向大学的平价产品 OpenAI for Education,旨在让高校负责任地将 AI 引入校园。该产品定位为可负担的教育方案,帮助大学在教学中规范使用 AI。
Hugging Face 宣布用户可直接将 Hub 上超 10 万个公开模型部署到 AWS Inferentia2,新增 14 种模型架构和 6 类机器学习任务支持,并可通过 Amazon SageMaker 或 Inference Endpoints 完成部署。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅向 PRO 订阅用户开放,编辑后可直接在 Space 内点击 Refresh 测试,满意后再 commit 并 merge 保存。
Hugging Face 与 Dell 联合推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署开源模型,将数周的工程工作缩短至几分钟。
Hugging Face 与 AMD 合作,为 AMD Instinct MI300 GPU 在 Hugging Face 平台提供一等公民级集成,用户无需修改代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
OpenAI 与业内顶尖选角及导演专业人士合作,从 400 多份投稿中筛选,最终为 ChatGPT 选定 5 种声音。
ChatGPT 的数据分析功能获得升级,用户现在可以与表格和图表进行交互,并直接从 Google Drive 和 Microsoft OneDrive 添加文件。
Hugging Face 在 Transformers 中上线 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,int4 精度下质量与 fp16 接近,int2 则出现明显下降。
Hugging Face 与 LangChain 联合推出合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,旨在将 Hugging Face 最新能力更快带入 LangChain 生态。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 现已支持用 AWS 账户将组织升级至 Enterprise Hub,订阅入口在 AWS Marketplace,价格与 Hugging Face 公开定价一致,但通过 AWS 账户计费。
Artificial Analysis 开发的 LLM 性能排行榜现已上线 Hugging Face,覆盖超过 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
OpenAI 发布 ChatGPT 与 Whisper 的 API,供开发者将对话与语音能力接入自有应用。
OpenAI 宣布 GPT-4 API 正式开放,GPT-3.5 Turbo、DALL·E 和 Whisper API 也同步正式开放。同时公布旧版 Completions API 模型的退役计划,这些模型将于 2024 年初退役。
推荐理由:OpenAI 公布 GPT-4 等 API 正式开放及旧模型退役安排,读者可据此规划接口迁移。
OpenAI 为 API 客户新增更多安全功能与控制项,并更新 Assistants API,同时提供更好地管理成本的工具,以加强企业级支持。
OpenAI 宣布在亚洲设立首个办公室,落地日本。同时发布了一款针对日语优化的 GPT-4 定制模型。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个开源模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,作为自有账号内的 API Endpoint。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费。
OpenAI 宣布让用户无需注册即可直接使用 ChatGPT,以便更轻松地体验 AI 带来的好处。
推荐理由:OpenAI 官方宣布 ChatGPT 无需注册即可使用,读者可据此了解其降低使用门槛的具体做法。
Zelma 利用 GPT-4 让教育数据变得易于获取。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,可输出物体在三维空间中的 (x, y, z) 坐标。
OpenAI 上月发布 Sora 后,与艺术家合作探索该模型如何辅助创作流程,并公布了首批使用印象。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试套取虚构银行 XYZ001 客户的敏感信息,再投票选出隐私保护更强的模型。
Superhuman 宣布与 OpenAI 合作,推出由 AI 驱动的新一代邮件体验。官方称这标志着邮件进入新纪元,但未披露具体模型版本、功能细节或上线时间。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。
推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,可了解其底层模型选择与自部署、审核机制。
Hugging Face 的 PEFT 库新增了面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
OpenAI 正在测试让 ChatGPT 记住用户讨论过的内容,以便让后续对话更有帮助。官方表示用户对 ChatGPT 的记忆拥有控制权。
推荐理由:OpenAI 官方披露 ChatGPT 记忆功能的测试方向,读者可了解其能力边界与用户控制权设计。