Hugging Face 为 TGI 和 Inference Endpoints 推出兼容 OpenAI 的 Messages API
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
OpenAI 推出新的 ChatGPT 套餐 ChatGPT Team,面向各类规模的团队,提供安全、可协作的工作空间,让团队在工作中充分利用 ChatGPT。
推荐理由:OpenAI 面向各类规模团队推出 ChatGPT 新套餐,读者可据此了解其安全协作工作区的定位。
OpenAI 宣布推出 GPT Store。
Mistral AI 开放其首个平台服务 la plateforme 的 beta 访问,提供三个对话端点和一个嵌入端点。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个对话端点和嵌入端点的模型、价格与基准表现,可据此判断其早期 API 能力边界。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,含基础版与 Instruct 版,支持 32k token 上下文,以 Apache 2.0 许可开放商用。
推荐理由:Hugging Face 官方给出 Mixtral 的架构说明、基准对比与量化部署路径,可据此判断 MoE 开源模型的落地成本。
Hugging Face 与 AMD 宣布在 AMD Instinct GPU 上实现开箱即用支持,所有 Transformers 模型和任务无需修改代码即可运行,示例代码与 NVIDIA GPU 上完全一致。
推荐理由:原文给出 AMD GPU 上无需改代码运行 Transformers 的支持范围与实测对比数据,可据此判断迁移成本。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接集成 Hugging Face 生态。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。
推荐理由:OpenAI 官方发布 GPTs,用户可组合指令、额外知识和技能定制 ChatGPT 版本。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 GPT-4 Turbo with Vision。开发者产品方面新增 Assistants API,并开放 DALL·E 3 API。
推荐理由:OpenAI 在 DevDay 一次性公布模型与开发者产品更新,可据此了解其 API 能力与定价方向的变化。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,允许组织选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,Asia-Pacific 即将上线;存储在欧洲的仓库可获得约 4-5 倍的上传和下载速度提升,并满足 GDPR 合规需求。非默认区域的仓库会直接显示 Region 标签。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方表示为更广泛发布开发了一套安全缓解方案,并同步分享了内容溯源研究方面的进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线,并说明为扩大发布准备了安全缓解措施。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断前端部署与隐私场景的可行性。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Typeform 借助 GPT-3.5 和 GPT-4,把在线表单升级为动态、对话式的数据收集体验。
Ironclad 利用 GPT-4 简化合同审查流程。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包含众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,覆盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
Hugging Face Diffusers 现已支持使用 JAX 在 Cloud TPU 上部署 SDXL,实现高性能、低成本的推理。演示运行在多个 TPU v5e-4 实例上,约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3 秒。
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 为 PRO 用户推出 Inference 服务,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Zephyr 7B β、Code Llama 等精选模型的专属 API 端点,由 text-generation-inference 驱动,并提升免费 Inference API 的速率限制。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。SafeCoder 提供闭源服务所缺乏的透明度、定制化、IT 灵活性和隐私保护,支持本地部署和完全离线运行,不会收集任何遥测数据。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,涵盖推荐提示词、ChatGPT 工作原理与局限、AI 检测工具的有效性以及偏见问题。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为迄今最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布面向企业的 ChatGPT 版本,读者可据此了解其安全隐私定位与能力版本变化。
Meta 发布 Code Llama 系列代码模型,包含 7B、13B、34B 三个参数规模,基于 Llama 2 初始化并用 5000 亿 token 代码数据训练,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:Meta 发布 Code Llama 系列并接入 Hugging Face 生态,读者可了解其参数规模、上下文窗口与多语言基准表现。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。
Hugging Face 发布 SafeCoder,一款面向企业的自托管代码助手解决方案,基于 StarCoder 系列代码大模型,代码在训练和推理阶段都不离开客户自有 VPC。
OpenAI 将 GPT-4 用于内容政策制定和内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。连接需使用具备 admin 角色的组织账户,暂不支持个人账户。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后所有对话中记住这些偏好。该功能让用户对 ChatGPT 的回复方式拥有更多控制权。
推荐理由:OpenAI 官方说明 ChatGPT 新增自定义指令,读者可了解偏好设置会如何跨对话持续生效。
Viable 利用 GPT-4 以革命性规模和前所未有的准确度分析定性数据。
Hugging Face 与 Panel 合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。Panel 是 HoloViz 生态下的开源 Python 库,支持 Matplotlib、Plotly、Bokeh 等绘图库,可构建仪表盘和多页交互应用,并借助 Pyodide 与 WebAssembly 在浏览器中运行。
OpenAI 宣布对 API 进行多项更新,包括更易引导的模型、函数调用能力、更长的上下文以及更低的价格。
推荐理由:OpenAI 公布 API 多项更新,读者可据此了解模型可控性、函数调用与价格的变化方向。