跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

307 条精选近 30 天 55 条共收录 1,024 条

更新

精选归档 · 第 14 页

3月18日周一第 261–280 条
  1. Hugging Face Blog62

    Hugging Face 与 NVIDIA 推出 Train on DGX Cloud,可在 Hub 内用 H100 微调模型

    Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。

    推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。

3月13日周三
  1. Anthropic News78

    Anthropic 发布 Claude 3 Haiku,称其为同智能级别中最快最便宜的模型

    Anthropic 发布 Claude 3 Haiku,称其为同智能级别中最快、最便宜的模型,具备领先的视觉能力并在行业基准上表现强劲。该模型处理 32K token 以下提示时每秒可处理 21K token(约 30 页),速度是同类模型的三倍,输入输出 token 比例为 1:5,成本为同性能档其他模型的一半。

    推荐理由:官方给出 Haiku 的速度、定价与可用渠道,读者可据此判断它在企业批量文档处理中的定位。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面接入

    Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。

2月8日周四
1月14日周日
  1. Hugging Face Blog62

    如何在 Hugging Face Spaces 上用 Gradio 免费运行 ComfyUI 工作流

    Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。

    推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。

1月10日周三
12月20日周三
  1. Hugging Face Blog62

    用投机解码让 Whisper 推理提速 2 倍

    Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。

    推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。

12月19日周二
  1. Anthropic News60

    Anthropic 扩展版权赔偿并推出 Messages API 测试版

    Anthropic 发布简化的商业服务条款并扩大版权赔偿范围,承诺为客户经授权使用服务或其输出所遭遇的版权侵权索赔进行抗辩并支付和解或判决费用,新条款将于 2024 年 1 月 1 日对 Claude API 客户生效、1 月 2 日对通过 Amazon Bedrock 使用 Claude 的客户生效。

    推荐理由:原文给出商业条款与 Messages API 的具体变化,读者可据此判断 Claude API 接入方式与版权责任的调整。

12月11日周一
12月5日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

    Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。

    推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。

11月21日周二
11月9日周四
10月27日周五
10月24日周二
  1. Hugging Face Blog62

    RLHF 与 PPO 的 N 个实现细节:复现 OpenAI lm-human-preferences

    作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。

    推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。

10月19日周四