跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

418 条精选近 30 天 74 条共收录 1,434 条

更新

精选归档 · 第 19 页

7月24日周三第 361–380 条
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。

    推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。

7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1:8B、70B 与 405B,支持多语言和长上下文

    Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。

    推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。

7月22日周一
7月18日周四
  1. Hugging Face Blog62

    Hugging Face TGI 推出 Multi-LoRA 服务,一次部署可服务 30 个模型

    Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。

    推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。

7月11日周四
  1. Anthropic News62

    Anthropic 在 Amazon Bedrock 上线 Claude 3 Haiku 微调

    Anthropic 宣布 Claude 3 Haiku 在 Amazon Bedrock 中的微调功能正式可用,客户可基于自有 prompt-completion 数据训练定制版本,用于分类、调用自定义 API 等专门任务。

    推荐理由:官方给出微调后的分类准确率与 token 消耗变化,并附两家企业客户的具体数据,可据此判断定制小模型的落地空间。

6月12日周三
6月5日周三
  1. Mistral AI62

    Mistral 在 la Plateforme 推出模型微调服务并开源 mistral-finetune

    Mistral AI 在 la Plateforme 上线模型定制功能,提供三条路径:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。

    推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。

5月29日周三
  1. Mistral AI71

    Mistral 发布首款代码模型 Codestral

    Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。

    推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。

4月26日周五
  1. Modal Blog62

    用少量微调击败 OpenAI text-embedding-3-small 等专有嵌入模型

    Modal 团队用 Quora 重复问题数据集做实验,发现仅用几百个样本微调开源嵌入模型 bge-base-en-v1.5,就能在文本相似度任务上超过 OpenAI 的 text-embedding-3-small。

    推荐理由:作者用 Quora 数据集实测不同模型与数据量下的微调效果,给出了可复用的网格搜索与选型思路。

3月22日周五
  1. Hugging Face Blog64

    Hugging Face 详解嵌入向量二值与标量量化:检索更快更省

    Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。

    推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。

3月18日周一
  1. Hugging Face Blog62

    Hugging Face 与 NVIDIA 推出 Train on DGX Cloud,可在 Hub 内用 H100 微调模型

    Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。

    推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。

3月13日周三
  1. Anthropic News78

    Anthropic 发布 Claude 3 Haiku,称其为同智能级别中最快最便宜的模型

    Anthropic 发布 Claude 3 Haiku,称其为同智能级别中最快、最便宜的模型,具备领先的视觉能力并在行业基准上表现强劲。该模型处理 32K token 以下提示时每秒可处理 21K token(约 30 页),速度是同类模型的三倍,输入输出 token 比例为 1:5,成本为同性能档其他模型的一半。

    推荐理由:官方给出 Haiku 的速度、定价与可用渠道,读者可据此判断它在企业批量文档处理中的定位。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面接入

    Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。

2月8日周四
1月14日周日
  1. Hugging Face Blog62

    如何在 Hugging Face Spaces 上用 Gradio 免费运行 ComfyUI 工作流

    Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。

    推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。

1月10日周三
12月20日周三
  1. Hugging Face Blog62

    用投机解码让 Whisper 推理提速 2 倍

    Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。

    推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。

12月19日周二
  1. Anthropic News60

    Anthropic 扩展版权赔偿并推出 Messages API 测试版

    Anthropic 发布简化的商业服务条款并扩大版权赔偿范围,承诺为客户经授权使用服务或其输出所遭遇的版权侵权索赔进行抗辩并支付和解或判决费用,新条款将于 2024 年 1 月 1 日对 Claude API 客户生效、1 月 2 日对通过 Amazon Bedrock 使用 Claude 的客户生效。

    推荐理由:原文给出商业条款与 Messages API 的具体变化,读者可据此判断 Claude API 接入方式与版权责任的调整。

12月11日周一