跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

239 条精选近 30 天 23 条共收录 717 条

更新

精选归档 · 第 9 页

5月7日周三第 161–180 条
  1. Mistral AI60

    Mistral 发布 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。

4月30日周三
4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

3月18日周二
  1. Hugging Face Blog62

    Hugging Face 将 Xet 存储上线 Hub,首批仓库完成迁移

    Hugging Face 的 Xet 团队已将首批模型和数据集仓库从 LFS 迁移到 Xet 存储,迁移量约 4.5 TB,占 Hub 下载流量约 6%。Xet 采用内容定义分块(约 64KB)做字节级去重,改动小部分数据时只上传变化的块,官方举例称一个约 5 GB 的 SQLite 数据库追加 1 MB 数据,上传耗时从 LFS 下的 13 分钟降到 0.1 秒。

    推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的传输收益与迁移中暴露的工程问题。

3月12日周三
  1. Hugging Face Blog82

    Google 发布 Gemma 3 开源多模态模型,覆盖 1B 至 27B 四种尺寸

    Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。

    推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。

3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 OCR API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可读取图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出与 Google Document AI、Azure OCR、Gemini 系列的横向基准对比,可据此判断文档解析在 RAG 流程中的选型空间。

2月25日周二
2月17日周一
  1. Mistral AI62

    Mistral 发布 24B 区域语言模型 Mistral Saba

    Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,基于中东和南亚地区精选数据集训练。该模型支持阿拉伯语和多种印度语系语言,在南印度语系如泰米尔语上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。

    推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖和本地部署方式。

2月12日周三
2月7日周五
1月28日周二
  1. Hugging Face Blog60

    Hugging Face 在 Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。

    推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。

1月27日周一
  1. Hugging Face Blog62

    Diffusers 中的开源视频生成模型现状

    Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。

    推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。

1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布静态嵌入模型,CPU 推理快 100 至 400 倍

    Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。

    推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。

1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 代码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。

    推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。

12月18日周三
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation,可用任意助手模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。

10月23日周三
10月22日周二