Mistral 发布全新 le Chat 助手,上线 iOS 与 Android 并推出 Pro 和 Team 订阅
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
403 条精选近 30 天 74 条共收录 1,369 条
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
Modal 发布内存快照功能,为无服务器 GPU 容器提供 checkpoint/restore 能力,冷启动速度约为标准容器启动的 2.5 倍。官方数据显示,Stable Diffusion 推理函数从约 13 秒降至 3.5 秒,import torch 示例从约 5 秒降至 p50 约 1.05 秒、p0 约 0.69 秒。
推荐理由:Modal 官方披露内存快照的恢复机制与实测数据,读者可据此判断无服务器冷启动优化的可行路径。
Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。
Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。
推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。
Modal 宣布 Sandboxes 结束一年 beta 正式可用,用于安全隔离运行来自 LLM、用户或第三方的不可信代码。Sandboxes 提供 exec API,可在运行时配置执行环境,并支持文件系统快照与端口转发、网络访问限制等能力,与 Functions 共用底层基础设施。
推荐理由:官方给出 Sandbox 正式版的能力边界与客户案例,可据此判断隔离执行环境在智能体场景中的落地方式。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。
推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。
IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。
推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。
Anthropic 宣布新版 Claude 3.5 Sonnet 开始在 GitHub Copilot 上滚动推出,开发者可在 Visual Studio Code 和 GitHub.com 中选择该模型写代码,面向 GitHub 超过 1 亿开发者。
推荐理由:Anthropic 官方说明 Claude 3.5 Sonnet 接入 GitHub Copilot 的可用范围与编码场景,可据此判断开发者何时能用上。
Hugging Face 发布生成式 AI 服务 HUGS,基于 Text Generation Inference 和 Transformers 构建,提供零配置的优化推理微服务,可在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的优化推理部署压缩到零配置,读者可据此判断自托管开源模型的门槛与成本变化。
Anthropic 宣布最新版 Claude 3.5 Sonnet 具备电脑操作能力,在适当软件环境下可移动光标、点击屏幕位置并通过虚拟键盘输入,目前处于公开测试阶段。
推荐理由:Anthropic 官方披露 Claude 3.5 Sonnet 电脑操作能力的训练思路与安全评估,可了解该能力当前边界。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,加载模型时设置 device: 'webgpu' 即可启用。
推荐理由:官方发布说明列出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Anthropic 发布升级版 Claude 3.5 Sonnet 和新模型 Claude 3.5 Haiku,并公开 computer use 能力公测。
推荐理由:官方给出升级版 Claude 3.5 Sonnet 与 Haiku 的基准变化,并首次开放 computer use 公测,可据此判断智能体操作电脑的当前边界。
Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。
推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:Gradio 5 把 SSR、低延迟流式和安全审计打包进稳定版,可据此判断现有 ML 演示应用是否需要升级。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 在 API 中推出 Prompt Caching,对模型近期已见过的输入自动提供折扣。官方说明该机制面向重复出现的输入内容,具体折扣幅度与适用条件未在摘要中给出。
推荐理由:OpenAI 在 API 层面对近期出现过的输入自动打折,读者可据此判断长提示词与重复上下文的成本变化。
Anthropic 发布 Contextual Retrieval 方法,通过 Contextual Embeddings 和 Contextual BM25 两项子技术,将 top-20 分块检索失败率降低 49%,结合重排序后降低 67%。
推荐理由:Anthropic 公开了 Contextual Retrieval 的具体做法与失败率数据,读者可据此评估自家 RAG 检索环节的改进空间。