跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

111 条精选近 30 天 11 条共收录 256 条

更新

精选归档 · 第 5 页

2月3日周一第 81–100 条
  1. OpenAI News72

    OpenAI 发布 deep research 智能体

    OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。

2月2日周日
  1. Hugging Face Blog66

    Open-R1 更新:复现 DeepSeek-R1 评测与训练管线进展

    Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。

1月31日周五
1月28日周二
12月18日周三
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

12月17日周二
  1. OpenAI News62

    OpenAI 发布 o1 模型及多项开发者工具更新

    OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。

    推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。

10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation,可用任意助手模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。

10月16日周三
  1. Mistral AI62

    Mistral 发布 Ministral 3B 与 8B 端侧模型

    Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。

    推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。

9月12日周四
8月12日周一
  1. Hugging Face Blog62

    TII 发布 Falcon Mamba:首个强性能无注意力 7B 模型

    阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。

    推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。

7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1:8B、70B 与 405B,支持多语言和长上下文

    Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。

    推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。

7月16日周二
  1. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。

    推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。

7月11日周四
  1. Hugging Face Blog60

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。

4月18日周四
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

12月20日周三
  1. Hugging Face Blog62

    用投机解码让 Whisper 推理提速 2 倍

    Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。

    推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。