跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

111 条精选近 30 天 11 条共收录 256 条

更新

精选归档 · 第 6 页

12月5日周二第 101–111 条
  1. Hugging Face Blog62

    Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

    Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。

    推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。

9月27日周三
  1. Mistral AI78

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。

    推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。

6月5日周一
5月31日周三
  1. OpenAI News65

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。

5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成解码方法,可将文本生成延迟降低最多 10 倍

    Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。

    推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。

1月24日周二
12月9日周五
  1. Hugging Face Blog62

    图解基于人类反馈的强化学习 RLHF

    Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。

10月29日周五
  1. OpenAI News62

    OpenAI 训练系统求解小学数学应用题,准确率约为微调 GPT-3 的两倍

    OpenAI 训练了一个求解小学数学应用题的模型,准确率接近微调 GPT-3 模型的两倍。在自建数据集的同一批题目上,该系统的正确率为 55%,而 9-12 岁儿童小样本的正确率为 60%,即解题量约为这些孩子的 90%。

    推荐理由:OpenAI 用自建小学数学数据集对比微调 GPT-3,给出模型与 9-12 岁儿童在同一批题目上的准确率差距。

3月1日周日
7月4日周三
  1. OpenAI News62

    OpenAI 用单次演示让智能体在《蒙特祖玛的复仇》中取得 74500 分

    OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。

    推荐理由:OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。