跳到正文
5月7日周三
5月6日周二
5月5日周一
  1. OpenAI News62

    OpenAI 董事会宣布营利实体将转为公益公司

    OpenAI 董事会发布更新,宣布将营利实体转型为公益公司(Public Benefit Corporation),在非营利监督下强化其使命驱动结构,同时寻求更大影响力和与公共利益的长期一致。

    推荐理由:OpenAI 董事会披露营利实体转为公益公司的治理调整,可了解其非营利监督架构的走向。

5月2日周五
4月30日周三
4月29日周二
  1. Hugging Face Blog62

    Meta 发布 Llama Guard 4 与 Llama Prompt Guard 2

    Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个 Llama Prompt Guard 2 模型(86M 和 22M 参数),模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。

    推荐理由:Meta 发布 Llama Guard 4 多模态安全模型与 Prompt Guard 2,读者可了解其架构裁剪方式与相对前代的性能变化。

4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

4月25日周五
4月24日周四
4月23日周三
  1. Hugging Face Blog36

    TNG 微调 olmOCR-7B-0225-preview,打造忠实还原页眉页脚的 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调出忠实版 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调后模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。

4月22日周二
4月16日周三
  1. Hugging Face Blog36

    并发请求下的 Prefill 与 Decode:优化 LLM 性能

    TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。

  2. OpenAI News80

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 的系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的工具调用范围,可据此了解新模型在推理之外的能力边界。

  3. OpenAI News82

    OpenAI 发布 o3 与 o4-mini

    OpenAI 发布 o3 和 o4-mini 两款模型,官方称其为目前最智能、能力最强的模型,并支持完整的工具调用。

    推荐理由:OpenAI 官方发布 o3 与 o4-mini,并称其为目前最强模型且支持完整工具调用。

4月15日周二
4月14日周一
  1. OpenAI News80

    OpenAI 在 API 中发布 GPT-4.1 系列模型

    OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并首次推出 nano 模型。该系列即日起面向全球开发者开放。

    推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的新分层与编码、长上下文能力提升。

4月11日周五
4月10日周四
4月9日周三
  1. Mistral AI35

    Mistral 如何用 LLM as a Judge 评估 RAG 系统

    Mistral 提出用 LLM as a Judge 配合结构化输出实现 RAG Triad 评估框架,从上下文相关性、有据性和答案相关性三个维度打分。该框架由 TruLens 提出,RAGAS 等类似方案也已出现,用于端到端评估 RAG 系统的检索与生成质量。Mistral 模型可同时充当生成器和评判器,结构化输出让评分标准可复用且易于机器读取。

4月8日周二
4月7日周一
  1. OpenAI News20

    OpenAI 发布欧盟经济蓝图

    OpenAI 发布欧盟经济蓝图,提出一套政策建议,旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长,并确保 AI 由欧洲、在欧洲、为欧洲开发和部署。

4月5日周六
  1. Hugging Face Blog88

    Meta 发布 Llama 4 Maverick 与 Scout,上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数)两款原生多模态 MoE 模型,均为 17B 激活参数,权重已上线 Hugging Face 的 meta-llama 组织。

    推荐理由:Meta 发布 Llama 4 两款 MoE 多模态模型,Hugging Face 同步给出架构细节与部署方式,便于判断长上下文与端侧部署取舍。

4月4日周五
  1. Hugging Face Blog22

    Gradio 月活开发者突破 100 万:Hugging Face 分享五年增长经验

    Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。

4月3日周四
4月2日周三
  1. Hugging Face Blog36

    高效请求排队:优化 LLM 性能

    TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。