跳到正文
10月4日周日
10月2日周五
9月30日周三
  1. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,适用于构建自定义智能体、编写自动化流程和对话式数据分析。文章提出核心原则:以具体细节消除歧义、用业务上下文校准输出、用示例代替描述,并给出适用于复杂请求的 CRISPE 结构化框架。

  2. AWS Machine Learning Blog22

    Amazon Quick 各组件提示词工程:模式与陷阱

    AWS 博客按组件拆解 Amazon Quick 的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清时间、数据源与输出格式,复杂逻辑用编号步骤,并可通过对话迭代修改。Quick Sight 的查询则需包含业务问题、指标、维度与可视化偏好。

9月29日周二
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 代码、RAG 已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成代码仍需阅读和负责,但审查力度应随风险变化;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未死亡,检索能让模型更接近答案并减少 token 消耗。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求可能反映代码库可维护性问题。

9月16日周三
9月3日周四
8月21日周五
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。

8月18日周二
  1. Hugging Face Blog60

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

6月23日周二
  1. Mistral AI67

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。

6月5日周五
  1. Google Research58

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG

    Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过编排器、规划器、查询改写、搜索扇出和充分上下文智能体协同处理多源多跳查询。相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中路由查询,90.1% 的问题回答正确,单语料与跨语料版本延迟平均相差约 3%。

5月28日周四
  1. Mistral AI71

    Mistral AI 发布 Search Toolkit 公开预览版

    Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,将数据摄取、检索和评测整合到共享接口下,开源并支持云端、本地和边缘部署。

    推荐理由:原文给出检索管线的统一框架与内置评测指标,读者可据此判断自建 RAG 检索栈的整合成本。

5月19日周二
5月15日周五
4月16日周四
4月15日周三
  1. Hugging Face Blog40

    VAKRA 基准解析:AI 智能体的推理、工具调用与失败模式

    Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。

    推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。

10月23日周四
10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估 embedding 模型在真实应用中的检索准确率。该基准采用公开与私有数据集混合策略,私有部分由 MTEB 维护者评测,以检测模型在未见数据上的泛化能力,覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10。

9月4日周四
  1. Hugging Face Blog62

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。

8月5日周二
7月1日周二
5月28日周三
  1. Mistral AI62

    Mistral 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。

5月12日周一
4月9日周三
  1. Mistral AI35

    Mistral 如何用 LLM as a Judge 评估 RAG 系统

    Mistral 提出用 LLM as a Judge 配合结构化输出实现 RAG Triad 评估框架,从上下文相关性、有据性和答案相关性三个维度打分。该框架由 TruLens 提出,RAGAS 等类似方案也已出现,用于端到端评估 RAG 系统的检索与生成质量。Mistral 模型可同时充当生成器和评判器,结构化输出让评分标准可复用且易于机器读取。

3月26日周三
3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 OCR API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可读取图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出与 Google Document AI、Azure OCR、Gemini 系列的横向基准对比,可据此判断文档解析在 RAG 流程中的选型空间。

1月10日周五
10月28日周一
7月16日周二
7月9日周二
6月7日周五