跳到正文
10月4日周日
9月16日周三
9月3日周四
4月15日周三
  1. Hugging Face Blog40

    VAKRA 基准解析:AI 智能体的推理、工具调用与失败模式

    Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。

10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估 embedding 模型在真实应用中的检索准确率。该基准采用公开与私有数据集混合策略,私有部分由 MTEB 维护者评测,以检测模型在未见数据上的泛化能力,覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10。