跳到正文
4月3日周五
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月24日周二
3月18日周三
  1. Google DeepMind46

    Google DeepMind 发布 AGI 认知框架,并启动 Kaggle 黑客松

    Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出包含感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力的认知分类框架,并配套三阶段评估协议,用留出测试集防数据污染、采集具人口代表性的人类基线、将 AI 表现映射到人类表现分布。

3月17日周二
  1. Google Research40

    Google 用高温超导研究问题测试 LLM 世界模型

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。

2月26日周四
2月23日周一
  1. OpenAI News60

    OpenAI 解释为何不再评测 SWE-bench Verified

    OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。

    推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。

2月19日周四
  1. Hugging Face Blog60

    IBM 与 UC Berkeley 用 IT-Bench 和 MAST 诊断企业级智能体为何失败

    IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。

    推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。

2月18日周三
2月13日周五
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并首次开放 API 早期访问,可据此判断其科研与工程场景的可用性。

2月4日周三
1月28日周三
1月27日周二
1月21日周三
12月17日周三
12月16日周二
12月9日周二
12月4日周四
11月21日周五
11月19日周三
11月4日周二
10月24日周五
  1. Mistral AI62

    Mistral 发布 AI Studio 生产级 AI 平台

    Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,围绕可观测性、Agent Runtime 和 AI Registry 三大支柱构建。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力产品化,读者可据此判断企业 AI 从原型走向生产的工程路径。

10月7日周二
  1. Hugging Face Blog60

    BigCode 发布 BigCodeArena:通过代码执行端到端评测代码生成模型

    BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。

    推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。

10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估 embedding 模型在真实应用中的检索准确率。该基准采用公开与私有数据集混合策略,私有部分由 MTEB 维护者评测,以检测模型在未见数据上的泛化能力,覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10。

9月25日周四
9月22日周一
9月18日周四
8月12日周二
8月1日周五
7月23日周三
  1. Hugging Face Blog42

    TimeScope:你的视频大模型能看多长的视频?

    Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。

7月17日周四
  1. Hugging Face Blog40

    Hugging Face 推出 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务,评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周约产出 5 个新闻类问题,另从 Polymarket 每周引入约 8 个问题。其设计使数据污染不可能发生,结果可随时间客观验证。

7月16日周三
7月4日周五
6月6日周五
5月21日周三
  1. Mistral AI71

    Mistral AI 发布智能体编码模型 Devstral

    Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月12日周一
4月16日周三