Ai2 开源 AstaBrief 8B 科学报告生成模型
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模从 17m 到 1b,基于 Ettin ModernBERT 编码器构建。
IBM 在 Hugging Face 发布两款 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 与 granite-embedding-311m-multilingual-r2,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)及 9 种编程语言代码检索。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。
Hugging Face 推出 vdr-2b-multi-v1,一个面向多语言视觉文档检索的嵌入模型,可直接编码文档页面截图,无需 OCR 或分块流程。