Hugging Face Blog·· 2024-03-05AI 评分32
UCLA 发布 ConTextual:多模态模型在文本密集场景中的图文联合推理评测基准
Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?
AI 导读
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
来源:Hugging Face Blog · huggingface.co