跳到正文
Hugging Face Blog·· 2024-06-24AI 评分40

微调 Florence-2:微软的前沿视觉语言模型

Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models

AI 导读

微软 6 月发布的 Florence-2 视觉语言模型提供 0.2B 和 0.7B 两个小尺寸版本,支持 captioning、目标检测、OCR 等任务,但官方模型不含 VQA 能力。作者在 DocVQA 上微调后,验证集 Levenshtein 相似度从 0 提升至 57.0,并开源了 Colab notebook 与演示 Space。

来源:Hugging Face Blog · huggingface.co