跳到正文
Hugging Face Blog·· 2026-06-03AI 评分38

超越聊天机器人:用模型自身失败样本做 DPO,降低 OCR 文本退化

Direct Preference Optimization Beyond Chatbots

AI 导读

DharmaOCR 团队将 DPO 用于结构化 OCR 任务,用模型自身产生的重复循环失败样本构建偏好对,在全部测试的视觉语言模型家族中均降低文本退化,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。

来源:Hugging Face Blog · huggingface.co