UCR研究揭示LLM置信度与正确性内部特征分离
热点事件持续更新
UCR研究揭示LLM置信度与正确性内部特征分离
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
UC Riverside 团队发表研究,发现大语言模型的置信度与正确性由不同内部特征编码,挑战了“模型自信即正确”的假设。研究用稀疏自编码器分析 Meta Llama-3.1-8B 和 Google Gemma-2-9B 两个开放权重模型,识别出与不确定性、错误答案及两者混杂的三类特征。干预在已训练模型答题时进行,无需重新训练。抑制与不确定性和错误同时相关的特征后,准确率最高提升 1.1%,模型不确定性降低最多 75%。让模型对以此方式标记的问题拒绝作答,准确率从 62% 升至 81%,同时仍回答约 53% 的问题。该研究为通过内部特征标记可疑答案提供了依据。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 17:22
UC Riverside 研究:通过稀疏自编码器让模型标记可疑答案报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Hacker News · AIUC Riverside 研究:通过稀疏自编码器让模型标记可疑答案
UC Riverside 团队发现大语言模型的置信度与正确性由不同内部特征编码,挑战了“模型自信即正确”的假设。研究用稀疏自编码器分析 Meta Llama-3.1-8B 和 Google Gemma-2-9B,识别出与不确定性、错误答案及两者混杂的三类特征;抑制混杂特征后准确率最高提升 1.1%,不确定性降低最多 75%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。