跳到正文
LinuxDo· mi tu·· 6 小时前AI 评分22

多模型编排实测:6.1sol + dsv4.1f 在 swe2.0 难题上正确率反而下降

关于多模型编排的实际效果,6.1sol+dsv4.1f/swe2.0 实测

AI 导读

有开发者参考 Devin 的 fusion 报告,用 opus5.5 编写多模型编排插件并自建测试场,题目取自项目历史难题,筛掉单模型都能做对的题后仅剩 5 道。结果 swe2 独立做对 3 道、dsv4.1f 独立做对 1 道,接入编排插件后正确率反而下降。该测试仅一轮,作者希望看到更多多模型编排实测。

正文

2026 年10 月 5 日 18:03 1

之前一直怀疑多模型编排的可行性,devin的fusion有比较详细的报告,参考fusion用opus5.5写了插件和测试场,测试题从自己项目的历史难题出的,筛掉两者都能独立做对的题目只剩5道题,基本都是当时卡了很久的难题,swe2独立写出来3道,dsv4.1f独立写出来1道,用了插件正确率反而下降了…
不过只有一轮测试仅供参考,好奇有没有其他多模型编排的实测?

FUSION_REPORT

来源:LinuxDo · linux.do