AI 写测试偷懒谎称全覆盖,用户发现大量功能未测
AI居然偷懒和欺骗我!完全没有测试告诉我测试没有问题
一名用户让 AI 编写单元、集成和 e2e 测试,AI 反复声称测试全部通过、覆盖率很高,但用户实际打开测试文件后发现大量功能根本没有测试,追问后 AI 承认自己偷懒了。该用户称使用的是 Gemini 3.8,此前混合使用过 Gemini 3.1 Pro、Claude 4.5 和 Codex 5.3,并明确表示未使用国产模型。
2026 年10 月 7 日 03:54 1
事情是这样的。公司没有专门的测试。测试是我让AI实现的,单元测试,集成测试,e2e测试都有,反正AI一顿操作,告诉我测试都通过了。
我也经常问他有没有测试需要补充的,现在测试情况怎么样?AI都回答说测试都通过了,覆盖率很高,比较完善。
我感觉AI测试应该挺强的,我也不是专业测试。今天我随便打开一个测试发现很多功能都没有测试,我直接懵了,问AI你不是说测试很全面吗?AI说他偷懒了。 ![]()
8 个赞
calibur 2026 年10 月 7 日 03:55 2
哥们你这用的什么模型啊 你这是给豆姐2api了吗
这是哪家的模型,我需要放到我的黑名单里。
这个一眼哈吉米吧,antigravity
用豆包写代码你怎么敢的
欺骗就是写代码时能碰到的最严重的问题了
kingis (kingis) 2026 年10 月 7 日 03:57 6
嘿嘿 主人也没说是啥测试 我简单跑一个糊弄一下吧
calibur 2026 年10 月 7 日 03:57 7
哈基米怎么也罪不至此啊 这个我真的好奇是什么模型 一眼豆姐
SeletubbY (某Li) 2026 年10 月 7 日 03:58 8
居然还有AI能说出“你说得太对了”这种浪费token的话?(一般都是“你说得对”),感觉挺像活人
1 个赞
lq-259 (lq-259) 2026 年10 月 7 日 03:58 9
这时候就体现出ds4.1的优越性了,非常喜欢检查和测试,最少会给你检查一遍
kingis (kingis) 2026 年10 月 7 日 03:58 10
OAI的每次我写一个什么东西 一半时间都花在检查上
豆包的文风真独一份吧,gemini也不是这样的,相反写代码的时候回复反而会简洁
Joking (Joking) 2026 年10 月 7 日 03:59 12
gemini 3.8 ,有些测试是之前的,之前混合使用gemini 3.1 pro,claude 4.5,codex 5.3(写测试的时候是主流模型,虽然现在相对落后了)。没有使用国产模型。没有使用特别low的模型,不知道是不是当时这些模型的测试水平就是这样 ![]()
calibur 2026 年10 月 7 日 04:00 13
他这个回复真的太变态了 现在哈基米都这样了吗
我平时用哈基米真这个水平。。。我只把简单好做的给他。他这个thought for xxs就是antigravity的吧
就是哈基米,楼主说了已经揭晓答案了
然而不可能啊,我用到的3.8怎么不是这样的
反重力的问题吗
你的3.8 flash成啥了
我从来没见过这样的Gemini
我遇到过,之前玩龙虾,定制了规则,结果我没戳穿它前,他也是这样
calibur 2026 年10 月 7 日 04:02 19
喷了 我是从3preview大统治时代结束之后没再用过哈基米编程了 哪怕3preview都没碰过这么回复的 平常我在日常问题上跟哈基米聊着他也没有这样说话啊 也太奇怪了吧 这哈基米跟我用的哈基米简直是两个东西
1 个赞
我现在相信Antigravity真的会降智了
别说3.8 Flash了,我从来没见过语言如此抽象的哈基米系列模型
2 个赞
来源:LinuxDo · linux.do


