我要投稿

AI也邪修！Qwen3改Bug测试直接搜GitHub，太拟人了

发布日期：2025-09-04 14:48:23 浏览次数： 2102

作者：量子位

微信搜一搜，关注“量子位”

大模型也会玩信息差了。

Qwen3在基准测试中居然学会了钻空子。

FAIR研究员发现Qwen3在SWE-Bench Verified测试中，不按常理修bug，反而玩起了信息检索大法。

不分析代码逻辑，不定位漏洞根源，而是直接跑到GitHub上搜任务里的issue编号，精准扒出了前人留下的修复方案。

能说吗，会搜代码才是真正的程序员行为吧。而Qwen3，你是真正的程序员。

Qwen3是如何钻空子的

要知道，SWE-Bench Verified本来是检验模型真刀真枪修代码的基准，相当于编程届的资格考试。

它的测试逻辑是这样的：在代码修复类任务中，它给模型的任务全是真实开源项目里的bug，比如修复某个功能异常、补全缺失的代码模块，核心要求是模型能读懂现有的代码、定位到问题在哪，最后生成能够直接运行的解决方案。

这原本考验的是模型从0到1解决问题的能力，但我们的Qwen3，可没按这个剧本走。

FAIR研究团队追踪它的操作轨迹发现，Qwen3拿到任务后，第一步不是分析代码文件，而是调用工具检索GitHub的提交日志。

具体操作是：

先切换（cd）到/workspace/django_django_4.1这个目录；
然后执行git log —oneline —grep=“33628” —all这个命令。

git log是查看Git版本控制提交历史的命令，—oneline让提交历史以简洁的一行的形式展示。

—grep用于筛选提交指定内容（在这个例子中是issue编号33628），—all则表示所有分支的提交。

最后以退出码0表示命令成功执行。

一番操作之后，Qwen3不用动脑子写代码就轻松“借鉴”了以前的成功答案。（怎么不算动脑子了呢）

其实不止Qwen3，研究者发现Claude 4 Sonnet也有类似的行为。

不过，模型能成功钻空子，当然也不全是自身的原因。

说回SWE-Bench Verified，它自身的设计就有漏洞——没过滤未来仓库状态。

简单说就是，这个测试用的是开源项目数据，所以它连带着项目后续已经解决bug的提交记录一起放进去了，相当于把考题和参考答案混在一起，还没设权限。

正常来说，测试应该只给模型bug未修复时的项目状态，让它只看着题目解题。

但SWE-Bench Verified没做这个筛选，导致模型能够拿到bug已经被修复后的数据。

于是，只要用任务里的issue编号当关键词，就能在已解决的数据里找到现成的修复方案。

看来啊，不是只有人类知道搜答案比解问题简单，现在大模型也知道了。（Doge）

虽然说，按正常规则，这些模型确实是在作弊，但也有网友觉得：只要能完成任务，利用规则漏洞也没什么不行的。

所以，你觉得这种行为算作弊还是算Qwen3聪明呢？

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-06-25

微信在金矿上孵化了啥？

2026-06-25

Google 把 FDE 改写成 Agent Engineer 这周，中国企业正在逼出另一种 FDE

2026-06-24

使用 Google AI Studio 轻松构建原生 Android 应用

2026-06-24

场景营销前端 AI Coding — AI Native 的视觉稿还原

2026-06-24

Claude Tag：你的公司正在被 AI 偷学

2026-06-24

精华：去哪儿网AI Coding研发平台实践，值得读三遍的样本

2026-06-24

做 FDE 的第一步不是写代码，而是把客户问题拆到能验收

2026-06-24

Claude学会常驻Slack，AI协作变天了

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

Claude Opus 4.7刚刚曝光！Claude Code一夜重构，7x24小时替你打工

2026-04-15

OpenAI Codex CLI 完整使用指南

2026-04-07

Claude Code 和 Codex 接入 Figma MCP 保姆级教程

2026-04-07

刚刚Qwen 3.6 Plus上线预览：1M上下文，阿里Coding/Agent翻身战打响

2026-03-31

GPT5.5来了，最大特点解析

2026-04-24

Claude Opus 4.7 发布，全网最详细解读

2026-04-17

突发！Claude Code 源码泄露，扒出这些隐藏功能

2026-03-31

GPT-6，曝光了

2026-04-05

GLM-5.1 实测：面向 Agent 长程任务的国内第一模型

2026-04-02

重磅！GPT-6曝光了

2026-04-05

大家都在问

微信在金矿上孵化了啥？

2026-06-25

企业智能体的下半场，如何让智能体越用越聪明？

2026-06-18

Agent 记忆，我们全都理解错了？

2026-06-18

如何利用 Harness “一句话交付产品功能”？

2026-06-10

Loop Engineering 循环工程又是什么鬼？

2026-06-10

Agent 工程化五件套：Prompt、Skill、MCP、CLI 到底怎么配合？

2026-06-07

为什么云端 Agent 基建这么难？

2026-06-06

当 AI 开始拥有“自主调度权”：Claude 4.8 这个新功能，到底有多可怕？

2026-06-03

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw