Meta 等发布 SWE-sweep,测模型能否提前找 bug
2026/10/03 — 10/03 03:11·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,在 Reddit 的 LocalLLaMA 版块上,一位研究者发帖介绍了新基准 SWE-sweep。该基准由他与其他研究者共同完成,参与者来自 Meta、斯坦福、哈佛和华盛顿大学。
按照帖中描述,SWE-sweep 的做法是把一个大型代码库交给 agent,让它尽可能多地找出并修复其中的 bug,然后依据仓库中已知的隐藏 bug 集合来打分。作者在帖中说明了推出这一基准的理由:目前多数基准测的是用户已经遇到的 bug 的修复能力,而模型理应能够提前发现 bug,也就是在任何人实际撞上之前就把它们找出来。帖子称这是作者本人与 Meta、斯坦福、哈佛、UW 的研究者一起创建的。
目前这件事只停留在基准发布与作者自述阶段,材料中没有给出评测结果、参与模型、具体得分或后续计划,也没有第三方对该基准的回应。
AI 综合 1 篇报道生成 · 更新于 2 小时前
最新进展来自 Meta、斯坦福、哈佛和华盛顿大学的研究者推出新基准 SWE-sweep,把大型代码库交给 agent,让它尽可能多地找出并修复 bug,再按仓库中已知的隐藏 bug 集合评分。作者认为现有基准多只测用户已经遇到的 bug,而模型应该能提前发现。

- 热度指数
- 86
- 独立来源
- 1
- 报道数
- 1
- 首报
- 5 小时前
这件事的报道 点标题看原文
来自 Meta、斯坦福、哈佛和华盛顿大学的研究者推出新基准 SWE-sweep,把大型代码库交给 agent,让它尽可能多地找出并修复 bug,再按仓库中已知的隐藏 bug 集合评分。作者认为现有基准多只测用户已经遇到的 bug,而模型应该能提前发现。
关心代码 agent 评测新方向的读者值得一看
Reddit · LocalLLaMAAI 评分 74
同时在说的其他事
- 593爆英伟达发布 64GB 版 DGX Spark,售价 4999 美元7 个来源
- 466新Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险5 个来源
- 372谷歌发布 Gemini 4 Argon 模型,定位前沿 AI 能力10 个来源
- 262爆OpenAI DevDay 2026 发布 Dots、Decisions API 等新品3 个来源
- 248爆Suno 上线语音生成功能,支持旁白与配乐3 个来源
- 212爆微软发布 MAI-Transcribe-2-Streaming 实时转写模型3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
