Meta 等釋出 SWE-sweep,測模型能否提前找 bug
2026/10/03 — 10/03 03:11·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,在 Reddit 的 LocalLLaMA 版塊上,一位研究者發帖介紹了新基準 SWE-sweep。該基準由他與其他研究者共同完成,參與者來自 Meta、斯坦福、哈佛和華盛頓大學。
按照帖中描述,SWE-sweep 的做法是把一個大型程式碼庫交給 agent,讓它儘可能多地找出並修復其中的 bug,然後依據倉庫中已知的隱藏 bug 集合來打分。作者在帖中說明了推出這一基準的理由:目前多數基準測的是使用者已經遇到的 bug 的修復能力,而模型理應能夠提前發現 bug,也就是在任何人實際撞上之前就把它們找出來。帖子稱這是作者本人與 Meta、斯坦福、哈佛、UW 的研究者一起建立的。
目前這件事只停留在基準釋出與作者自述階段,材料中沒有給出評測結果、參與模型、具體得分或後續計劃,也沒有第三方對該基準的回應。
AI 綜合 1 篇報道生成 · 更新於 2 小時前
最新進展來自 Meta、斯坦福、哈佛和華盛頓大學的研究者推出新基準 SWE-sweep,把大型程式碼庫交給 agent,讓它儘可能多地找出並修復 bug,再按倉庫中已知的隱藏 bug 集合評分。作者認為現有基準多隻測使用者已經遇到的 bug,而模型應該能提前發現。

- 熱度指數
- 86
- 獨立來源
- 1
- 報道數
- 1
- 首報
- 5 小時前
這件事的報道 點標題看原文
來自 Meta、斯坦福、哈佛和華盛頓大學的研究者推出新基準 SWE-sweep,把大型程式碼庫交給 agent,讓它儘可能多地找出並修復 bug,再按倉庫中已知的隱藏 bug 集合評分。作者認為現有基準多隻測使用者已經遇到的 bug,而模型應該能提前發現。
关心代码 agent 评测新方向的读者值得一看
Reddit · LocalLLaMAAI 評分 74
同時在說的其他事
- 593爆輝達釋出 64GB 版 DGX Spark,售價 4999 美元7 個來源
- 466新Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險5 個來源
- 372谷歌釋出 Gemini 4 Argon 模型,定位前沿 AI 能力10 個來源
- 262爆OpenAI DevDay 2026 釋出 Dots、Decisions API 等新品3 個來源
- 248爆Suno 上線語音生成功能,支援旁白與配樂3 個來源
- 212爆微軟釋出 MAI-Transcribe-2-Streaming 即時轉寫模型3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
