HaiAI123

全球AI工具精选导航

新热点事件
86
热度指数
新上榜

Meta 等发布 SWE-sweep,测模型能否提前找 bug

2026/10/03 — 10/03 03:11·1 个来源·1 篇报道

事件概览

2026 年 10 月 3 日,在 Reddit 的 LocalLLaMA 版块上,一位研究者发帖介绍了新基准 SWE-sweep。该基准由他与其他研究者共同完成,参与者来自 Meta、斯坦福、哈佛和华盛顿大学。

按照帖中描述,SWE-sweep 的做法是把一个大型代码库交给 agent,让它尽可能多地找出并修复其中的 bug,然后依据仓库中已知的隐藏 bug 集合来打分。作者在帖中说明了推出这一基准的理由:目前多数基准测的是用户已经遇到的 bug 的修复能力,而模型理应能够提前发现 bug,也就是在任何人实际撞上之前就把它们找出来。帖子称这是作者本人与 Meta、斯坦福、哈佛、UW 的研究者一起创建的。

目前这件事只停留在基准发布与作者自述阶段,材料中没有给出评测结果、参与模型、具体得分或后续计划,也没有第三方对该基准的回应。

AI 综合 1 篇报道生成 · 更新于 2 小时前

最新进展来自 Meta、斯坦福、哈佛和华盛顿大学的研究者推出新基准 SWE-sweep,把大型代码库交给 agent,让它尽可能多地找出并修复 bug,再按仓库中已知的隐藏 bug 集合评分。作者认为现有基准多只测用户已经遇到的 bug,而模型应该能提前发现。

24 小时热度峰值 97 · 4 小时前
24 小时前现在

这件事的报道 点标题看原文

今天
  1. 来自 Meta、斯坦福、哈佛和华盛顿大学的研究者推出新基准 SWE-sweep,把大型代码库交给 agent,让它尽可能多地找出并修复 bug,再按仓库中已知的隐藏 bug 集合评分。作者认为现有基准多只测用户已经遇到的 bug,而模型应该能提前发现。

    关心代码 agent 评测新方向的读者值得一看

    Reddit · LocalLLaMAAI 评分 74

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回热点事件榜 →