HaiAI123

全球AI工具精選導航

熱點事件
0
熱度指數
新上榜

GLM-5.3 與 Claude Mythos 在漏洞利用測試中取得突破

2026/09/30 — 10/03 01:12·2 個來源·2 篇報道

事件概覽

2026 年 9 月 30 日,Simon Willison 報道了 Anthropic Frontier Red Team 的一項測試結果:該團隊從內部 Binary Exploitation 基準中隨機抽取 100 項任務,對多個模型進行評估,發現 GLM-5.3 在 4% 的測試中實現了完整的控制流劫持,Claude Mythos Preview 的比例為 6%。報道同時指出,GLM-5.3 在這一點上低於 Claude Mythos Preview,但一個明顯的門檻已經被跨過:此前的模型,例如 Claude Opus 4.6 和 GLM-5.2,都沒有成功。

同日晚些時候,開源中國報道稱,Anthropic 前沿紅隊在評估智譜的 GLM-5.3 後認為,它是第一個能像五個月前的 Claude Mythos Preview 那樣自主構建端到端漏洞利用、卻幾乎沒有拒絕護欄就放出來的模型。報道提到,五個月前 Anthropic 釋出 Claude Mythos Preview 時,曾自稱這是第一個能自主構建複雜端到端漏洞利用的 AI 模型。

目前事情停在 Anthropic 前沿紅隊給出上述評估結論這一步:兩篇報道分別給出了 4% 與 6% 的測試數字,以及護欄缺失的判斷,側重點不同。材料中沒有出現智譜方面的回應,也沒有說明紅隊評估之後會有什麼後續動作。

AI 綜合 2 篇報道生成 · 更新於 1 小時前

最新進展Anthropic 前沿紅隊評估智譜 GLM-5.3 後認為,它是首個能像五個月前的 Claude Mythos Preview 那樣自主構建端到端漏洞利用、卻幾乎沒有拒絕護欄就放出來的模型。五個月前 Anthropic 釋出 Mythos Preview 時,曾稱其為首個具備該能力的模型。

相關工具

這件事的報道 點標題看原文

9月30日
  1. Anthropic 前沿紅隊評估智譜 GLM-5.3 後認為,它是首個能像五個月前的 Claude Mythos Preview 那樣自主構建端到端漏洞利用、卻幾乎沒有拒絕護欄就放出來的模型。五個月前 Anthropic 釋出 Mythos Preview 時,曾稱其為首個具備該能力的模型。

    了解开源模型能力与安全护栏的真实差距。

    开源中国AI 評分 82
  2. Anthropic Frontier Red Team 測試顯示,GLM-5.3 在 4%的測試中實現完整控制流劫持,Claude Mythos Preview 為 6%,而此前模型如 Claude Opus 4.6 和 GLM-5.2 均未成功。

    揭示 AI 模型在网络安全能力上的实质性跨越

    Simon WillisonAI 評分 85

同時在說的其他事

熱度怎麼算的?瞭解口徑

熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。

本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。

爆
討論快速增加
新
首報 6 小時內
發酵中
討論仍在增加

回熱點事件榜 →