iPhone 当第二块 GPU,Qwen 3.8 27B 预填充提速 29–44%
2026/10/03 — 10/03 03:11·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版块出现一则来自开发者的实践记录:他把一台 iPhone 17 Pro Max 当作第二块 GPU,接到一台 24GB 内存的 M4 Pro MacBook 上,用来分担 Qwen 3.8 27B(IQ4_XS 量化)的部分上下文窗口。按作者给出的数字,端到端预填充速度因此提升 29–44%。
作者在说明里交代了做这件事的缘由:在他的 24GB M4 Pro MacBook 上,agent 每读一个文件或工具返回结果都要等待,即便把 wired limit 提高到 20480,在 Qwen 3.8 27B(IQ4_XS)旁边也只能放下 64k 的 8-bit 上下文。
他同时加了一段免责声明,提醒读者手机上显示的预填充 t/s 只统计了该设备所承载的那些层,并不能代表整体速度,真正的准确数值是端到端预填充速率。作者表示已经在修正这个显示问题,并强调文中列出的数字对端到端预填充速率是准确的。截至这篇材料,这件事停在该开发者公布数据并说明显示口径待修正的阶段。
AI 综合 1 篇报道生成 · 更新于 2 小时前
最新进展有开发者把 iPhone 17 Pro Max 当作 24GB M4 Pro MacBook 的第二块 GPU,让它承载 Qwen 3.8 27B(IQ4_XS)的部分上下文窗口,端到端预填充速度提升 29–44%。作者补充说,手机上显示的预填充 t/s 只统计它承载的层,端到端数字才是准确值,相关显示正在修正。

- 热度指数
- 89
- 独立来源
- 1
- 报道数
- 1
- 首报
- 4 小时前
这件事的报道 点标题看原文
有开发者把 iPhone 17 Pro Max 当作 24GB M4 Pro MacBook 的第二块 GPU,让它承载 Qwen 3.8 27B(IQ4_XS)的部分上下文窗口,端到端预填充速度提升 29–44%。作者补充说,手机上显示的预填充 t/s 只统计它承载的层,端到端数字才是准确值,相关显示正在修正。
想用手机给本地模型加算力的人可参考这套做法
同时在说的其他事
- 593爆英伟达发布 64GB 版 DGX Spark,售价 4999 美元7 个来源
- 466新Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险5 个来源
- 372谷歌发布 Gemini 4 Argon 模型,定位前沿 AI 能力10 个来源
- 262爆OpenAI DevDay 2026 发布 Dots、Decisions API 等新品3 个来源
- 248爆Suno 上线语音生成功能,支持旁白与配乐3 个来源
- 212爆微软发布 MAI-Transcribe-2-Streaming 实时转写模型3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
