字节跳动发布 Sa2va-4b-Image,连接 SAM-2 与多模态大模型
2026/10/03 — 10/03 11:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,DEV Community 上出现一篇介绍性文章,讲的是由字节跳动维护的图像模型 Sa2va-4b-Image。文章称该模型属于 Sa2VA 系列,是这个系列中的图像模型;它的做法是把 SAM-2 分割模型与多模态大模型(MLLM)结合在一起,从而把自然语言指令直接连接到图像中的具体区域。
使用方式上,模型接收一张图片和一段文字指令作为输入,返回一段文本回复以及一个图片 URI。该文自述是一份关于这个模型的简化指南,并在开头提到,如果读者喜欢这类分析,可以加入 AImodels.fyi 或关注其 Twitter 账号。
报道没有给出这个模型的发布时间、参数量、训练数据、评测结果、开放范围或与同系列其他模型的关系,也没有说明字节跳动是否通过官方渠道宣布过它。就目前这一篇材料而言,可以核对到的信息停留在上述范围:主体是字节跳动,模型名是 Sa2va-4b-Image,所属系列是 Sa2VA,技术路线是 SAM-2 加多模态大模型,输入是图片加文字指令,输出是文本回复加图片 URI。
AI 综合 1 篇报道生成 · 更新于 2 小时前
最新进展字节跳动的 Sa2va-4b-Image 属于 Sa2VA 系列,把 SAM-2 分割模型与多模态大模型结合,让自然语言指令直接对应到图像区域。输入一张图片和一段文字指令,模型返回文本回复和图片 URI。

这件事的报道 点标题看原文
字节跳动的 Sa2va-4b-Image 属于 Sa2VA 系列,把 SAM-2 分割模型与多模态大模型结合,让自然语言指令直接对应到图像区域。输入一张图片和一段文字指令,模型返回文本回复和图片 URI。
多模态分割方向的新模型,可留意字节这条线
DEV Community · AIAI 评分 62
同时在说的其他事
- 554英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 539发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险7 个来源
- 400Meta 开源 Muse Gadgets 固件与 SDK5 个来源
- 234爆亚马逊拟将约 80 亿美元英伟达芯片转入融资载体3 个来源
- 227Anthropic 投 1 亿美元启动 Claude 工程师学院3 个来源
- 226爆Hugging Face 开源报告生成模型 AstaBrief3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
