刷到一篇公众号,标题是「Meta 又开源了」,讲 SAM 3D 能把一张照片变成完整 3D 场景。
技术是真的,但「又开源」这三个字容易让人误会——它 2025 年 11 月就发了,到现在快一年。
撇开时间戳,真正值得问的是另一件事:单图变 3D 这条路,到 2026 年到底谁最强,我们手上的活该用谁?
作者 | 听风
编辑/排版 | MM77
翠鸟AI技术漫研 — 拓新AI边界、探索技术增量
SAM 3D 首发是 2025 年 11 月 19 日,不是新闻。它由两个模型组成:SAM 3D Objects 管物体和场景,SAM 3D Body 管人体。
它真正的本事,是从一张杂乱、有遮挡的真实照片里,把被挡住一半的东西也补全成完整 3D,还能把人和物摆进同一个坐标系。
官方给的偏好胜率是 5:1——但这是在「真实场景重建」这条赛道上比的,不是「生成一个好看的手办」。
没有全能冠军。

你要一个能用、能商用的 3D 资产,该看 Hunyuan3D 或 TRELLIS:网格更干净、纹理是 PBR、许可证也更宽松。
SAM 3D 能干的事很窄,但那件窄事,别人暂时还干不了。
01. 把「又开源」三个字先放下
那篇公众号没说错什么,信息基本准确,只是浅——它是官方博客的中文缩写版。唯一有点误导的是标题的「又」字。
SAM 3D 的代码、权重、在线 demo,是 2025 年 11 月 19 日一起放出的。
今年年中补了两次料:6 月 1 日放视觉编码器权重,6 月 2 日放了一套叫 SA-3DAO 的物体评测基准和排行榜。
核心模型摆在 GitHub 上,快一年了。
这不是挑刺。时间线重要,是因为它决定了一件实在的事:社区生态成熟到什么程度。
一个刚发一周的模型,你得自己啃论文、踩环境坑;一个跑了快一年、Objects 仓库攒了七千多颗星的模型,二次封装、量化版、和别的工具的对接教程,多半都有人趟过了。真要上手,你省下的是这一年里别人替你踩的坑。
撇开这层,正题只有一个:从一张 2D 图恢复 3D 这件事,本身很难,SAM 3D 把它做到了哪一步,又还有谁做得更好。

02. SAM 3D到底做了什么“难事”
难点在数据。要训一个「看一眼就知道背面长啥样」的模型,你需要海量的「图像 ↔ 3D 模型」配对数据。
这种数据几乎不存在——没人会给世界上每个杯子都建一个精确的 3D 模型再配上照片。
传统办法绕过它,是靠多视角几何:
同一个物体从不同角度拍好多张,再拼出来。但那要求你能到处拍,单张图就没辙。
SAM 3D 的解法分两头。

架构:先猜个大概,再补细节
它把重建拆成两段。
- 第一段是几何模型,核心是「认」——用 DINOv2 的语义特征判断「这是个杯子」,
- 然后调出记忆里杯子的典型形状,输出一个 64³ 体素的粗胚,外加物体的姿态(旋转、平移、缩放)。
这里有个巧思:
它同时喂两张图,一张是裁出来的物体特写,一张是完整场景,让模型既看清东西本身、又懂它在环境里的位置。
- 第二段是纹理细化模型,以粗胚为底,把被遮挡的部分补全,再合成颜色和材质。
- 最后可以输出传统三角网格,也可以输出 3D 高斯泼溅。

// 为什么「先猜再补」是对的
当 AI 看不到杯子背面时,纯几何的方法只能瞎编,容易出鬼影和破面。
SAM 3D 先靠语义认出「这是杯子」,再按杯子该有的样子去补——它编得更像那个东西该有的样子。
一份把它和 Hunyuan3D、TripoSG 等放一起测的基准就发现:
单图深度这道坎大家都过不好,但 SAM 3D 最能抓住整体拓扑,别的模型更容易「过度简化」,糊弄过去。
训练:像训语言模型一样,分阶段灌
数据不够怎么办?
它用了一套三阶段的渐进策略,味道很像大语言模型的预训练 + 微调 + 对齐:
- 先用纯渲染的合成物体打底,让模型学会基本的形状和纹理词汇;
- 再把合成物体贴进真实照片背景里,逼它适应光照、杂乱、遮挡;
- 最后用真实的图像-3D 配对数据微调,并且和人类偏好对齐,学会处理严重遮挡和罕见物体。
这套「多阶段 + 带人类反馈的数据引擎」,是它敢自称 foundation model 的底气所在,也是它在真实杂乱场景下比同类稳的原因。

别人比的是「谁生成的模型好看」,SAM 3D 比的是「谁能从一张乱糟糟的真实照片里,把东西还原得更忠实」。这是两道题。
03. SAM 3D强在哪,它只强在哪
把话说透:SAM 3D 有一个别人暂时给不了的能力,其余维度它都不是最优。
它真正的护城河是真实场景重建——
从一张同时有人、有物、有遮挡的普通照片里,把每个物体补全成完整 3D,把人体也重建出来(这是 SAM 3D Body 的活,它用一套新的人体参数化表示 MHR,把骨架和体表解耦),
然后让人和物落在同一个坐标系里,组成一个可交互、能从任意角度看的 3D 场景。
这件事,做资产生成的那些模型做不了——它们的输入假设是「一张干净的、只有一个主体的产品图」。

// 那道窄门后面,也有三块绊脚石
- 要给提示。
SAM 3D 通常得你先给个 mask 圈出目标物体。真实场景里给精确 mask 很麻烦,有时候你想框的东西根本没法用「位置」框,只能用「语义」描述。
已经有个叫 Ref-SAM3D 的扩展工作用文字提示来绕开这点。
- 出的不是美术友好的模型。
它的输出是「重建」,不是「资产」——布线、拓扑不是给你直接拖进游戏引擎、绑骨骼用的。要那种,得看专门优化拓扑的工具。
- 许可证有坑。
SAM 3D 用的是 SAM License,不是 Apache/MIT 那种标准开源协议。要商用,先老老实实把条款读完。
04. 没有全能冠军,要按用途选
2026 年这个领域最真实的一句话是:
没有哪个模型样样第一。所以别问「哪个最好」,问「我这件活该用谁」。
| 你要干的事 | 选谁 | 为什么不是 SAM 3D |
| 杂乱真实场景 + 遮挡补全 + 人物同坐标系 | SAM 3D ✅ | 这就是它的主场,别人进不来 |
| 单物体 → 干净可用的 3D 资产 | Hunyuan3D 2.5/3.x、TRELLIS | 网格更干净、纹理带 PBR 材质,能直接进引擎 |
| 要快(几秒出货) | TRELLIS-2、TripoSR | 两段式 + 体素 + 细化,SAM 3D 慢 |
| 单图 → 高斯泼溅 | TripoSplat、TRELLIS | SAM 3D 也能出 3DGS,但 TripoSplat 更专更快、许可证更松 |
| 要商用、要许可证干净 | TRELLIS(MIT)、Hunyuan3D、Tripo | SAM License 不是标准开源协议,商用有约束 |
| 想避开 mask、用文字指定物体 | Ref-SAM3D | SAM 3D 本体依赖空间提示,这条扩展才绕开 |
如果嫌表格绕,一条决策路径给到底:
你要做什么?
├─ 一张乱照片,要把整个场景(含人和物)重建出来
│ └→ SAM 3D,别处没有
├─ 一张干净图,要一个能拖进引擎的 3D 资产
│ └→ Hunyuan3D(好看/风格化强)或 TRELLIS(灵活/MIT)
├─ 要塞进自己的 Three.js / WebGPU 管线,出高斯泼溅
│ └→ TripoSplat 或 TRELLIS
└─ 要商用、怕许可证
└→ 避开 SAM License,走 TRELLIS(MIT) / Hunyuan3D / Tripo
05. 所以它是终点吗
不是。
单图变 3D 是个还在快速滚动的方向,SAM 3D 是当前「真实场景重建」这一格的最强,但它连自己那一格都没封死——
Ref-SAM3D 在补它的 mask 短板,一堆新工作(Direct3D-S2、Hi3DGen、Step1X-3D 这些)在标准基准上你追我赶。
把它当终点,是被「Meta 出品 + 又开源」的光环晃了眼。
务实的看法是:
SAM 3D 真正推进的,是「从一张普通照片重建可交互完整场景」这个能力本身。
这在混合现实、虚拟制片、机器人空间理解这些场景里,是别的模型暂时接不住的活。
至于把一张图变成一个好用模型的日常需求,Hunyuan3D 和 TRELLIS 每天都在替人干,还不用担心许可证。

所以回到开头那个「又开源」。
它是条快一年的旧闻,被重新包装成新闻推给你;而它出自 Meta 这件事,也不代表它在每道题上都替你选好了答案。
刷到一个模型时先别急着记住是谁家开源的,先问它能干你这件活吗——
这一步,那篇公众号没替你做,本文替你做了