开发者用ComfyUI + RealVisXL生成参考图,再通过Hunyuan3D-2(FP16约4.9GB)在苹果MPS上直接转GLB,全程离线免费,未使用任何云API。
我是 StudioMidori。目前正在用 Unreal Engine 5 开发一款合作游戏(暂定名 "Engawa Summer"),目标是重现 90 年代暑假游戏的感觉。
在这个系列 "Rebuilding Summer" 中,我计划记录开发过程中的技术细节——以详尽但有时相当坦诚的方式分享成功与失败。
第一期的主题是独立开发者永恒的难题:"如何获取 3D 资产?" 先说结论:我仅用 Mac 和本地 AI 生成了超过 100 个资产,零额外成本。下面分享配置方案以及我踩过的坑。

配置:图像生成到"图像→3D"转换的两阶段流水线
我使用的工具全部是本地运行的免费工具。
虽然 Hunyuan3D 看起来对 CUDA(NVIDIA)支持很重,但它实际上能在 Apple Silicon 的 MPS 上运行!说实话,这是我最担心的部分。之前我有过其他 3D 模型因为 MPS 上未实现的算子而崩溃的经历……但这次,它成功运行了。做得好!
以下是我的实测结果:
生成时间:每个物体约 6–8 分钟(octree_resolution 256–320)。
GPU 利用率:生成期间设备利用率 100%(用 ioreg 检查。证明它没有摸鱼)。
输出网格:以单个自动贩卖机为例,约 709,000 顶点 / 350k 三角面(稍后会解释为什么这是个问题)。
质量 80% 取决于"输入图像创建"
亲身体验后,我深感 3D 输出质量几乎完全由输入图像决定。经过大量试错,我总结出了以下配方。
方形物体:从正视图拍摄 / 圆柱或球形物体:从 45 度角拍摄(以帮助模型正确估算形状)。
在提示词中加入 "levitating in an empty white void, nothing underneath"。→ 如果不加入,物体下方的地面和阴影会连同地面一起被物化,导致像长出翅膀的自动贩卖机这样的东西凭空出现。
严格使用负面提示词排除 podium、plinth、table、shadow(如果交给 AI 自行处理,产品照片会自动把物品放在展示台上)。
不要生成任何文字(no text + 负面提示词排除 chinese characters, garbled text)。
"文字"部分是最大的难题。当我想在招牌上放日文字符时,图像 AI 自信地伪造出了看起来像"汉字"的东西。所以我早早放弃了,决定把所有招牌生成纯白表面,然后在引擎里自己贴上正确的字体。……后来我才意识到这个决定"从版权角度来看是完全正确的",但那是另一回事了。
▼ 输入图像(左)vs 生成 3D 的三视图轮廓(右)


我史诗级的失败(这部分最有参考价值)
如果技术文章只展示完美的成功故事,那就不诚实了,所以我要分享一些可复现的失败案例。
失败①:薄或小的物体会被"压成饼"
以象征平成时代的折叠手机为例。结果它变成了一个薄薄的脆饼,深度信息已经消失。无论我怎么调整提示词,都无法获得任何厚度。

原因:单视角图像转 3D 模型在处理薄或小的物体时容易崩溃,因为它必须猜测看不到的那一面。解决方案:我决定接受这个现实——对于手机、寻呼机或磁带这些本身就很薄的东西,根本不应该依赖 AI。我发现最好还是在引擎里用简单的立方体图元来创建它们。这是一种"在合适的地方使用合适工具"的问题。
失败②:雕像"自动繁殖"
当我只请求一座地藏菩萨雕像时,结果出现了两座并排的雕像,而且它们以某种方式融合成了一个双体怪物。解决方案:我在提示词中明确加入 one single ... , only one figure,并在负面提示词中加入 multiple, two。这对守护犬和稻荷狐也有效;就这么简单的短语让它们恢复成了单一单位。如果交给 AI 处理,它往往会过于"贴心"地添加额外的东西,所以明确说明"一个就够了"是关键。
失败③:线缆/天线"散落空中"
当我生成一个游戏手柄时,线缆断裂散落,像意面一样漂浮在空中。解决方案:从提示词中排除细长的附件(如线缆、天线或绳子)。只生成主体,线缆稍后添加。
成品率约 85%。但前方还有大坑。
当我把精力集中在固体物体(房屋、家电、雕像、汽车、建筑)上时,成品率一般在 85% 左右。对于"有轮子"的物品,如三轮车或拖拉机,轮子似乎是很强的结构提示,意外地得到了相当干净的形状。

甚至有机物(动物)的形状构建也比预期更好。

然而,在检查了 66 个生成的物品后,一个事实变得清晰了。
生成的 GLB 缺少 UV 坐标、法线和材质。它们都只是扁平的灰色团块。
这意味着我无法做"应用单一纹理"这种常识性操作。这是下一座要翻越的高山。
此时,我想当然地认为可以在引擎侧统一上色。直截了当说结论:这个假设后来被推翻了。到底哪里出了问题、怎么出的,我会在下一篇文章中详细讲述。
总结与下期预告
我们可以用 Mac + 本地 AI 免费批量生产游戏 3D 资产(简单物体估计成品率 85%)。
质量 80% 取决于输入图像。提示词方面,我会让它漂浮在空旷空间,并要求"一个一个"地生成物体,避免文字生成。
输出是没有任何 UV 或材质的灰色网格。下一个挑战是搞清楚如何给这些灰色团块上色。
下一次,我计划分享把这一百个批量资产导入 Unreal Engine 并让它们真正可用的全部内容——包括任何磕绊的 Python 脚本。标题将是"给灰色团块注入'色彩'(不是生命)的那一集"。
……虽然我很想说这些,但需要提前提醒你。在下一篇文章中,我将彻底重建我的上色策略。
我每天在 X (@StudioMidori) 更新进度。如果你不介意的话,如果你能关注并见证夏天被一个像素一个像素地重建,我会非常感激。