传统 3D 资产管线的复杂度对个人开发者几乎是劝退级的:场景建模、UV 展开、烘焙贴图、材质烘焙、灯光校准、音效匹配——一套流程走下来,一个像样的场景 blockout 至少要个把星期。即使雇外包,中等复杂度场景报价也在 3000-8000 块之间。
有人尝试用 AI 生成图像,效果确实惊艳。但图像到 3D 这一步,依然是堵在创意路上的一堵墙。Midjourney 能画出一张完美的中世纪酒馆,但画出来的东西"站不起来"——你没法在 Unity 里走进去,没法旋转视角,没法在那把椅子旁边放个可拾取的道具。
直到在 GitHub 上刷到 image-blaster,它声称可以在 5 分钟内,把一张照片变成一个可漫游的 3D 环境。

项目简介
image-blaster 是由 World Labs 设计团队成员 Neilson Koerner-Safrata 开发的开源项目。它不是一个独立的桌面软件或 Web 应用,而是一套 Claude Code skills——在终端里跑 Claude,通过自然语言指令来驱动整个流程。
给它一张图,它还你一整套可以直接进游戏引擎的 3D 资产包。默认生成三类输出:
- 静态环境:用 World Labs 的 Marble 模型生成的 3D 高斯泼溅场景(.spz 格式),可以在里面自由漫游
- 动态物体模型:用腾讯 Hunyuan 3D 提取场景中所有"人类能搬动的物体",生成带 PBR 材质的可编辑 3D 模型(.glb / .obj)
- 环境音效和物理音效:用 ElevenLabs SFX 模型生成的环境循环音效加每个物体的交互音效(.mp3)
它有一套完整的工作流编排,每一步都会停下来让你确认,不会一股脑瞎生成。
核心亮点
真正的"多模型编排":每个环节都交给最专业的模型——3D 环境重建用 World Labs Marble 1.1,物体 3D 建模用腾讯 Hunyuan 3D,背景擦除用 Nano Banana Pro 或 GPT-Image-2,音效生成用 ElevenLabs SFX。这种"术业有专攻"的编排思路,比一个"勉强能做但什么都做不好"的大一统模型靠谱得多。
结构化输出:环境是 .spz 格式的高斯泼溅,可以直接在 Unity/Unreal/Three.js 里加载和漫游;物体是标准的 .glb / .obj 格式,带 PBR 材质,可以在 Blender 里继续雕刻;音效是 .mp3 格式,环境循环音加物体交互音,命名规范,可以直接挂在游戏逻辑上。
8 个 Skill 串起的流水线:从创建项目目录、AI 视觉分析、背景擦除、环境重建、物体建模到音效生成,每个环节都让人类始终在回路里。每生成完一个环节,Claude 会停下来问"要不要继续?",可以调整参数、换模型、甚至只跑其中某一步。
快速上手
环境要求:Node.js ≥ 18、pnpm 或 npm、Claude Code 最新版。
git clone https://github.com/neilsonnn/image-blaster
cd image-blaster
# 安装 Claude Code(如果还没装)
curl -fsSL https://claude.ai/install.sh | bash
# 准备三个 API Key:World Labs、FAL、ElevenLabs
# 把图片放进 input/ 目录,执行 claude
# 然后说:blast it and confirm each step with me
写在最后
image-blaster 就是一个 World Labs 设计师在业余时间写的 TypeScript 代码,往 GitHub 一扔就炸了。这说明一件事:AI 3D 创作的土壤已经够了,缺的就是把各个模型串起来的那根线。
过去两年里,AI 图像生成已经卷到了天花板。但图像之后的那一步,一直没人好好解决。image-blaster 把那些"专业模型的工人"协调起来,按部就班地干活。这种思路,可能才是下一阶段 AI 创作工具的主流范式——不是一个超级模型包打天下,而是多个专业模型加一个靠谱的编排层。