Modly 开源解读:本地 GPU 图生 3D,节点式工作流与扩展系统

Modly 是一个把图像转成 3D 网格的开源桌面应用,Windows、Linux 和 Apple Silicon macOS 三个平台都有安装包。它的差异点在运行位置:推理全部在本地 GPU 完成,输入图片不上传,生成次数不受额度限制。仓库 2026 年 3 月创建,五个多月积累近 6000 star,当前版本 v0.4.1 Beta。

Modly 应用界面

应用形态:Electron 壳加 Python 后端

Modly 的技术栈是两层结构。界面层是 Electron 加 TypeScript,渲染进程负责工作流画布、模型管理和 3D 预览;计算层是一个独立的 Python FastAPI 服务,跑在虚拟环境里,负责加载模型和执行推理。从源码运行需要分别安装 npm 依赖和 Python 依赖,npm run dev 同时拉起两层。

界面顶部有一个实时 RAM 指示器,数据来自主进程。网格工作流在运行前会做连线校验,非法连接不删除当前网格视图,改为行内和 toast 警告。导入的外部网格可以在应用内做平滑(Smooth)和减面(Decimate),优化结果写回工作区。截图里生成的龙模型约 799 万三角面、624 万顶点,应用直接显示这两个统计值。

导出格式覆盖 GLB、OBJ、STL、PLY 四种,对应 Blender、Unity、Unreal 的常规导入流程,STL 则直接对接 3D 打印切片软件。

模型不内置,用扩展系统装进来

Modly 本体不带任何生成模型,模型通过扩展机制安装。每个扩展是一个独立的 GitHub 仓库,包含 manifest.json 和运行时入口文件。在应用的 Models 页面点击 Install from GitHub,粘贴扩展仓库地址即可。

官方目前维护五个扩展:

扩展模型上游来源
modly-hunyuan3d-mini-extensionHunyuan3D 2 Minitencent/Hunyuan3D-2
modly-hunyuan3d-mini-turbo-extensionHunyuan3D 2 Mini Turbotencent/Hunyuan3D-2
modly-hunyuan3d-mini-fast-extensionHunyuan3D 2 Mini Fasttencent/Hunyuan3D-2
modly-triposg-extensionTripoSGVAST AI
modly-trellis2-gguf-extensionTrellis2 GGUFAero-Ex/Trellis2-GGUF

扩展安装时在独立虚拟环境中部署,不污染系统 Python。安装脚本根据 Modly 传入的平台信息选择 PyTorch 版本:GPU 计算能力版本(gpu_sm)、CUDA 版本、操作系统和 CPU 架构。Linux ARM64 有专门的处理路径,走 ARM64 版 PyTorch wheel、CUDA 12.8 分支、带 sha256 校验的固定下载地址,抠图环节用 rembg 加 onnxruntime 的 CPU 组合替代 GPU 版。扩展装完出问题,应用内的 Repair 功能会重建虚拟环境。

这套设计意味着模型生态可以独立于应用本体迭代。 Hunyuan3D 系列来自腾讯,TripoSG 来自 VAST,Trellis2 GGUF 是社区量化团队 Aero-Ex 发布的 GGUF 量化版本,权重托管在 Hugging Face,三个家族覆盖了当前开源图生 3D 的主力选择。

工作流:节点式管线,参数全部可调

生成流程在 Workflows 页面用节点搭建。最基础的模板是 Image → Generate Mesh → Add to Scene 三节点链,节点之间必须连线。切到 Generate 页面选中工作流,点 Generate 3D Model 开始生成。

Trellis2 工作流

以 Trellis2 GGUF 扩展为例,Generate Mesh 节点的参数表如下:

参数含义默认值
pipeline质量档位:fast(512)、balanced(1024)、high(1024 级联)、ultra(1536 级联)balanced
quantizationGGUF 量化等级,Q4_K_M 到 Q8_0,越低显存占用越小、质量越低Q5_K_M
ss_steps稀疏结构扩散步数25
slat_steps形状潜表示扩散步数25
foreground_ratio主体在画面中的占比阈值(0-1)0.85
remesh_resolution双等值面重构网格分辨率256

Texture Mesh 节点负责烘焙贴图:纹理分辨率默认 1024,UV 图集打包分辨率 2048,纹理扩散步数 12,CFG 引导强度 3.0。两个节点共用同一张输入图,foreground_ratio 需要保持一致。输出是带纹理的 GLB。

量化等级是显存受限时的第一个调节旋钮。Q5_K_M 是质量与占用的平衡点,降到 Q4_K_M 可以在低显存卡上跑 high 档位,代价是几何细节损失。管线档位里的级联(cascade)指先生成低分辨率再逐级细化的策略,ultra 的 1536 级联对显存和时间的消耗都显著高于 balanced。

CLI:把 Modly 变成 agent 的 3D 生成后端

桌面应用运行时在本机 127.0.0.1:8765 暴露一个本地 API,配套一个只依赖标准库的命令行工具 tools/modly-cli/agent.py。设计目标是让脚本和 AI agent 不经过界面直接调用生成能力:

bash
python tools/modly-cli/agent.py health
python tools/modly-cli/agent.py model list
python tools/modly-cli/agent.py generate --image ./input.png --output ./export.glb

规范命令有五组:health、model、workflow-run、capability、process-run。友好的 generate 命令内部执行 POST /workflow-runs/from-image,轮询运行状态,按需导出最终网格,响应 JSON 里附带 workflow-run status 和 cancel 等恢复元数据。仓库还提供了面向 agent 的 SKILL.md 契约文档,描述完整的调用流程和输出格式。

兼容层和规范层做了明确切分:legacy 命令包装旧的 /generate/* 任务端点;dev serve-api 只启动 FastAPI 后端,不保证 Electron 桥接就绪;experimental 组的 comfy-image 和 generate-from-workflow 是对接外部 ComfyUI 的编排辅助,不属于规范契约。这个切分说明项目在认真设计自动化接口的稳定性,把会被外部脚本依赖的部分固定下来。

硬件边界与适用场景

官网对硬件的要求没有含糊:所有推理在本地 NVIDIA GPU 上执行,没有云端队列。应用同时提供 Apple Silicon macOS 安装包,README 标注 macOS 支持目标是 Apple Silicon only,界面使用原生窗口控件。实际跑 Hunyuan3D 或 Trellis2 这类扩散模型,显存容量决定可用的量化档位和质量档位,NVIDIA CUDA 仍是官方描述的主路径。

和 Meshy、Tripo 这类云服务相比,Modly 的取舍清晰:用本地图形卡的固定成本换无限次生成和数据不出本机。对游戏原型、3D 打印爱好者、独立开发者的小批量资产生成,这个模型成立;需要批量生产级质量的商用管线,云服务的高分辨率多视图重建仍然是更强的方案。

许可证是 MIT,附加一条署名要求:fork 后构建自己应用的开发者,必须在应用界面或文档中保留对原项目和作者的署名。

来源:lightningpixel/modlymodly3d.appmodly-trellis2-gguf-extensionmodly-hunyuan3d-mini-extension