PointDiT提出一种简化的像素空间扩散Transformer:以普通ViT为骨干,直接处理原始3D点图块,并使用预训练DINOv3的图像token进行条件控制。模型无需点图tokenizer,也不依赖潜空间扩散或复杂混合架构,且扩散骨干从零训练。据论文摘要,其在单图3D重建中超越复杂潜空间方法,并在透明物体等高歧义区域生成更清晰、更稳健的几何结构。
最近 24 小时暂无可用热度快照。