Duisterhof

modality-forcing

Duisterhof

暂无描述

AI 简介

Modality Forcing 是一个面向空间感知的扩散模型后训练方法,旨在实现文本到图像与深度图的联合生成。其核心是通过为图像和深度模态分配独立噪声调度,在单个DiT(Diffusion Transformer)模型中支持任意条件组合(如文本→图像、文本→深度、文本+图像→深度等),仅需稀疏真实深度数据即可训练。技术上基于FLUX.2架构,采用模态专属解码器与多流输入设计,具备良好可扩展性,且随模型规模与图像预训练数据量增加,深度预测精度同步提升。适用于需要高精度几何感知的生成任务,如3D内容创作、机器人视觉仿真、AR/VR场景生成及单目深度估计增强等场景。

Python
Apache License 2.0
105
Stars
0
Forks
1
Watchers
3
Issues

Star 增长

今日0
近 7 天0
近 30 天+15
综合评分38.5
默认分支main