facebookresearch

tuna-2

facebookresearch

Official implementation of Tuna-2: Pixel Embeddings Beat Vision Encoders for Unified Understanding and Generation

AI 简介

Tuna-2 是一个面向统一多模态理解与生成的轻量化视觉语言模型,摒弃传统视觉编码器(如VAE或表示编码器),直接对图像块进行像素级嵌入,实现端到端的文本到图像生成与图像编辑。其核心特点是架构极简、无需中间视觉表征,同时在跨模态理解(如VQA、captioning)和生成任务(t2i、图像编辑)上超越前代Tuna及Tuna-R。适用于资源受限环境下的多模态研究、快速原型验证及需要高一致性图文联合建模的学术与工业探索场景。

Python
Apache License 2.0
732
Stars
29
Forks
14
Watchers
8
Issues

Star 增长

今日0
近 7 天0
近 30 天+8
综合评分49.23
默认分支main