facebookresearch

ImageBind

facebookresearch

ImageBind One Embedding Space to Bind Them All

AI 简介

ImageBind 是一个跨模态联合嵌入模型,将图像、文本、音频、深度、热成像和IMU六种模态统一映射到同一语义向量空间。其核心特点是无需模态配对标注即可通过自监督学习实现零样本跨模态对齐,支持跨模态检索、模态算术组合(如'图像+文本−音频')、零样本分类与跨模态检测等任务。技术上基于Transformer架构,采用多模态对比学习目标,在多个下游任务中展现强泛化能力。适用于多传感器融合分析、无障碍交互、智能内容理解等需协同处理异构感知数据的场景。

Python
Other
9.1k
Stars
844
Forks
96
Watchers
79
Issues

Star 增长

今日0
近 7 天0
近 30 天+9
综合评分65.68
默认分支main