Tagged: 多模态

392  0

初探Sora笔记

网络结构分析 visual patches 支持各种尺寸、各种分辨率、各种长度的视频作为输入:https://arxiv.org/abs/2307.06304 视频降维 最大输入1920×1...

200  0

[略读] MMT

Multi-modal Transformer for Video Retrieval 任务 标题到视频和视频到标题检索 贡献 联合编码不同的视频模态(视频帧、ASR、音频) 对时间信息进行编码和建模...

260  0

[略读]Emu2

Generative Multimodal Models are In-Context Learners Abstract 人类能够(仅需少量演示或简单指示即可)轻松解决多模态任务的能力,是当前多模态...

212  0

[精读]CLIP

Learning Transferable Visual Models From Natural Language Supervision https://github.com/OpenAI/CLIP...