arXivに掲載された論文「Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models」(arxiv.org/abs/2405.04233、2024年5月公開)によると、Viduは拡散モデルをベースとし、バックボーンにU-ViTアーキテクチャを採用しています。論文著者にはFan Bao、Chendong Xiang、Jun Zhuらが名を連ね、Jun Zhuは清華大学とShengShu(生数科技)の両方に所属しており、ShengShu Technologyの既存参照で言及されるFounder兼Chief Scientistと同一人物です。論文はU-ViTが「スケーラビリティと長尺動画への対応力を実現する」と説明し、Viduは単一生成で最大16秒の1080p動画を生成できるとしています。さらに著者らはViduの性能を「最も強力とされるテキスト動画生成モデルであるSoraと同等」と位置づけており、エッジガイド生成やフレーム予測、被写体駆動生成といった制御可能な動画生成タスクへの応用も示しています。