OpenMOSS-Team/moss-video-preview-realtime-sft
Video-Text-to-Text ⢠11B ⢠Updated ⢠164 ⢠25
LLM
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation