通义万相上新，登顶！

2025-01-12 33442

刚刚，阿里云通义万相迎来重磅升级，推出万相2.1视频生成模型，在大幅度复杂运动、物理规律遵循、艺术表现等方面全面提升，并在权威评测榜单VBench中登上榜首。

VBench是视频生成领域的权威评测集，它一共有16个评分维度，从整体一致性、动作流畅度、画面稳定性等方面对模型进行全方位评估。VBench榜单显示，通义万相在运动幅度、多对象生成、空间关系等关键能力上拿下最高分，并以总分84.7%的成绩斩获第一。

精准理解和模拟物理世界是当下视频生成模型的核心难题，现有模型生成的视频在大幅运动、物理复杂场景表现较差，容易生成肢体扭曲、违背物理定律的视频。针对这一难题，通义万相团队采用自研高效的VAE和DiT架构，有效增强时空上下文关系建模能力。

在全新架构下，通义万相在大幅度的肢体运动和肢体旋转场景的视频生成上表现更稳定，即便是花样滑冰、游泳、跳水等运动视频也能保持肢体协调并符合正常运动轨迹。通义万相在文字视频生成上实现了突破，成为首个支持中文文字生成能力、且同时支持中英文文字特效生成的视频生成模型，可满足广告设计、短视频等领域的创作需求。

TAG：视频通义模型物理肢体能力复杂方面