GOOD猫柠

通义万相

今天测评了通义万相,通义万相作为一个视频和图片生成平台,最早是由openai的sora提出,主要是通过采用文本提示词生成图片或者视频。视频生成技术相比于文字大模型往往需要更多的技术积累,因为多模态大模型需要通过视频和图片学习到物理世界的规律和动作连贯性,过往多模态大模型生成的视频和图片虽然可以识别出文字所指代的物体但是在光照,阴影和物体动态方面存在反常的情况。但是相比于文字大模型的需求,多模态大模型具有更大的应用空间,对传统的广告,短视频甚至是影视行业都会产生更大的颠覆,因为每个人都对视频和图像的自我创作都有比较强烈的个人追求,但是过往影视行业和视频拍摄往往聚焦于专业的人员才可以工作,但是多模态大模型的发展会给予每个人都可以通过多模态大模型进行创作。 回到通义万相上,我从多个题材和素材来进行测试,同时从光照和物理规律和本身想表达的意思是否符合上来评测通义万相的视频生成的质量,总的来说,通义万相比较好的针对不同风格和题材生成对应不同的视频和在基本的物理条件基本满意。但是个人认为其在动漫效果上比一般记录片的效果要好,可能是由于真实的纪录片需要更多的物理条件的约束很容易让人产生违和感,最终希望在token上更加偏移。
2026-03-09
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发