TigeronAI

视频生成最强大模型花落谁家

今天继续测试国产最强多模态大模型豆包和MiniMax二进一,测试内容是严格指令下的视频生成,并且提示词要求展现连续变化的画面和细节,即生成一段乒乓球连续对拉的视频,这对视频生成模型理解人类乒乓球运动逻辑提出了非常高的要求。 因为乒乓球的运动在画面中的呈现非常小,模型很难单独处理细节,并且两个运动员的动作幅度大且快,我认为这次的测试挑战相当大。 结果不出所料,背负众望的带来全民创作时代的豆包seedance2.0模型因为服务器爆满甚至无法输出结果,可能算力都调去给API了,我又用相同的提示词要求生成图片,效果也不尽如人意,图片中的运动员站位错乱,有的甚至手里没有拍,看来连基本的运动规则逻辑都没搞清楚,也可能是web端确实是阉割版,想完整体验还得使用付费API吧。 然后是成功生成的MiniMax,效果也很难评,乒乓球在画面中飘来飘去,跟两个运动员的挥拍毫无关联性,也是缺乏底层逻辑的理解。 总的来说,目前连续变动画面的视频生成对于目前大模型来说确实还是一个挑战,网页端的视频生成还处于可望不可用的存在。
2026-04-09
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发