刚刚我体验了最新上线的 MiniMax H3 模型,这次能够把图片、文字、视频和音频都能喂进去跑。
但是整体效果真的惊艳到我了。
以往我们如果想做这种多参考视频,Seedance 基本就绕不开,现在 MiniMax H3 也能拿着几种素材一起干活,生成完还能接着改,最高支持 15 秒原生 2K。
下面这个视频就是用刚刚上面几个图片、视频进行参考的内容,最终生成的融合了音乐和不同转场风格的视频。
刚好也看到了来自 MiniMax 官方关于 H3 这个模型的效果展示,整体感受就是这个模型太懂审美了。
包括自己深度体验后跑完,我就感觉 MiniMax H3 已经踩进 seedance 最舒服的那块地盘。
这么看来,偷家这件事,算是发生了。
01
多模态开始看材料办事
我现在看到「支持多模态」几个字,会先看成片,不数上传按钮。
这次 MiniMax H3 我觉得最大的亮点就是,我可以输入音频、视频、图片等素材直接合成视频,但是考验素材传进去以后,人物、画风、运镜和声音还能不能在成片里,这才有用。
这次体验完发现 MiniMax H3 对首图气质的保持更稳,包括像这种纯文本+空间细节的动画生成,让我开场就有了期待感。
我愿意把这种用法叫「素材级提示词」。
图片讲构图,视频讲动作,音频给节奏,文字把要求说清楚,对我来说写 Prompt 终于不用兼任分镜师、摄影师和算命先生,这种简单提示词就能生成的内容,对我可太友好了。
02
视频终于能读也能改
我拿文字生成的视频给 MiniMax H3 上强度,对于这种真实+二次元的融合效果看看如何。
用了一个很复杂的热门视频创作提示词,来生成了一套视频,而这个生成的效果简直太贴近生活也太逼真了,可以看到这个炒菜的肉都还有滋滋冒油。
不过到了这里,我又想到了一件非常有意思的事情,这里面生成的 2D 贴图,是不是也能够直接使用我自己的头像形象来做一次替换呢?
于是顺延这个想法,把原来 8s 的视频+我自己的头像添加到了这个 MiniMax H3 的任务里面,同时还把原来的 8s 顺延到了 15s 然后增加了后面的剧情故事。
视频出来的时候,我感觉这也太有意思了,而且是一轮出的视频!!
这个视频要是放在过去,很多视频模型都不一定能 Cover 住,今天 MiniMax H3 的表现让我对它刮目相看了。
既然视频编辑能力这么强,那么我们再来对比下 seedance 里面经典的能力,也就是对于视频中的部分角色信息进行删除的操作。
我又继续接着我拿现有的 seedance 的视频编辑案例素材拿来做 MiniMax H3 的修改,比如我们只指定人物元素的变化,音频的变化,镜头运镜和其他动作都保持不变。
这个是原视频。
这个是替换人物和更换配音语种之后由 MiniMax H3 生成的视频。
原来的动作、构图和光影都留着,替换物能接住场景里的细节,看来现在我可以留住已经满意的部分,只动那个让我不满意的地方。
对比 seedance 生成的视频效果,你可以从这个角色的音色上有很强的体感,MiniMax H3 一模一样的保留了原视频的音色并且配音成了英文版本,而 seedance 选择了一种新的音色。
这真的令我很是震惊这里面的细节工程。
03
声音少做一次返工
声音这块,我专门戴上耳机又听了一遍。
过去用视频模型,我经常把原生声音当临时轨道,画面能用,台词的音色却会飘。
这次在 MiniMax H3 中直接结合歌曲文件,我也试了一段。
以前最常见的情况是旋律在往前走,字幕和口型在后面追,追着追着几个关系就散了。
但是这次体验到 MiniMax H3 这一版的歌词清晰度和音色保持都更稳,而且在人物口型中,已经不仅仅是说话那种感觉了,是对于吟唱类的表达口型都能对上。
这个体验真的震撼到我了。
04
电商批量生产
同样的回到我们经常关注的电商业务会更实际。
我把分镜图和产品图一起丢进去先生成一张图,接下来就通过简单的一段提示词,根本不去管那些复杂的分镜图管镜头顺序的专业描述,直接让 MiniMax H3 去自由的补运动、光影和转场。
这种投放视频对于跨境电商的业务来说,已经完全够用了,放在产品介绍详情页,对于服饰细节和针对目标人群的运营,MiniMax H3 就只需要参考一张图,然后输入这么简单的一句话,就可以自动生成 2K 高清的展示视频,对于产品的特写可以精准拿捏。
05
多模态视频进入双雄局
尽管我还不准备替 MiniMax H3 宣布全面胜利。
但是在这轮测试里,复杂字幕、多素材参考和精准编辑都在 MiniMax H3 里面跑通了,复杂高速运动、长时间一致性和连续多轮修改,我还得继续测。
我还重点盯了文字、UI、镜头节奏和参考素材保持,真的也是给我了很大的惊喜,在我输入的这个图如此之糊的情况下,MiniMax H3 对于图片中的文本部分进行了修复,然后给我一个更清晰的视频。
MiniMax H3 在这几项上已经没有明显的功能缺口,这个图片中的文字细节还原跟我原图呈现的一模一样,而且对于这些文本效果和图片中的人物角色保持一致。
seedance 的成熟度还在,尤其碰到更复杂的动作和更长的镜头,我不会只凭这一轮就给它排座次,同 Prompt 对比放在这里,素材、时长和分辨率全部一样。
这次 MiniMax H3 已经沿着复杂文字、剪辑包装、声音和商业场景都能稳稳接住。
整体体验下来,我自己也发现 MiniMax H3 在各种影视、游戏画面上我觉得效果都很不错,我感觉做科幻大片我又有一个靠谱的视频模型可以选择了。
看来视频模型的市场竞争局面也要跟着换了,以前大家问模型能不能把几种素材一起做成片,接下来要问一次成功率有多高,改一处要返工几轮,生成一秒到底多少钱。
价格这块,我看了下 MiniMax 年度基础会员的折扣价格计算,MiniMax H3 仅需 0.53 元/秒,性价比极高,相比之前用 Seedance 即便有折扣补贴的要 1 元/秒 起的价格,MiniMax H3 同款效果能够达到更低的价格,真的良心之选了。
并且在 MiniMax Hub 上可以享受更多优惠,直接把视频生成这件事做到了价格平民级的生产力。
对用户来说,这事挺简单,以后做多模态类视频,不用只选一个模型了。
看来 seedance 的独家营业,到 MiniMax H3 这里也就结束了。
© THE END