2026年8月底,AI视频赛道出了件有意思的事。
当外界以为OpenAI对Sora偃旗息鼓时,Google反手掏出了Gemini Omni 1.1 Flash。
老实讲,这仗打到这个份上,拼早就不是谁生成的画面更炫了。
画质只是及格线,可控性才是真战场
Google DeepMind这次没搞虚的,直接面向开发者开放了API。
核心逻辑就一个:让AI视频从“抽卡游戏”变成“精密仪器”。
以前AI生成视频像开盲盒,现在Gemini 1.1 Flash给你戴上了“紧箍咒”。
场景延伸能力大幅进化。
过去的模型只能记住最后1秒的画面,现在能分析前10秒的上下文。
每次延伸10秒,最长能无缝拼出40秒的连贯故事。视觉一致性和叙事逻辑终于不用靠运气了。
首尾帧指定,指哪打哪。
你可以直接扔给AI一张开头图和一张结尾图,让它自己填补中间的运镜和动作。
复杂的镜头环绕、无缝循环,甚至一镜到底,现在都能通过关键帧精准控制。
个人觉得,这招对影视前期和广告分镜来说,简直是救命稻草。
降本增效的算盘,与360p的骨感现实
为了让大家多用,Google在成本上也动了刀子。
360p草图预览,生成速度提升60%,成本直接砍到标准720p的三分之一。
快速迭代、画分镜,用这个低分辨率版本确实香。
同时,4K超高清输出和3秒视频参考也一并上线。
你可以上传一段舞蹈视频,让AI里的狗熊、章鱼和狗狗分别模仿古典舞、嘻哈和霹雳舞,还能保持角色特征不崩。
听起来很完美对吧?
但评论区有开发者直接泼了冷水。
有人吐槽,360p预览确实快,可一旦升到标准分辨率,画面结果就变了。
非确定性让预览失去了意义。
快是快了,但结果不可控,这就有点尴尬了。
Sora退场背后,谁在偷笑?
有意思的是,行业里正在发生微妙的反转。
有评论一针见血:OpenAI放弃了Sora,Google却还在死磕视频生成。
大概率是因为Google把视频生成看作构建“世界模型”的关键拼图。
大厂在卷4K,卷长视频。
但真正的痛点,往往在暗处。
一位开发者坦言,他根本没等Gemini的更新,而是 happily using Minimax H3。
他在自己12G显存的4070RTX显卡上,用本地小模型搞定了唇形同步。
因为Gemini 1.1 Flash做不到把生成视频和现有音频精准对齐。
这就很魔幻了。
大厂在云端卷画质和长度,开发者却在本地用小模型解决最基础的音画同步。
Demo很丰满,落地很骨感?
抛开技术细节,我们得面对一个灵魂拷问。
这玩意到底能干嘛?
有用户直言,除了做广告和媒体前期制作,这东西到底怎么enrich life?
如果只是为了生成几条流水线上的短视频,或者制造一些视觉奇观,那它和那些让人麻木的AI slop(AI垃圾内容)有什么区别?
原始生成质量早就成了各家标配。
当所有人都能生成逼真的4K视频时,护城河到底在哪?
是更精准的控制,还是更贴合实际工作流的整合?
Google这次给出了“控制”的答案,但开发者们显然还在等待那个真正改变工作方式的“杀手级应用”。
AI视频的下半场,拼的早就不是谁的Demo更惊艳,而是谁能真正融入普通人的创作流。
只是不知道,当AI把视频制作的门槛踩到泥里时,我们还需要那么多视频吗?
【锐评】:大厂死磕云端可控性,开发者却在本地跑小模型搞同步,这届AI视频工具,到底是谁在给谁打工?
参考链接:
https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/