2026年8月底,AI视频赛道出了件有意思的事。

当外界以为OpenAI对Sora偃旗息鼓时,Google反手掏出了Gemini Omni 1.1 Flash。

老实讲,这仗打到这个份上,拼早就不是谁生成的画面更炫了。

Gemini Omni 1.1 Flash Available via APIs

画质只是及格线,可控性才是真战场

Google DeepMind这次没搞虚的,直接面向开发者开放了API。

核心逻辑就一个:让AI视频从“抽卡游戏”变成“精密仪器”。

以前AI生成视频像开盲盒,现在Gemini 1.1 Flash给你戴上了“紧箍咒”。

场景延伸能力大幅进化。

过去的模型只能记住最后1秒的画面,现在能分析前10秒的上下文。

每次延伸10秒,最长能无缝拼出40秒的连贯故事。视觉一致性和叙事逻辑终于不用靠运气了。

首尾帧指定,指哪打哪。

你可以直接扔给AI一张开头图和一张结尾图,让它自己填补中间的运镜和动作。

复杂的镜头环绕、无缝循环,甚至一镜到底,现在都能通过关键帧精准控制。

个人觉得,这招对影视前期和广告分镜来说,简直是救命稻草。

降本增效的算盘,与360p的骨感现实

为了让大家多用,Google在成本上也动了刀子。

360p草图预览,生成速度提升60%,成本直接砍到标准720p的三分之一。

快速迭代、画分镜,用这个低分辨率版本确实香。

同时,4K超高清输出3秒视频参考也一并上线。

你可以上传一段舞蹈视频,让AI里的狗熊、章鱼和狗狗分别模仿古典舞、嘻哈和霹雳舞,还能保持角色特征不崩。

听起来很完美对吧?

但评论区有开发者直接泼了冷水。

有人吐槽,360p预览确实快,可一旦升到标准分辨率,画面结果就变了。

非确定性让预览失去了意义。

快是快了,但结果不可控,这就有点尴尬了。

Sora退场背后,谁在偷笑?

有意思的是,行业里正在发生微妙的反转。

有评论一针见血:OpenAI放弃了Sora,Google却还在死磕视频生成。

AI配图

大概率是因为Google把视频生成看作构建“世界模型”的关键拼图。

大厂在卷4K,卷长视频。

但真正的痛点,往往在暗处。

一位开发者坦言,他根本没等Gemini的更新,而是 happily using Minimax H3。

他在自己12G显存的4070RTX显卡上,用本地小模型搞定了唇形同步。

因为Gemini 1.1 Flash做不到把生成视频和现有音频精准对齐。

这就很魔幻了。

大厂在云端卷画质和长度,开发者却在本地用小模型解决最基础的音画同步。

Demo很丰满,落地很骨感?

抛开技术细节,我们得面对一个灵魂拷问。

这玩意到底能干嘛?

有用户直言,除了做广告和媒体前期制作,这东西到底怎么enrich life?

如果只是为了生成几条流水线上的短视频,或者制造一些视觉奇观,那它和那些让人麻木的AI slop(AI垃圾内容)有什么区别?

原始生成质量早就成了各家标配。

当所有人都能生成逼真的4K视频时,护城河到底在哪?

是更精准的控制,还是更贴合实际工作流的整合?

Google这次给出了“控制”的答案,但开发者们显然还在等待那个真正改变工作方式的“杀手级应用”。

AI视频的下半场,拼的早就不是谁的Demo更惊艳,而是谁能真正融入普通人的创作流。

只是不知道,当AI把视频制作的门槛踩到泥里时,我们还需要那么多视频吗?

【锐评】:大厂死磕云端可控性,开发者却在本地跑小模型搞同步,这届AI视频工具,到底是谁在给谁打工?

参考链接:
https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/