谷歌深夜炸场!一个模型搞定视频生成+编辑,以后拍电影靠“聊天”就行
本帖最后由 短视频软推广 于 2026-5-20 13:23 编辑北京时间5月20日凌晨,谷歌I/O大会扔出一颗重磅炸弹——Gemini Omni正式发布。
别被名字吓到,简单来说:这是一个能“理解世界,还能创造世界”的AI。
以前的AI:分工明确,各干各的
过去的AI视频生成,通常是两套系统:一个负责“看懂”你说什么,另一个负责“画出”你想要的。好比剧本和拍摄是两个人,配合起来常有脱节。
现在的Omni:一个模型全包了
谷歌称它为“原生Omni多模态生成模型”——能看懂文字、听懂声音、识别图片和视频,还能直接生成完整的视频+音频。
DeepMind CEO哈萨比斯给出了一个简单粗暴的定义:“Create anything from any input.(从任何输入,创造任何内容。)”
最炸裂的功能:像聊天一样改视频
你拍了一段街头漫步的视频,然后对AI说:
“把天空改成暴雨。”——画面里的蓝天瞬间变暴雨。
“主角换成黑色风衣。”——衣服立马变了。
“增加夕阳光线,镜头向前推进。”——光影移动,镜头推近,整个片段节奏都变了。
不需要重新生成,不用等半天,就像跟剪辑师聊天一样,一句话,改一个画面。
谷歌管这叫“对话式编辑”。
从“生成片段”到“构建世界”
以前的AI视频,生成5-10秒还行,一旦想拍长一点,人脸就开始漂移、物体开始穿模、逻辑完全断裂。
Gemini Omni想做的是另一件事:持续世界建模。
它记住角色长什么样、衣服什么颜色、光线从哪来、重力怎么作用。你改一个地方,其他部分会自动适配,保持逻辑一致。
换句话说,它不是在“拍一段视频”,而是在“运行一个世界”。
行业迎来拐点
业内人士认为,AI视频正在从“镜头生成时代”进入“世界模型时代”。
以后你刷到的视频,可能不再是现实世界的拍摄记录,而是某个人用文字亲手构建出的世界切片。
Gemini Omni已经来了。拍电影靠“聊天”的那一天,还远吗?
来源:
IT之家:《谷歌 Gemini Omni 模型发布:可从任意输入生成任意输出,一句话让 AI 修改视频》
每日经济新闻:《一文看懂2026年谷歌I/O大会》
经济观察网:《Token消耗一年暴增7倍!谷歌步入Agent驱动时代》
微博:@微博AI
页:
[1]