短视频软推广 发表于 2026-5-20 13:22:15

谷歌深夜炸场!一个模型搞定视频生成+编辑,以后拍电影靠“聊天”就行

本帖最后由 短视频软推广 于 2026-5-20 13:23 编辑


  北京时间5月20日凌晨,谷歌I/O大会扔出一颗重磅炸弹——Gemini Omni正式发布。
  别被名字吓到,简单来说:这是一个能“理解世界,还能创造世界”的AI。

  以前的AI:分工明确,各干各的
  过去的AI视频生成,通常是两套系统:一个负责“看懂”你说什么,另一个负责“画出”你想要的。好比剧本和拍摄是两个人,配合起来常有脱节。

  现在的Omni:一个模型全包了
  谷歌称它为“原生Omni多模态生成模型”——能看懂文字、听懂声音、识别图片和视频,还能直接生成完整的视频+音频。
  DeepMind CEO哈萨比斯给出了一个简单粗暴的定义:“Create anything from any input.(从任何输入,创造任何内容。)”



  最炸裂的功能:像聊天一样改视频
  你拍了一段街头漫步的视频,然后对AI说:
  “把天空改成暴雨。”——画面里的蓝天瞬间变暴雨。
  “主角换成黑色风衣。”——衣服立马变了。
  “增加夕阳光线,镜头向前推进。”——光影移动,镜头推近,整个片段节奏都变了。
  不需要重新生成,不用等半天,就像跟剪辑师聊天一样,一句话,改一个画面。
  谷歌管这叫“对话式编辑”。

  从“生成片段”到“构建世界”
  以前的AI视频,生成5-10秒还行,一旦想拍长一点,人脸就开始漂移、物体开始穿模、逻辑完全断裂。
  Gemini Omni想做的是另一件事:持续世界建模。
  它记住角色长什么样、衣服什么颜色、光线从哪来、重力怎么作用。你改一个地方,其他部分会自动适配,保持逻辑一致。
  换句话说,它不是在“拍一段视频”,而是在“运行一个世界”。

  行业迎来拐点
  业内人士认为,AI视频正在从“镜头生成时代”进入“世界模型时代”。
  以后你刷到的视频,可能不再是现实世界的拍摄记录,而是某个人用文字亲手构建出的世界切片。
  Gemini Omni已经来了。拍电影靠“聊天”的那一天,还远吗?

  来源:
  IT之家:《谷歌 Gemini Omni 模型发布:可从任意输入生成任意输出,一句话让 AI 修改视频》
  每日经济新闻:《一文看懂2026年谷歌I/O大会》
  经济观察网:《Token消耗一年暴增7倍!谷歌步入Agent驱动时代》
      微博:@微博AI




页: [1]
查看完整版本: 谷歌深夜炸场!一个模型搞定视频生成+编辑,以后拍电影靠“聊天”就行