跳到正文

#视频

今日 1 条
今天9月29日周二
9月25日周五
  1. Google Research64

    Google 发布长视频连贯生成多智能体框架研究

    Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。

    推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。

  2. Google DeepMind74

    Google DeepMind 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。

    推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。

9月24日周四
9月23日周三
9月21日周一
9月2日周三
8月28日周五
7月3日周五
  1. Google DeepMind56

    Google DeepMind 与 A24 达成影视技术研究合作,Google 亦完成对 A24 投资

    Google DeepMind 与电影公司 A24 宣布建立长期研发合作,同时 Google 完成了对 A24 的投资。双方将把技术创新直接锚定在创意制作流程中,由电影创作者参与未来工具与新工作流的塑造,并向研发团队提供一线反馈。合作初期聚焦于弥合前沿技术与娱乐制作的断层,具体技术成果与里程碑将随联合开发逐步推进。

7月1日周三
5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni,首款模型 Gemini Omni Flash 上线

    Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。

    推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。