跳到正文

#视频

今日 2 条
今天9月29日周二
9月25日周五
  1. Google Research64

    Google 发布长视频连贯生成多智能体框架研究

    Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。

    推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。

  2. Google DeepMind74

    Google DeepMind 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。

    推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。

9月24日周四
  1. Ars Technica · AI36

    YouTube 承诺今年晚些时候推出自定义信息流和更多 AI 功能

    YouTube 在年度 Made on YouTube 活动上宣布,将于今年晚些时候推出 Custom Feeds 及更多 AI 功能。用户可通过输入描述创建并保存多个自定义内容标签页,该功能即将在美国面向 Web、移动和 TV 端推出。此外,评论区将支持在常规视频与 Shorts 中发送 GIF,私信功能也将迎来群聊支持。

9月23日周三
9月21日周一
9月2日周三
8月28日周五
7月3日周五
  1. Google DeepMind56

    Google DeepMind 与 A24 达成影视技术研究合作,Google 亦完成对 A24 投资

    Google DeepMind 与电影公司 A24 宣布建立长期研发合作,同时 Google 完成了对 A24 的投资。双方将把技术创新直接锚定在创意制作流程中,由电影创作者参与未来工具与新工作流的塑造,并向研发团队提供一线反馈。合作初期聚焦于弥合前沿技术与娱乐制作的断层,具体技术成果与里程碑将随联合开发逐步推进。

7月1日周三
5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni,首款模型 Gemini Omni Flash 上线

    Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。

    推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。