可灵 4.0 首发实测:升级 10-bit HDR 输出与原生 30 秒叙事能力
爱范儿对即将上线的新一代视频生成模型 Kling 4.0 进行了首发实测,该版本重点强化了复杂运镜稳定性与叙事可控性。模型原生支持最长 30 秒生成与 21:9 画幅,提供 10-bit HDR 规格输出以适配专业调色流程,并支持 9 种语言的口型与多声道音频同步。
爱范儿对即将上线的新一代视频生成模型 Kling 4.0 进行了首发实测,该版本重点强化了复杂运镜稳定性与叙事可控性。模型原生支持最长 30 秒生成与 21:9 画幅,提供 10-bit HDR 规格输出以适配专业调色流程,并支持 9 种语言的口型与多声道音频同步。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 做图像生成(/v1/images/generations),异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成(/v1/videos/sync),生成的 MP4 存入 Amazon S3。
Runway 在 GWM Worlds 2 研究预览中引入 WorldPrompt 控制机制,其核心团队受访详解了将离线视频模型改造为实时交互式运行时的技术架构。
Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。
推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。
Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。
推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。
YouTube 在年度 Made on YouTube 活动上宣布,将于今年晚些时候推出 Custom Feeds 及更多 AI 功能。用户可通过输入描述创建并保存多个自定义内容标签页,该功能即将在美国面向 Web、移动和 TV 端推出。此外,评论区将支持在常规视频与 Shorts 中发送 GIF,私信功能也将迎来群聊支持。
AWS 提出基于智能体架构的对话式视频智能方案,通过 Strands Agents SDK 编排 Amazon Bedrock、Amazon Rekognition 与 Amazon Transcribe,支持用自然语言直接查询视频内容。
invideo 借助 GPT-6 Astra 将视频色彩校正与调色效率提升至 3 倍。通过引入该模型,invideo 能够以更高的精度规划视频剪辑,并在一天内制作出 50 种自定义特效。
Higgsfield AI 借助 GPT-6 Astra 在一天内上线了全新视频功能。该能力降低了小型企业制作视频广告的门槛,并帮助团队更快将全新创意工具推向市场。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic 视频理解,官方称可将视频分析的 token 消耗最多降低 88%、成本最多降低 66%,准确率最多提升 7%。
推荐理由:Google DeepMind 公布 agentic 视频理解在长视频上的 token 与成本变化,并给出 API 开启方式。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 与 Google AI Studio 为开发者提供更精细的生成式视频控制能力。
推荐理由:新版本引入了基于上下文的场景扩展与首尾帧控制,展示了开发者在长视频叙事与分辨率超分中的具体调用方式。
Google DeepMind 与电影公司 A24 宣布建立长期研发合作,同时 Google 完成了对 A24 的投资。双方将把技术创新直接锚定在创意制作流程中,由电影创作者参与未来工具与新工作流的塑造,并向研发团队提供一线反馈。合作初期聚焦于弥合前沿技术与娱乐制作的断层,具体技术成果与里程碑将随联合开发逐步推进。
Google DeepMind 推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:官方给出了高吞吐图像模型与多模态视频模型的延迟和定价,为构建轻量端到端多媒体流水线提供了参考。
Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。
推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。