在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第 2 部分)
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 做图像生成(/v1/images/generations),异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成(/v1/videos/sync),生成的 MP4 存入 Amazon S3。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 做图像生成(/v1/images/generations),异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成(/v1/videos/sync),生成的 MP4 存入 Amazon S3。
Hugging Face 演示了基于 Gradio Workflow 搭建的 Workflow1111 项目,通过 73 个节点和 11 条流水线重构了 AUTOMATIC1111 的主要功能。
推荐理由:原文详细拆解了用节点图组合多模态模型与本地函数的架构,读者可据此参考如何将复杂应用封装为标准接口与智能体工具。
OpenAI 推出 ChatGPT Images 2.5。新版本支持将用户的想法、草图和参考照片转化为更具个性化、更精致且更能体现原意的图像。
Hugging Face Diffusers 现已原生集成 Nunchaku Lite,支持直接通过 from_pretrained() 加载基于 SVDQuant 的 4-bit 扩散模型。
推荐理由:该集成让开发者无需部署独立引擎即可直接加载 4-bit 扩散模型权重,在降低显存门槛的同时保持了推理加速。
Google Research 在 ICLR 2026 发表的研究揭示,扩散模型的“创造力”并非随机巧合,而是源于神经网络训练中的得分平滑(score smoothing)现象。由于权重衰减等正则化效应,模型学到的是平滑后的近似得分函数,避免了单纯记忆复刻训练数据。这种平滑机制促使去噪过程在训练数据点之间实现插值,从而稳定生成逼真的全新样本。
Photoroom 详细公开了开源图像模型 PRX 的预训练数据工程管线与策略,围绕数据格式选型、VLM 长图说重标注与流式分发展开。团队采用 Lance 格式进行底层索引与多模态检索,选用 Qwen3-VL-8B 生成密集长图说,并实测验证 quality 92 的 JPEG 存储不会对生成质量产生负面影响。
Google DeepMind 推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:官方给出了高吞吐图像模型与多模态视频模型的延迟和定价,为构建轻量端到端多媒体流水线提供了参考。
Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。
推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。
Google 推出一种结合三维场景理解与生成式 AI 的照片重构技术,并已在 Google Photos 的 Auto frame 功能中正式上线。该方案将图像处理解耦为 3D 场景与相机参数估计、潜在扩散模型修补两个阶段,能够在拍照后自动调整虚拟相机机位与焦距,并修复人像广角畸变。用户在编辑包含人物的照片时,可直接在构图候选项中选择重构视角的一键优化效果。
推荐理由:该方案将单张照片解耦为三维场景估计与扩散模型修补两阶段,展示了借助空间感知调整成像视角并消除畸变的新思路。
Mistral AI 宣布为助手 Le Chat 推出一系列重大更新,包括提供结构化研究报告的 Deep Research 预览版,以及由新模型 Voxtral 驱动的低延迟语音模式。新版本还集成了推理模型 Magistral 以支持原生多语言深度思考,并增加用于归类管理对话与文件的 Projects 功能,同时携手 Black Forest Labs 支持直接通过提示词进行图像连续编辑。
推荐理由:原文集中展示了深度研究、语音和推理模型等多项能力更新,读者可以了解该助手在工作流组织与多模态交互上的最新进展。