Flux 3 视频生成实测:分屏双机位一致性领先
近期多位创作者实测了 Flux 3 的视频生成能力,发现其在复杂的分屏与双机位场景中表现突出。测试表明,Flux 3 能在左右分屏中实现同一事件的逐帧同步,并在严苛的双路监控视角测试中保持人物、物体与时间戳的一致性。多位测试者认为其在该特定任务上的表现明显优于其他视频模型。
07 月 29 日
120 条动态
近期多位创作者实测了 Flux 3 的视频生成能力,发现其在复杂的分屏与双机位场景中表现突出。测试表明,Flux 3 能在左右分屏中实现同一事件的逐帧同步,并在严苛的双路监控视角测试中保持人物、物体与时间戳的一致性。多位测试者认为其在该特定任务上的表现明显优于其他视频模型。
分享的是一个 Midjourney 新创建风格 及其提示词参数:--chaos 7 --ar 3:2 --sref 1835916550 --sw 500 --stylize 500 --hd。 这条帖子本质上是一个风格展示,不是产品发布;配图给出了多张生成效果,能直观看到这种风格的视觉表现。

这条内容介绍了 ComfyUI 里的 FreeU 节点,主张它能明显改善 AI 图像质量。 文章说 FreeU 通过类似傅里叶变换的处理,增强低频成分、抑制高频噪声。 它的卖点是帮助提升结构一致性和色彩平衡。 重点在于:不用重新训练模型,也能靠一个节点改善出图效果。

KAIST 团队提出 GeoFace,一种带几何约束的多视角扩散框架,目标是从单张输入生成一致的人脸多视角图像。 方法会同时生成多视角 RGB 图像和共享的 canonical UV position map,把 3D 结构约束显式注入生成过程。 结构上采用双流架构,并通过几何引导的注意力对齐,让外观与几何在不同视角下保持一致。 论文声称,这种设计在大姿态变化下比以往方法更稳,几何一致性更好。 应用场景包括 3D 重建、数字人和沉浸式内容创作。

- 作者用 LTXV2.3 做了一次 lip-sync(口型同步) 测试,重点想验证:图像+音频生成 不仅能不能对嘴,还能不能处理镜头移动。 这套流程基本照搬 Civitai 上现成工作流,作者提到自己额外在跑的是 EROS V4-B16。 这条内容带明显的自嘲和搞笑气质:作者坦言只是随手测试,还把效果里的角色戏称成 “Fatty Sean Paul / Shaggy Paul”。 对有类似设备的人也有参考价值,原帖附了可复用的工作流链接,并提到 RTX 3060 12GB 也能跑。
Emad Mostaque使用经典的“海獭在飞机上用笔记本电脑”提示词对Flux 3视频模型进行了测试。结果显示,经过两年的迭代,Flux 3已能轻松驾驭这一复杂场景,甚至能将其拓展为充满1990年代动作片风格的“海獭黑客”变体,充分展现了AI视频生成技术在细节把控和创意表现力上的肉眼可见的进步。
一张完全由 AI 工作流参与制作的专辑已成功上架 Spotify 和 Apple Music 等主流流媒体平台。该专辑的歌词主要由 GPT-5.5 和 Claude 生成,随后交由 Suno 完成作曲与风格标签的制作。作者特别感谢了发行商 DistroKid 接受 AI 音乐,其中由 GPT-5.5 创作的歌曲甚至成为了专辑中播放量最高的曲目。

这是一条带强烈视觉梗感的帖子,配图是一张黑白风格的“绅士机器人”形象:西装、礼帽、墨镜,整体很像 AI 生成图或 AI 圈审美梗图。 正文没有提供事实信息,主要作用就是“看一眼就忘不掉”的视觉玩笑;真正的传播点在图片本身。

- 这条 Reddit 视频展示了一段“由 AI 写出来的酷炫节拍”演出,配图是一个舞台表演场景。 重点不在技术发布,而在 AI 生成音乐 + 夸张现场表演 的组合效果,属于很适合转发的多模态趣味内容。

一位 Reddit 创作者分享了自己把AI 参考图一路做成 Fortnite 里可骑乘机械迅猛龙的完整流程,细节非常工程化。 他的流程大致是:先用 Grok Imagine 生成参考图,再用 Nano Banana Pro 修掉一个关键细节;随后进入 image-to-3D 工具生成基础几何体,再用 Hunyuan 3D Studio 做低模重拓扑和 UV 展开;贴图与放大阶段则交给 Trellis2 + ComfyUI,最后由 Blender 完成清理、绑定和权重绘制。 几个实用经验: 在 3D 化之前先把身体拆成多个部件,能明显改善几何体控制 最终模型约为 28K triangles 进入 UEFN 后,靠 Unreal Engine 的 retargeting 工具实现了移动和骑乘 目前还剩硬表面抖动、贴图和权重绘制流程优化等问题

- 发帖者先让 Codex 对一段视频进行编辑和调色。 随后又用自己做的 生成式 UI skill,在聊天界面里生成了一个可交互的前后对比报告。 这个报告支持 拖动查看调色效果、对比不同版本、逐项检查每个决策,把视频处理流程做成了一个可交互的智能体体验。
一个在网页端制作并发布的 Grok Build 演示,核心是名为 RIFT 的实时视频反馈特效应用。 页面支持调用摄像头或上传视频片段,再套用 Liquid Chrome、Prism Cathedral、Temporal RGB、Heat Mirage、Event Horizon 等视觉效果。 工具还提供导出功能,注明可生成适合 X 的 H.264 MP4,并开放 Intensity / Chaos / Feedback / Mix 等参数调节。 这个 demo 的定位是 “live reality distortion”,主打把摄像头画面做成无限反馈、扭曲和燃烧式的视觉效果。
Pika 正在预热 Seedance 2.5,上线时间被明确指向“很快”,并将率先在 Pika 里开放。 这条帖子的核心信息不是技术细节,而是视频生成产品的近期开启预告:作者称目前看到的 teaser 视频是“迄今最好的一版”。
Inpaint-Anything 时隔三年迎来升级,作者把它重新面向第一人称数据做了一轮重构。 这次主要更新包括: 分割模型从 SAM 迁移到 SAM3 视频修复骨干从 STTN 换成 ProPainter 增加了更多面向 egocentric data 的处理能力 作者提到,最近 EgoEngine 等工作会用它来去除第一人称视频里的手臂和手部,这让他认为这套工具可以扩展成更通用的 ego data processing 方案。

像从时光旅行者皮包里翻出的 54 张“历史照片” 这组作品的设定是:一只属于未知时间旅行者的旧皮包被发现,里面装着 54 张跨越人类历史的实体照片。作者明确说明,这些照片都是 AI 生成的虚构影像,并非真实档案或“隐藏历史”证据。 作品使用 ChatGPT Sol5.6 Max Work Mode 逐场景生成,单张图大约耗时 7–10 分钟。 对于没有现存照片的年代,作者用博物馆、考古资料、历史记载和原始文献作为参考锚点,再做“推测性重建”。 创作目标不是精修概念图,而是做出那种粗糙、带点瑕疵、像真实旧照片一样的人类瞬间。 这只是 Part 1,作者表示如果大家感兴趣,会继续发 Part 2 和 Part 3。

Google DeepMind 发现,visual prompt engineering(VIPE) 能通过直接编辑任务图像来提升视频模型的推理表现。核心思路是:把输入视觉内容改写成模型更容易推理的形式。 例子:把一个类似草图的物理场景,先转成更接近照片风格的版本,再让模型推理。 结果:VIPE 在多个任务上都能提分,而且有时比传统文本 prompt engineering 或 test-time scaling 更有效。 结论:对视频模型来说,prompt engineering 不只是改文本,视觉侧的预处理也可能是低算力成本的提升手段。
月之暗面发布了包含 3000 道题目的 PerceptionBench 基准测试。该基准专注于评估多模态大模型的原子视觉感知能力,试图将纯粹的感知错误与推理、知识错误剥离开来。测试结果显示,目前前沿多模态模型在该项基础感知能力上的表现均未突破 60%,暴露出当前模型在底层视觉理解上的短板。
OmniDelta 用技能驱动重分配多模态 token 预算 OmniDelta 是一个训练无关的多模态 token 压缩框架,目标不是只做“删 token”,而是先解决预算该分给音频还是视频、以及各自内部该怎么分的问题。作者认为,直接用查询和音视频 token 的相似度来做跨模态预算分配并不可靠,而固定的模态内均匀预算也容易漏掉关键信息、保留冗余内容。 方法 先构建音频技能池和视频技能池,根据查询意图动态调整保留预算。 再结合局部复杂度和时间冗余,在音频片段与视频帧之间重分配预算。 该方法可以和现有 pruning 策略叠加,在不改变总保留比例的前提下,改变预算花在哪里。 结果 在 4 个音视频 benchmark 和 2 个 Qwen2.5-Omni 模型上验证。 在不同剪枝比例下,取得新的准确率-效率 Pareto 前沿。 在 Qwen2.5-Omni-7B 上保留 25% token 时,GPU 显存下降 22.0%,端到端推理速度提升 1.64 倍。
Google联合哥本哈根大学与牛津大学的研究人员提出了VGGRPO(Visual Geometry GRPO)方法,旨在解决视频生成中“画面好看但物理崩坏”的问题。该方法通过在隐空间引入几何奖励对齐视频扩散模型,利用潜空间几何模型来提升视频生成的物理一致性与几何稳定性。

作者分享了一个用 GPT Image 2 生成的夏日怀旧风作品:以一位合成角色坐在老旧救生塔上为核心,追求“韩式夏日日记”般的气质。 他详细讲了哪些视觉细节决定了成片效果:旧塔必须显得风化而不是刚刷漆,配上快融化的冰棒、挂在手腕上的复古相机、风筝、漂浮的手写笔记,以及大量留白的浅蓝天空;再用胶片颗粒和低对比度,把画面压成像老相册里翻出来的照片,而不是明显的渲染图。

Adobe Research 和 Johns Hopkins 提出了 Wonder,一个面向实时、可由相机控制的通用视频世界模型。它可以从一张图或一段条件视频出发,构建一个可交互的“可玩世界”,用户能通过移动镜头探索未见区域,并在长时间跨度里回看已见内容。 论文的关键设计包括: 密集坐标场式的相机条件:把镜头运动直接转成视觉证据。 稀疏注意力记忆机制:在长上下文里快速检索相关信息。 蒸馏流程修正:增强学生模型对控制信号的服从度,同时保留多样性和长期记忆。 系统可在 16 FPS 下生成分钟级视频,也支持对已有动态场景做实时重拍式生成。
多位开发者成功将 Claude Code 改造为完整的 AI 影视工作室系统,构建出可落地的六阶段短片生产管线。其中一位开发者受 Netflix 斥资 5.87 亿美元收购 AI 创意公司的启发,从零搭建了全自动 AI 视频生成工作流。这套方案并非依赖单一提示词,而是深度结合了子智能体、技能模块、Bash 脚本与工程化编排,实现了高度自动化的视频内容生产。

创作者用 Flux 3 制作 AI 恐怖片预告片 原帖说,作者开始用 Flux 3 制作 AI 恐怖电影预告片,这支作品的名字叫 《Contaminated》。 它不是产品发布,而是一个很具体的创作 demo:用视频生成能力做类型片预告,重点展示的是多模态生成在叙事和风格化内容上的可玩性。
有人在尝试用 Opus 5 + three.js 把一张工厂照片尽量复现成可交互场景。 转推者认为它对细小资产的还原做得不错,说明这不是普通的文生图展示,而是偏向基于图片参考的三维/场景重建实测。