Seedance 2.5 走红:一张自拍生成同款人物逼真视频
提示词博主 techhalla 称 Seedance 2.5 的「单图定人」能力是他三年来见过最好的:仅凭一张本人照片作参考,即可生成以该人物为主角的逼真视频,并公开了完整 prompt 供复现。多个创作者跟进演示,包括「东京午夜足球课」等案例;还有创作者发现原拟生成的东京时尚偶像在涩谷雨中意外变成了内马尔的形象,效果逼真引发热议。
09 月 13 日
74 条动态
提示词博主 techhalla 称 Seedance 2.5 的「单图定人」能力是他三年来见过最好的:仅凭一张本人照片作参考,即可生成以该人物为主角的逼真视频,并公开了完整 prompt 供复现。多个创作者跟进演示,包括「东京午夜足球课」等案例;还有创作者发现原拟生成的东京时尚偶像在涩谷雨中意外变成了内马尔的形象,效果逼真引发热议。
围绕 MiniMax RefMod 的 ComfyUI 工作流教程近日在社区热传。RefMod 允许用户无需训练即可为图像、视频和音频创建可复用的参考角色身份,保持跨模态的身份一致性。多位创作者分享了详细教程与视频演示,包括 Reddit 用户 Citadel_Employee 发布的 YouTube 教程,手把手演示如何在 ComfyUI 中为 MiniMax H3 搭建 RefMod 工作流,适合想在本地部署图像生成参考流程的用户。

围绕 MiniMax RefMod 的 ComfyUI 工作流教程近日在社区热传。RefMod 允许用户无需训练即可为图像、视频和音频创建可复用的参考角色身份,保持跨模态的身份一致性。多位创作者分享了详细教程与视频演示,包括 Reddit 用户 Citadel_Employee 发布的 YouTube 教程,手把手演示如何在 ComfyUI 中为 MiniMax H3 搭建 RefMod 工作流,适合想在本地部署图像生成参考流程的用户。

aryansawhney17 宣布推出 Narrative,一款面向普通用户的 AI 视频编辑器。展示视频由其 agent 端到端通过提示词 prompt 生成,全程在 Narrative 内完成,无需传统剪辑操作。
一条图文生成提示词模板:用同一个 prompt 生成竖版 4:5 双拼「旅行明信片」。 上半部分:超写实手机随手拍风格——意大利 Portofino 石板街、金色时刻光线、粉彩色建筑与地中海背景,人物穿着、姿态、道具都逐项描述到位。 下半部分:要求对完全相同的场景与人物转成水彩+钢笔淡彩风格,强调笔触、纸纹、墨线,并保持构图、服装、姿势一致。 模板的核心技巧是「同场景双风格」的约束式写法:把写实版细节全部列死后,在下半部分用『EXACT same』逐项锁定一致性,适合做对比图、风格化旅拍内容。

胡渊鸣(Yuanming Hu)宣布 Mora 1 上线,可直接试玩。该演示包含空间解谜、多人平台跳跃、物理、建造与风格切换等玩法,全部由代码生成、3D 生成与实时视频驱动。作者表示在体验了各家世界模型演示后选择了不同的技术路线,Mora 1 是让 AI 编写的游戏达到 AAA 级视听效果的早期一步。
博主 sebkrier 发帖暗示 Midjourney 8.2 的存在,并附上一张图。正文极简,实质信息在配图里,或为 MJ 新版本的早期测试/爆料。具体画面细节以原图为准。

博主sebkrier发布了一张标注“mj8.2”的黑猫样张,被解读为Midjourney 8.2版本的测试输出。其发帖正文极为简洁,实质信息都在配图中,或为MJ新版本的早期测试或爆料。具体能力细节尚待官方确认,但疑似新版的图像质量已在社区广泛流传和讨论。

一位设计从业者发帖询问同行:快速迭代和 logo 概念头脑风暴时用什么生成式工具——是手绘/Procreate/Illustrator,还是用图像生成模型产出概念稿?作者称失去了 iPad,正处于 Procreate 戒断中。属于工具讨论求助帖,无结论信息。
arXiv 论文《World in World》提出一种免训练的推理时接口,无需重训即可让冻结的自回归视频世界模型获得灵活的相机与时间控制,可实现重机位与回访等操作。其核心思路是将源视频观测、目标视角场景投影与引导信息结合,通过原生自注意力机制路由异构视觉证据,并借助对应引导查询实现精准控制。
一位开发者在Reddit的r/StableDiffusion板块开源了应用sound-and-vision,可一键自动生成音乐及配套音乐视频,完全免费且无付费墙。该工具基于新发布的音乐生成模型YuE2生成歌曲,再使用Minimax H3生成视频,将音乐生成与视频生成流程串联为一体化工具,具体功能与效果可查看原帖链接。
Reddit 用户分享了一支名为《The Jitterbug Jamboree》的超现实风格音乐视频(AI 生成),效果见原帖视频。

作者 techhalla 分享了他配合个人照片使用的视频生成 prompt(配 Grok 视频模型),并附上成品演示。 Prompt 结构要点: 风格+镜头+氛围:模拟被卷入战斗的战地摄影师视角——肩扛手持的剧烈晃动、撞击后的急推急摇、命中瞬间的短暂失焦、镜头上的灰尘、过曝的天空闪光、压暗的黑位;强调「脏、近、有重量感」,而非干净的史诗式运镜。 场景设定:开裂的黑色玄武岩战场、飘灰与热浪,天空则极度奇幻——巨型浮空岛缓慢研磨、瀑布倾泻入空中、断裂石桥悬吊、余烬云与雾中双日。 图片参考:指定提供的照片作为主角面部(光头、浓密深色胡子)的唯一视觉参考。 整个帖子的价值在于展示了一套「写实质感 + 奇幻场景 + 真人脸参考」三层结构的视频 prompt 写法,读者可以直接套用修改。
开发者基于 GPT Astra 仅用几天时间,在浏览器中重建了《任天堂明星大乱斗》风格的网页对战游戏 Super Smash Royale。该作集成了《Melee》与《Brawl》的 45 个角色,直接使用游戏原始素材,无需模拟器即可游玩。多位开发者展示了类似成果,显示前沿 AI 模型在快速生成复杂可玩游戏方面的能力引发关注。
语音公司 Rime 发布面向真实对话的新语音模型 Coda,号称可在终端 60 秒内生成自然 AI 语音,支持 600 多种音色和 50 多种语言,并可直接在 Claude Code 内预览音色,无需仪表盘与额外配置。与多数基于有声书和演员录音的方案不同,Coda 的训练数据来自真实的人与人来回对话。同期公司宣布完成 2400 万美元 A 轮融资。
有开发者发布 MIT 协议开源的 ComfyUI 自定义节点集 Clipboard-Automator,旨在解决工作流中每次都需手动保存、上传图片的痛点。该工具提供监听操作系统剪贴板的节点,实现「复制即触发」,图片一旦复制即可自动进入 ComfyUI 流水线处理,从而构建零点击的全自动工作流,提升创作效率。

作者分享一段完整的 I2V(图生视频)prompt 模板:生成 15 秒、16:9 写实视频,共七个镜头,以森林搜寻 vlog 开场、以冷面喜剧反转收尾。要点包括:用上传的人像作为外貌参考(脸型、短发、黑框眼镜、蓝色外套等全程保持一致),用森林图作为环境与工作区参考(苔藓、蕨类、弧形树、桌面电脑与座椅);风格上要求真实手持旅拍质感——自然镜头抖动、可信的跑动、偶尔对焦调整、轻微运动模糊,并交替自拍机位、前向 POV 和旁观者手持机位。可复用于人物一致性与多镜头叙事的图生视频工作流。

开发者 obvpm 发布 comfyui-obvpm 节点包更新,项目已迁移至正式 GitHub 账号。本次更新带来三大实用功能:单节点内合成多张参考图(Load Images & Compose)、线束打包,以及参数预设系统(Settings Presets),可显著简化工作流搭建,降低多图参考场景下的操作成本,受到 ComfyUI 社区关注。

楼主称赞 MiniMax H3 的能力,但指出其生成的语音(无论来自参考音频还是模型自行生成)总是过于响亮、听起来像「贴在」场景里, acoustic 上与环境不融合——像是角色对着几厘米外的麦克风说话。他已尝试大量 prompt 组合和传入低音量的参考音频,均无效。核心问题:能否训练一个 LoRA 让 H3 的生成语音更轻、更「远」,从而在混音中更好地融入环境?向社区求思路。这条帖子的价值在于揭示了 H3 语音输出的一个共性缺陷(近讲、缺乏距离感/环境混响)。
创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。
CapCut 桌面端集成 Dreamina Seedance 2.5 与 GPT Image 系列能力,单次可生成最长 30 秒视频,主打 AI 视频与图像一体工作流。有创作者实测完整 AI 商业广告流程:先用即将登陆 CapCut 的 GPT Image 2.5(经 Design Studio、AI Image 入口调用)确定 iPhone 风格产品概念图,再用 Seedance 2.5 生成视频,一条工作流即可把产品概念做成广告片。
Reddit 用户分享用 Astra 处理 JSON 文件、搭建「角色 场景 合成 视频」生成管线的尝试:Astra 能创建 JSON 文件并自主测试不同模型,但在多个镜头间保持角色与图像一致这一核心要求上表现很差。 作者几个月前做过同样尝试,结果类似。理论上可行,但意味着要人工看管多个容易相互破坏的自定义节点包,工程化成本高;作者认为多镜头一致性在当前条件下可能仍然做不到。
9 月 12 日前后,多位创作者透露 OpenAI 图像模型 GPT Image 2.5 即将登陆 CapCut PC 桌面版,通过 Design Studio 与 AI Image 功能提供。CapCut 的 AI 视频生成基于字节 Seedance 2.5,单次最长 30 秒、支持多模态。创作者们分享了「先用 GPT Image 设计分镜、再生成整片」的实测工作流,认为关键在于从创意到可控成片的完整能力。
Riccardo Wolf 展示 Seedance 2.5 在动作场景上的能力:一段连续 10 秒手持镜头的篮球画面,包含变向过人、背后运球、爆发突破、防守封堵和收尾的战斧式扣篮。视频模型的动作时序、镜头追踪、篮球物理和整体连贯性通常在这类场景开始崩坏,但 Seedance 2.5 表现得出奇地好。