MiniMax H3 首尾帧实测:火柴与太阳在白光中无缝互换
创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。
09 月 13 日
79 条动态
创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。
CapCut 桌面端集成 Dreamina Seedance 2.5 与 GPT Image 系列能力,单次可生成最长 30 秒视频,主打 AI 视频与图像一体工作流。有创作者实测完整 AI 商业广告流程:先用即将登陆 CapCut 的 GPT Image 2.5(经 Design Studio、AI Image 入口调用)确定 iPhone 风格产品概念图,再用 Seedance 2.5 生成视频,一条工作流即可把产品概念做成广告片。
Reddit 用户分享用 Astra 处理 JSON 文件、搭建「角色 场景 合成 视频」生成管线的尝试:Astra 能创建 JSON 文件并自主测试不同模型,但在多个镜头间保持角色与图像一致这一核心要求上表现很差。 作者几个月前做过同样尝试,结果类似。理论上可行,但意味着要人工看管多个容易相互破坏的自定义节点包,工程化成本高;作者认为多镜头一致性在当前条件下可能仍然做不到。
9 月 12 日前后,多位创作者透露 OpenAI 图像模型 GPT Image 2.5 即将登陆 CapCut PC 桌面版,通过 Design Studio 与 AI Image 功能提供。CapCut 的 AI 视频生成基于字节 Seedance 2.5,单次最长 30 秒、支持多模态。创作者们分享了「先用 GPT Image 设计分镜、再生成整片」的实测工作流,认为关键在于从创意到可控成片的完整能力。
Riccardo Wolf 展示 Seedance 2.5 在动作场景上的能力:一段连续 10 秒手持镜头的篮球画面,包含变向过人、背后运球、爆发突破、防守封堵和收尾的战斧式扣篮。视频模型的动作时序、镜头追踪、篮球物理和整体连贯性通常在这类场景开始崩坏,但 Seedance 2.5 表现得出奇地好。
Linus Ekenstam 展示智能体 Astra 的 3D 创作能力:给一个任务和一张 Google Maps 截图,Astra 用一个多小时生成了西班牙马贝拉 15x14 公里的 3D 地块,包含 4393 栋房屋和 450 公里可驾驶道路;此外它还能仅凭 Amble 网站的几张参考图在 Blender 中直接建模出 Amble One 轻型越野车,并全自动生成着色器弹簧动画。

字节跳动 Seedream 团队发布新研究 VoT(Vision-of-Thought),用于统一多模态表征对齐。其核心设计是在 VLM 与 DiT 扩散主干之间加入一个 VoT 层,让模型在渲染像素之前先进行「视觉思考」,即在生成图像前先做视觉层面的推理。该方法旨在打通视觉语言模型与扩散生成模型,提升多模态统一建模能力。
一位用户此前用 Wan 2.2 16fp i2v 正常生成 5 秒视频,几周后在 ComfyUI 及其他组件均未更新的情况下,输出突然变成诡异的波浪状抽象动画。 排查过程:作者与 Claude 一起排除多种可能,关闭 sage attention 无效,最终换用 fp8 模型后恢复生成。Claude 判断 5090(32GB 显存)+32GB 内存的配置本身够用,问题根源很可能是 Blackwell 架构的 fp16 累加不稳定——作者自己也提醒这更像是 AI 的断言而非已证实的结论,在帖中征求其他人的见解。
有用户实测 Krea 2 的角色生成能力:不使用 LoRA 直接生成 2D 与 3D 游戏角色,约有一半次数能正确还原来源角色,说明其对训练数据中的角色记忆相当强。 作者同时观察到 Civitai 上的角色 LoRA 生态偏写实内容,2D 与游戏相关角色的 LoRA 很少——意味着想稳定生成动漫/游戏角色仍需自训 LoRA 补足。
用户实测腾讯开源的 WeMM-Embedding 模型,用它从《三体》视频中把所有展示电脑桌面的画面和视频片段检索出来,且能在自己的 RTX 3060 显卡上稳定运行。作者认为该模型可做很多视频衍生品,并向网友征集更多玩法点子。

Higgsfield 发布 AI Motion Designer,一款可接入 After Effects 的 ChatGPT 插件,据称能理解动画原理、自动编写表达式并调整关键帧。结合 GPT-6 Astra,用户在 ChatGPT 中输入指令即可直接在 AE 中生成内容,甚至一句话生成 3D 引擎,无需系统学习 After Effects。其设计负责人演示称,过去耗时约一周的程序化动画工作,如今缩短至约 20 分钟,大幅提升动效设计效率。
作者 mhmazur 分享了用 Codex 和 Astra 组合制作艺术 GIF 的实验成果:一幅复古未来主义的星球改造场景,呈现出厚涂油画(impasto)的丰富质感。
楼主在 RTX 5050(8GB 显存)笔记本上用 MiniMax 的视频生成工作流做实测:仅用 1 个节点、5 张图片加 5 条提示词、耗时 17 分钟,一次性生成短视频草稿,全程无需剪辑。楼主表示许多视频工具用起来繁琐,这种"扔图扔 prompt 直接出草稿"的轻量体验正是自己想要的效果。

Reddit 用户分享了 AI 科幻惊悚片《Deviant》的预告片,全片长 82 分钟,可免费在线观看完整版。这是 AI 影像生成工具进入长片创作的又一个实际案例。

有网友用字节的 Seedance 2.5 模型(在 Dreamina 平台)生成了一段自然演化的视频,全程一镜到底、无任何剪辑切换,画面连贯展示了自然演变过程,作者附上了提示词。展示了当前视频生成模型在长镜头连贯性上的能力。
Reddit 用户分享 AI 生成视频作品「The Architect's Monolith」:在 20 秒内完成一段建筑的连续演化,包含 8 次无缝场景转场,全程一镜到底式的流畅过渡。展示了当前视频生成模型在长镜头连贯性与转场控制上的能力上限,是值得一看的生成视频 demo。

Tripo 官方发布一套完整的 3D 角色制作教程,组合 Astra + Tripo 3D + Blender,覆盖从参考图生成 3D 模型到组装、绑定、表情与动画的全流程。 核心经验:不要让 AI 一次生成整个角色。整人生成容易脸崩、头发粘连、脖子接不上;应先在 Tripo 中把角色拆成身体、头部、头发三个部件分别生成,再导入 Blender 由 Astra 完成组装与检查,每个部件可单独重新生成和调整,效果稳定得多。 工作流共 7 步:准备参考图 → 分别生成三个部件 → 配置 Blender MCP → 组装角色 → 绑定骨骼和表情 → 检查材质 → 制作渲染动画。参考图建议用正面全身 T Pose,手脚完整、双臂分开、背景干净,提前检查脖子、手指和头发轮廓,教程附每步可直接复制的提示词。

Reddit 用户分享了一段 Seedance 2 生成的视频:画面中的球队成功进球并晋级半决赛。帖子展示了 Seedance 2 在复杂运动场景与连贯叙事上的生成效果,属于媒体生成模型的新实测案例。

德州农工大学联合 Stanford、Snap、Topaz Labs 等机构发布 4KAgent,自称全球首个 agentic 照片修复系统,论文已被 NeurIPS 2025 接收,代码已在 GitHub 开源(约 823 star)。 系统内置 50 多个专用模型(去噪、去模糊、超分、人脸恢复、细节增强等),工作方式类似人类修图师: 先对输入图像做诊断; 规划并执行一张动作图(action graph); 每步之后评估输出,必要时动态调整计划。 目标是让没有摄影专业知识的普通用户也能把任意图像一键修复/超分到 4K 级别,无需手动组合多个 AI 模型。
机器学习圈知名作者 Andriy Burkov 转发并点赞一幅作品,称作者精准捕捉并呈现了一位伦敦普通女性的气质与外表,细腻程度令他着迷。原帖应为 AI 生成图像,展示了当前图像生成在刻画「普通人真实感」上的水准。

一位 Reddit 用户分享为流行歌曲制作 MV 的工作流测试:用音频模型分析 3 分 17 秒的歌曲《Les Fleurs》,生成带时间戳的分段描述,再喂给视频生成模型。由于能听音频的模型不足以生成复杂的多段 JSON,他采用「音频模型写文字描述 + 强模型消费」的两段式方案,并以匿名文件名防止模型靠歌名作弊。实测结论: Qwen3.5 Omni Plus:曲目长度精确到秒,准确命中 1:04 的管弦乐铺垫和 1:17 的副歌爆发,主题总结到位,综合最佳 Gemini 3.8 Flash 内容最好但时间戳整体偏早几秒 Mimo 2.5 Thinking 能识别节奏变化、正确指出 3:15 的淡出,但错过第一个铺垫点 Gemini 3.1 Pro Preview 漏掉了 1:17 的关键节拍点 Muse Spark 1.2/1.3 与 Inkling Thinking 实际未收到音频,凭空编造了不存在的歌曲

- 设计师 Tegadesigns 分享如何用 AI 制作近期在社媒疯传的「1980 年代复古」照片/视频效果的教程,内容主要在其附图中,并邀请读者跟做并 @ 作者。 属于典型的一波社交媒体 AI 复古美学创作玩法,适合内容创作者跟风复刻。
作者分享了一个进行中的创作项目:先用 ChatGPT 生成图像,再用 New Image 2.5 将其动画化,拼成一首歌的完整 MV 预览。这首歌出自作者正在写的小说,属于小说配套音乐作品,目前仍在制作中。

作者详细拆解了上一条展示的 3D 教科书的工作流:GPT-6 Astra + Hyper3D Rodin MCP,从简单提示词到完整交互体验。 流程: 描述你想构建的东西 让 GPT 规划项目 用 Hyper3D 生成 3D 资产 全部集成进可运行的网站 作者指出 Hyper3D 的差异化在于:Bang 功能可直接在 GPT 工作流中调用;若有更精细要求,还可在 Hyper3D 界面里继续调整模型。他认为这类工作流会大幅降低教育工具、交互 demo 的制作门槛,过去需要完整 3D 制作团队才能完成。