AMD 显卡跑 MiniMax H3 教程:ROCm 需升级
Reddit 用户发布在 AMD 显卡上运行 MiniMax H3(MMH3)的完整教程,覆盖 RDNA3 架构的 RX 7900 系列与 RDNA4 架构的 RX 9070/AI Pro R9700。教程基于 ComfyUI 加 ROCm 环境,强调需将 ROCm 升级至 7.13 及以上版本才能以最佳速度运行,为 AMD 平台用户提供了可行的本地部署路径。

09 月 13 日
74 条动态
Reddit 用户发布在 AMD 显卡上运行 MiniMax H3(MMH3)的完整教程,覆盖 RDNA3 架构的 RX 7900 系列与 RDNA4 架构的 RX 9070/AI Pro R9700。教程基于 ComfyUI 加 ROCm 环境,强调需将 ROCm 升级至 7.13 及以上版本才能以最佳速度运行,为 AMD 平台用户提供了可行的本地部署路径。

网友转发 @spawn 的环境设计演示,称其水准'next level'。Spawn 是 AI 生成世界/环境的产品,此帖展示了其生成的场景质量,对关注 AI 生成内容质量的读者有参考价值。
本地运行的 3D AI 生成器 Pixal3D 推出 Multiview 功能,现已原生集成进 ComfyUI。用户可同时上传正面、侧面、背面三张视图,生成精度更高的 3D 模型。作者预告专门的视频教程即将在其频道上线。
一部 8 分钟以上的 AI 科幻短片《CANDY》100% 用 BytePlus 的 Dreamina Seedance 2.5 制作,从剧本、生成到剪辑由一人完成,被认为证明了个人已能独立做出真正的电影。 片中包含伪新闻桥段、多个短小段落、统一的世界观规则和一个有力结尾,被视为真正的短片而非 demo 合集 Seedance 2.5 在电影感布光、 glossy VFX、大场面镜头上表现出色,单段素材最长可达约 30 秒 过去需要剧组和不小预算才能完成的内容,现在一个创作者即可写、生成、剪辑并成片
一位 3D 背景的短片创作者针对“用生成式 AI 就不算电影人”的观点发布反驳视频。他坦言最初也被 AI 带来竞争威胁,但逐渐把 ComfyUI 等工具纳入制作流程,并反思艺术社群围绕 AI 的种种误解与双重标准。视频本身就是用 ComfyUI 参与制作的实例。

作者 Salmaaboukarr 分享了一组用 Midjourney 进行的风格探索作品,展示了新尝试出的图像风格效果。图片本身即内容,适合关注 MJ 创作玩法的读者参考。

作者给出在 AMD GPU(RDNA 4 的 RX 9070/AI Pro R9700、RDNA 3 的 RX 7900)上以最佳速度运行 MiniMax H3(MMH3)的完整 Windows 11 教程。 核心问题:默认安装的 ComfyUI 使用基于 ROCm 7.2 的 PyTorch,int8convrot 版模型在这些卡上跑不动,必须升级到 ROCm 7.13+(推荐 7.14.0)。 关键命令: 用 pip install --index-url https://repo.amd.com/rocm/whl-multi-arch/ "torch[device-gfx????]==2.12.0+rocm7.14.0" ... 按 GPU 型号对应的 gfx???? 值安装。 四种安装 ROCm 7.14 的方式(由易到难): Stability Matrix 安装(作者实测最新版已坏,暂不推荐;含完整启动参数如 --enable-dynamic-vram --use-ck-attention 等) Portable 版 ComfyUI + 内嵌 Python Python venv + comfy-cli 官方安装器 pip + git 手动安装(最灵活) 文章还包含模型下载链接(Krea-2 int8convrot,13.5 GB,含 SHA256)与验证生成是否正常的方法,并预告将另发 Ubuntu 版教程。

作者宣布为 AI 音乐项目 leafalia 发布 4 个新环境与交互机制,制作原声带的下载版本,并为虚拟艺人 noaliae 的第二张专辑在全流媒体平台上架做准备。展示了 AI 生成音乐作为持续运营的虚拟艺人产品的进展。
发帖人在 ComfyUI 上用 5070 Ti 16GB + 64GB 内存跑 MiniMax H3 的 ref2va(int8,启用 Turbo LoRA),生成 10 秒 9:16、0.2MP、单图+视频输入的视频,每步耗时约 150 秒;而同类设置下 image2video 生成 10 秒 0.5MP 视频每步只需约 27 秒。作者询问这一巨大速度差异是否正常,还是自己的配置有问题,并求排障指南。
作者在做约 128×128 像素画的同一角色多姿势生成:先用参考图预处理成更干净的像素风数据,再用 IP-Adapter 锁定角色外观、ControlNet pose/rig 控制目标姿势,并尝试正面/背面/左右多参考图加姿势与深度标注。核心问题是两类条件经常冲突——模型按 ControlNet 摆好手臂却又复制参考图中的手臂形状,导致肢体重复或怪异;调 strength 与 start/end 时机收效有限。作者资源有限无法为每个角色训练 LoRA,征求兼顾外观保真与姿势控制的方案。
一位用户发帖称 Sydney Sweeney 出演的一支广告「谁都没看出来是 AI」,转发者评论认为这可能是第一个大众普遍没意识到是 AI 生成的案例,并感叹图像生成质量已到这一步。具体广告来源与制作方未明,但作为图像生成普及度的一个信号值得记录。
Reddit 用户展示了一个用 Rust 编写、完全接入 MCP 的 AI 驱动模块化音乐合成系统:AI 能做到人类操作者能做的一切,包括为模块生成截图、在任意端口测量 X 秒的音频。通过 MCP 协议让模型直接操控音频硬件/软件模块,是 agent 与音乐创作工具结合的有趣 demo。

开发者 Dilum Sanjaya 分享了一个游戏 NPC 生成工作流:先用 Tripo 生成 3D 角色,再用 Mixamo 绑定骨骼动画,然后让 AI 智能体(帖中称 "GPT-6 Astra")为角色搭建一座岛屿、分配不同职业,并让他们自主互动。 成品是一个充满生活感的 NPC 村庄,角色间能自然交流互动,效果相当完整。整套流程全部由现成工具组合而成,对做 AI 生成游戏内容的人有直接参考价值。
开发者 elmorinelly 开源了 ComfyUI 节点 PromptSync,专为使用定时提示词生成视频的用户设计,用于核查视频生成模型对提示的遵循程度。其核心交互为左侧播放视频、右侧同步显示提示词,实现视频与分时 prompt 的逐段对齐对照,方便排查模型是否按要求执行。

创作者受 @yuruyurau 的「波动生物」生成艺术启发,基于其底层数学实现再创作:引入 domain shifting 增加随机性与复杂度,并用 GLSL 重写了整套渲染。配图为最终生成的流体状生物效果。
英伟达高级研究科学家 Jiarui Xu 展示:将办公室扫描的几张渲染图喂给 GPT-6 Astra,模型直接输出完整的 Blender 重建场景,包含 50 张办公桌、62 把椅子、墙体与百叶窗,与扫描对齐误差仅约 2 厘米,还可用于构建人形机器人训练场。
Vinod Khosla 展示了一个新玩法:用 ChatGPT 设计商品,再交给意大利的 Modaway AI 在数天内手工制作成真品——发一张图即可获得定制单品。Modaway 定位为「个人 AI 时装工作室」:用提示词描述想法,AI 秒级生成可穿戴设计,7 天内在意大利手工制作交付,覆盖包袋、球鞋、高跟鞋等品类,工作室位于米兰 Via Montenapoleone 8。回复者戏称应该加个 MCP 接口,做成「定制时尚生产即服务」。
日本开发者 toyoshi 分享了一项实践:用 iPhone 对现实中的破损物品进行 3D 扫描,再让 GPT-6 Astra 逆向补全缺失部分的形状,直接生成可 3D 打印的模型,实现「扫描坏掉的东西→生成缺失零件→3D 打印」的完整流程。他强调自己完全没有点云处理知识,3D 打印数据全部交给 AI 生成,这一案例展示了 AI 辅助普通用户完成专业级修复制造的可能性。

Epic Games Education 团队发布完整工作流教学,演示如何把自己的实拍视频变成 Unreal Engine 中高质量的 MetaHuman 角色动画,全程无需穿戴式动捕设备(markerless mocap)。 内容覆盖从素材准备、生成到最终动画精修的完整流程,适合想在 UE 中做角色动画的创作者直接照做。完整版为视频课程。

博主 ZeroStateReflex 分享了一部AI生成的科幻短片《The Day the Pillars Fell》第一部,出自频道 The Archive In Between。博主表示这就是他想要的AI内容类型——用AI做科幻短片创作,展示了AI视频生成在叙事短片上的应用效果。
一位 3D/AI 开发者分享:AI 现在可以在不同骨架和体型之间直接重定向动画,无需手动骨骼映射。 传统上,动捕数据复用到新角色需要重新做骨骼映射和清理,费时费力;这一进展若成熟,可能大幅简化游戏动画管线的角色复用流程。
音乐生成模型 Suno 被发现已经完美掌握了 Amen Break 的生成技巧——这段鼓机采样史上被无数次引用的经典鼓点。网友 astralmatrix 等人调侃称『节奏层面的 AGI 已经达成』,感叹 AI 音乐生成在鼓点细节上的表现已达到以假乱真的水准,相关讨论在社区引发热议。
一位 Reddit 用户分享了自己的 AI 生成视频作品《Mirage》,作为对导演大卫·林奇的致敬,视频以林奇标志性的梦境式、超现实影像风格呈现。原帖未附制作工具与流程细节。

作者 lvladikov 发布 Krea 2 Turbo 的 2 步蒸馏 LoRA alpha 版,延续其此前 4 步 LoRA 项目,把官方 Turbo 的 8 步采样压到 2 步。 性能:1024×1024 下去噪时间 79.9s → 20.9s,约 3.8 倍提速,LoRA 自身每次调用仅增加约 3.5% 开销。 方法:采用分布匹配(DMD2)而非模仿,双 score 均按每条 prompt 的条件评估;用视觉-语言裁判对每个 checkpoint 逐张打分检查 prompt 依从性。 训练:rank 64、228 个模块,覆盖 512×512 到 1440×1440 共 12 种分辨率。 使用:普通 LoRA,在 diffusers/ComfyUI/MLX 中以原生 Euler、sigmas [1.0, 0.5128] 即插即用。 作者明确说明 2 步版本质量低于 4 步版,定位为快速预览草稿,高质量出图仍推荐 4 步 LoRA,训练仍在继续。
