Seedance 2.5 将很快登陆 ImagineArt
ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。
07 月 29 日
154 条动态
ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。
又一条用 Runway 上的 Seedance 2 做出的 NERF → 写实 风格转换测试视频。作者表示这个效果足够有趣,甚至考虑围绕它做成一部电影;最终成片还用了 CapCut 做剪辑。
Cartesia 认为,判断一个 TTS 模型好不好,远比一句“听起来不错”复杂。文章把质量拆成至少五个维度:正确性、音频质量、上下文正确性、自然度、鲁棒性。 核心结论是:模型越强,评测越难。等到明显的口误、杂音、失真都被修掉后,真正难测的是名字、数字、混语、上下文歧义这些更贴近生产环境的问题。
这是一篇深度技术博客的第一部分,作者分享了历时四个月的实验:尝试教导神经网络使用 Gabor 小波(Gabor wavelets)来渲染自然图像。 在各大厂商追求超写实图像/视频生成模型的热潮下,作者反其道而行之,探索更小、独特且自训练的模型。作者以这种熟悉的 Gabor 表示为切入点,在 Claude 的辅助下进行机器学习探索,旨在发现创意工具并实现更具表现力的图像生成路径。
开发者发布了适用于 Krea 2 模型的 Don Martin LoRA,能够生成 Mad 杂志传奇漫画家 Don Martin 标志性的夸张、搞怪风格图像。 该模型训练至 1200 步,在大多数情况下无需特定触发词即可生效。作者表示,如果提示词中包含过多其他风格描述(如“neon”等),添加“a cartoon”或“an illustration”能获得更稳定的效果。模型已在 Civitai 和 Hugging Face 上开源。

开发者发布了一款专为 Krea-2 模型设计的 Depth LoRA,能够将任意输入图像转化为高质量的深度图(Depth Map)。 该 LoRA 采用了两阶段渐进式分辨率训练策略: 阶段一(512分辨率预训练):在2000对公开数据集上训练,利用 VLM 重新生成描述以增强图文对齐,建立稳定的深度结构先验。 阶段二(1536高分辨率微调):专注于细节重建,优化边缘和精细几何结构,采用余弦学习率以稳定收敛。 使用注意:必须配合 ComfyUI-EditUtils 插件才能正常工作,建议输入图像最长边在 1024 至 2048 像素之间以获得最佳效果。

这条帖子是在推荐一段关于 Higgsfield 的视频,作者直说“任何想用 Higgsfield 的人都值得看”。 帖子本身没有展开更多技术细节,但语境表明它更像是一段面向实操用户的讲解或评测,重点是帮助理解这款视频生成产品的使用方式。
Magnific 预告即将接入由 BytePlusGlobal 提供支持的 Seedance 2.5 视频生成模型。据预告信息显示,新版本功能大幅提升,最多可支持 50 张参考图,并能够生成最长 30 秒的视频。目前该功能已进入上线倒计时阶段,引发社区广泛关注。
社区近期推出了针对Krea 2模型的快速LoRA训练工具与实操教程。该工具主打在极低资源环境下的可用性,仅需11GB显存和16GB内存即可运行。配套的开源教程详细展示了数据重标注、自适应学习率调整等核心微调技巧,能够帮助开发者在两分钟内快速完成Krea 2的LoRA训练。

作者分享了一个把 Codex、Claude Code 和 Higgsfield MCP 串起来的实战工作流:先让 Codex 为 Open Field 做出完整 demo,再让它生成带有“ScreenStudio 风格”的发布视频、交互式 UI 和用户视角录制,最后切到 Claude Code,通过 Higgsfield 的 MCP 直接在聊天线程里给视频补上配音。 具体流程包括: 用 Codex 生成 demo、时间轴和旁白文稿 在 Claude 里直接挑选并测试不同声音 把旁白按动作节奏对齐到视频里 在同一个对话中完成视频润色和语音添加 作者的观点是:所谓“AGI”更像是把一堆现成工具正确拼接起来;前沿实验室已经把能力拆成了很多可组合的模块。帖子最后还介绍了 Open Field:一个面向数学和科学开放问题的平台,主张通过公开验证、独立审计和链上可追溯记录来处理新发现。

这条帖在讲一个生成式渲染里的角色一致性事故:为了保住同一个人物,制作方前后试了四次失败渲染;三次单独生成各自产出了三个不同的女孩,连 QC 工具拿着作者自己的外形都判定成了“完全不同的角色”。 作者说,真正的修正办法不是继续硬生成,而是回到单次渲染内的连续性:靠一张 model sheet、三个嘴型、裁切和循环来维持一致。文末还提到,那个缠着绷带的喉部设定在所有变体里都保住了。

泄露的时间表显示,视频生成模型即将迎来密集发布期。Hailuo 3 预计于 7 月 29 日登场,Seedance 2.5 也有望在 7 月 31 日左右上线。此外,FLUX 3 和 WAN 3 分别预计于 8 月 4 日和 6 日接连发布,行业即将进入视频模型的新一轮激烈角逐。

一个“有点诡异”的修图应用已经开放 beta 测试。它用 seam carving 做内容感知缩放,并结合 Apple Vision 和 Roboflow RF-DETR 来识别人、物体和图片中的关键区域。 作者强调,这套流程 全部在 iPhone 本地运行,后续还会公开给更多用户试用。
作者做了一个开源应用,借助 Gemini Video Understanding 自动提取“高影响力、可直接播放”的 reels,不用再手动看文字摘要,也不用拖时间轴。 工具会自动找出值得看的片段。 项目是开源的,并给出了 GitHub 仓库。 这条帖子的重点是:用视频理解能力把“找素材”这件事自动化。 它更像一个基于多模态能力搭出来的实用应用案例。

有人觉得纯文本总结已经不够用了,希望一个大型 agent 任务结束后,直接产出一段 高质量短视频 作为结果摘要。 这条不是在讲某个具体产品发布,而是在表达一个很明确的方向:如果 agent 已经替你做完长规划、长研究,那输出形式也许应该从“又一大坨文字”进化成短小、可视化、便于快速消化的讲解视频。作者认为,模型在生成这种结果视频上的能力还远远不够。
有开发者分享了一种全新的视频生成工作流,将字节跳动的WAN Bernini视频生成框架与Prompt Relay技术相结合。该方案能够生成10至15秒的视频,并成功实现了将特定动作精确控制在指定时间节点,显著提升了长视频生成的可控性与精准度。

HeyGen 将在西雅图 Tech Week 现场演示 HyperFrames HeyGen 宣布在 Seattle Tech Week 期间,于 INTDEV 举办一场 HyperFrames 现场演示活动,时间是 7 月 29 日周三 18:00–20:00。 这场活动的定位不是普通发布会,而是面向 builder 的 meetup。HeyGen 把 HyperFrames 介绍为一种 programmatic video infrastructure:用 HTML、CSS、JavaScript 和 AI 生成动态视觉内容,不需要时间线和关键帧。 文案里还明确提到,它面向做 数据可视化、内容创作、营销、媒体制作、多模态模型、智能体 和各类视觉体验扩展的开发者。HeyGen 想表达的核心是:未来不仅产品可以由 agent 辅助发布,连发布视频也可以由 agent 一起生成。

HeyGen 开源了名为 HyperFrames 的视频特效处理技能包。 核心功能:用户无需手动调节各种滑块,直接通过自然语言请求即可完成视频调色。 支持效果:包含轮子、曲线等各项控制,支持录像带、像素化、ASCII、交叉阴影等多种视觉风格,也允许导入自定义外观包。 所见即所得:预览效果即为最终渲染效果。 安装方式:开发者可通过 npx skills add heygen-com/hyperframes --full-depth 快速集成。
作者让 AI 生成一张“被重建后的旧金山”:把单户住宅和高楼换成豪华 five-over-one、公链连锁店,以及巨大的 AI 广告牌。 配图里满是麦当劳、Subway、Google、Anthropic、Apple Store 等标识,整体更像一张拿来调侃 YIMBY 争论的生成图梗图,而不是认真的城市方案。

有人把 ChatGPT 的实时语音做成了一个带脸、身体和性格的桌面 3D 角色。 这个 demo 被拿来类比 OpenAI 可能的 “Codex Pets” 方向:不是只在窗口里聊天,而是一个会说话、常驻桌面的 AI 伴侣。
Artificial Analysis 发布了最新的原生语音到语音模型测评报告。在 Big Bench Audio 子集测试中,阿里 Qwen Audio 3.0 Realtime Plus 展现了较强的推理表现,但其输入音频成本约为每小时 4.42 美元,略高于同级别的 GPT 实时音频模型。这为开发者在语音模型选型时提供了直观的成本与性能参考。

阿里发布的 Qwen Audio 3.0 Realtime 在 Artificial Analysis 的 Speech to Speech Index 上拿到新第一,Plus 版 84.1%,领先 GPT-Realtime-2.1 High 的 79.1%。 这次测试显示它在多个分项上都领先:Big Bench Audio、Full Duplex Bench、Tau Voice 都是 Plus 版占优。但代价也很明显:首个音频输出时间偏慢,在榜单里属于较慢的一档。测试对象是阿里云上的中国区 endpoint。

Reddit 上有人分享了 《Zombie World | AI Black Comedy Music Short Film》,是一支带有僵尸末日讽刺感的 AI 黑色喜剧音乐短片。 它更像一个值得转发的奇观作品:重点不在技术发布,而在 AI 生成的视觉效果和荒诞设定本身。

TILT 用模型内生奖励提升组合式文生图 论文 TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward 关注的是文生图模型在处理复杂、多概念提示词时常见的组合失败问题。 方法本身是无需训练的 test-time 方案:通过修改采样轨迹来提升生成结果的组合一致性,而且奖励信号来自基础模型内部,不需要外部监督或单独的奖励模型。 作者把组合失败解释为联合分布与单概念分布之间的重叠模式,并据此推导出一个带 KL 约束的目标函数、闭式的 tilted target distribution,以及适用于扩散采样的引导步骤。 在 T2ICompBench 上,该方法在提升组合对齐的同时尽量保持图像质量;文中还发现,平衡两种引导策略的混合方案效果最好。