Fish Audio 成立一年发布 S2.1 Pro 语音模型
Fish Audio 回顾了自己成立一年的进展,称过去一年一直在努力把合成语音做得更接近真人语音,主要服务三类用户:创作者、需要做实时语音应用的开发者,以及追求规模化稳定质量的企业。 帖子强调,语音是最难“伪造”的模态之一,因为人耳会立刻捕捉到细微的不自然之处。这也是为什么语音被看作智能体和对话式软件的下一层关键接口。作为一周年节点,Fish Audio 发布了 S2.1 Pro,称其为目前最先进的语音模型。
07 月 29 日
106 条动态
Fish Audio 回顾了自己成立一年的进展,称过去一年一直在努力把合成语音做得更接近真人语音,主要服务三类用户:创作者、需要做实时语音应用的开发者,以及追求规模化稳定质量的企业。 帖子强调,语音是最难“伪造”的模态之一,因为人耳会立刻捕捉到细微的不自然之处。这也是为什么语音被看作智能体和对话式软件的下一层关键接口。作为一周年节点,Fish Audio 发布了 S2.1 Pro,称其为目前最先进的语音模型。
7月28日,TopviewAI正式推出Film Studio,将AI视频生成从传统的“反复抽提示词”升级为“像导演一样拍片”的精细化工作流。该产品为创作者提供了一个统一的无限画布环境,将3D布景、镜头调度、人物微表情控制、VFX特效及电影调色等核心要素整合在同一平台。此举大幅提升了AI影视创作的可控性,有效解决了以往工具控制力不足的痛点。
一条 Reddit 帖展示了用 img 2.0 生成的名人同框图:Elon Musk 和 Sam Altman 正在对话。 帖子本身没有更多技术细节,主要价值在于这是一个可转发的 AI 生成图片效果展示,偏梗图/名场面。

ComfyUI 0.29 是一次信息量很高的更新,重点集中在 视频处理、模型生态扩展和性能优化。 视频能力:新增流式视频转码,改为边处理边传输,不再把长视频完整缓存在内存里,显著降低内存占用;训练器、图像处理节点也补上了视频支持。 模型与集成:新增或更新了 GPT 5.6、Gemini 3.5 Flash、Gemini-Omni 修复、Claude Opus 5、字节的 audio-1.0-multilingual、HeyGen、Recraft V4.1 等节点,并将 Runway Gen3a 标记为弃用。 本地模型支持:扩展了 JoyImageEdit、Gemma4 12B、MageFlow、Uni3C ControlNet、Anima、FreSca、Krea 2、LTX 等支持。 性能:RMS RoPE、INT8、Latent Upsampler 等路径都做了优化。 系统/API:后台内存默认上调到 128 GB,Job ID 和 credit 头也开始向 partner nodes 透传。

这条帖子的核心信息是:整张专辑从头到尾都是用 AI 做的,作者点名用了 Suno,并半开玩笑地说现在配上一点混乱就能完成这样的创作。 上下文里还有一条引用回复,表示听众已经把专辑循环听了三次并很喜欢。整体更像是一个真实的 AI 音乐创作案例,带点圈内玩笑感。
这条帖配图在讲图像生成/排版的构图规范: 画面被拆成标题区、留白区、光影引导线和空间截景区几块,用来约束元素分布。 作者的核心意思是:即使透视和光线不完全正确,也能先把布局规则立住,让模型别再“瞎摆放元素”,从而提升整体可控性。

MODUS 提出了一种统一的 decoder-only any-to-any 多模态建模框架:同一个模型可以在任意模态组合之间做预测,把“任意模态作为输入、任意模态作为输出”这件事统一起来。 现有不少 any-to-any 方法依赖从头训练的 encoder-decoder 或 diffusion 架构;MODUS 试图直接复用强大的预训练 decoder-only 模型作为先验。 它把不同模态放在对称位置,不需要模态专属的 head、loss 或任务管线。 作者举了几个用途:例如通过中间模态做链式生成,或者用另一种模态来对生成结果做跨模态自验证。 论文称该方法在多个基准上表现出较强的即插即用能力,并且能和专用/多任务基线竞争。 项目材料已经开源。

这条 Reddit 分享了一个基于 ComfyUI + KREA 2 Identity Edit v1.2 的实战教程,重点是低显存下的身份保持式图像编辑。 这个工作流强调在修改 姿势、表情、风格 时,尽量保持人物面部身份一致。 还覆盖了 换脸、虚拟试穿、局部重绘(inpainting) 和 扩图(outpainting)。 作者表示流程比较简单:载入参考图、输入编辑提示词,然后直接运行工作流。 原帖同时附了工作流文章链接和 YouTube 教程视频。

- 这条 Reddit 展示了一个用 GPT Image 2 做出的 3×3 单图分镜:同一位飞行员从早晨喝茶,逐步走向机甲大战。 作者强调关键不是“多张图拼接”,而是先设定 严格的九宫格结构,让开头、中段、结尾按顺序推进,九格读起来像一个完整动作弧线。 通过统一的 3D CG anime 风格、角色外观、服装和光照,整张图保持了一致性,变化只体现在剧情推进上。 这被作者视为一种可复用模板:用一张图压缩完整的动作叙事。

这条帖子在分享一个强化沙特本土文化感的图像提示词,并给出了生成结果。 被引用的原始 prompt 先是“埃及女人坐在尼罗河岸边”的构图,但作者说明他们修改了提示词,以更好呈现“authentic Saudi heritage”与传统细节。 配图展示的是一组带有传统阿拉伯服饰、庭院建筑、咖啡器具和夕阳色调的风格化生成图,重点在于通过 prompt 微调,明显改变图像的文化指向与视觉效果。

Twelve Labs 认为,视频不能简单当成“逐帧图片”或“带时间戳的转录文本”,因为运动、因果和时间推进本身就是信息。James Le 在 Vector Space Day SF 上指出,视频系统常见三类失败:上下文错误、记忆错误、推理错误;并介绍了对应的技术栈:Marengo 负责视频检索,Pegasus 负责把检索到的片段转成结构化答案,Jockey 作为面向视频语料工作流的 agentic framework 和记忆层,底层由 Qdrant 提供存储与检索。

- 同事做了一个“空耳沙雕 skill”:输入一段音乐,系统会自动生成并剪辑成一支搞笑 MV。 这更像是一个轻量的 AI 创意 demo,重点在于好玩、离谱和可转发,而不是严肃产品发布。
Fish Audio正式发布面向生产环境的语音克隆模型S2.1 Pro,并宣布完成5200万美元种子轮融资。该模型仅需5至10秒音频即可高保真克隆声音,首音延迟低至90ms,支持83种语言。官方数据显示其速度达Cartesia两倍,成本仅为ElevenLabs六分之一,公司年经常性收入已达2100万美元。
近日一位 Reddit 用户使用 Claude Opus 5(即 Claude Code)耗时约 9 小时,消耗近 400 万 token,成功开发出一款名为 SNOWFLOW 的浏览器端 WebGPU 雪地仿真 demo。该项目从架构规划到 Babylon.js 与 WGSL 实现均由 AI 完成。该 demo 在单标签页内实现了接近 AAA 级别的画面效果,包含数百万雪粒子、布料物理及可交互的魔法特效,充分展现了 AI 在复杂图形学编程上的巨大潜力。

Magnific 宣布把完整套件原生接入多个主流创意编辑器,让用户可以直接在熟悉的软件里跑它的 AI 工作流。 视频侧覆盖 After Effects、Premiere Pro、DaVinci Resolve、Final Cut Pro。 设计侧覆盖 Photoshop、Illustrator、InDesign、Figma。 官方强调同一个账号和 credits 可以跨编辑器复用,用户只需一次登录。 文案里还提到支持 Microsoft Office,整体定位更像是一层横跨创意软件与办公软件的 AI 工作流层。
- PrunaAI 开源了 PrunaVAED,它是 LTX-2.3 视频生成解码器的可直接替换版本。 官方给出的效果是 1.7×–2.1× 的解码加速、约 50% 的峰值显存下降,同时还能保持接近原版的视觉质量,且 latent 格式不需要改动。 项目页给出了基准测试、对比样例和 Diffusers 快速接入方式,说明它既可以作为开源集成,也可以作为更快的视频生成服务端点使用。
SmartPhotoCrafter 是一个自动摄影图像优化框架,目标是让模型先判断照片哪里有问题,再决定如何修复与调色,而不需要用户手动下修图指令。系统分成两部分:ImageCritic 负责分析图像质量、输出结构化建议和评分;PhotographicArtist 负责生成增强后的图像。论文还给出三阶段训练路线:先分别预训练,再做基于推理表征的对齐,最后进行联合强化学习,以提升修复和摄影级调色能力,同时尽量保持内容一致性。
这篇论文在质疑一个常见前提 作者重新审视了多模态自动事实核查(MAFC)里一个很常见的假设:只要把测试样本换成“模型知识截止日期之后”发布的声明,就能得到“无污染”的动态评测。 他们同时检查了静态基准 AVeriTeC 和新构建的动态基准 ClaimReview2025Q4,发现: 即便是截止日期之后的声明,仍有 17.09%–29.30% 可能存在污染风险; 很多“新声明”其实可以仅凭截止日期之前已有的公开知识直接验证,或者通过拼接多条旧信息推导出来; 污染会显著抬高评测成绩,Macro-F1 最多虚高 11.34 分,还会扭曲系统排名。 论文最后在更严格的去污染设置下重新评估了 SOTA 模型,并给出了一套更可信的多模态事实核查评测建议。
ComfyUI 展示了创作者 seungho__yeo 用一个工作流,在 1 小时内完成一段日漫风格的 2D 动画序列:从海报图、分镜帧,到转场、动画和最终渲染。 这条内容的核心不只是成片效果,而是端到端流程被压进一个工具里:原本要切换多个应用的任务,现在可以在同一工作流中完成,体现了 ComfyUI 在多模态创作管线上的整合能力。
Runway 官方近日预告,其视频生成产品栈即将迎来新一轮更新,Seedance 2.5 版本预计将于 7 月 31 日正式发布。虽然目前的预告消息并未披露具体的参数或新增能力细节,但这已明确释放了版本迭代的信号,意味着该系列视频生成工具即将迎来重要升级。
一支酒店设计团队把 Kimi K3 通过 MCP 接到建模软件里,用蓝图照片加自然语言说明,直接生成并协调机电模型。 目标是一座 190 间客房的酒店,施工前需要先把风管、给排水、电气和消防系统全部建模协调好。 帖子给出的对比是:旧流程要 3 名工程师 / 6 周 / 约 4.7 万美元;新流程变成 1 名工程师复核 AI 输出 / 9 天 / 约 1.05 万美元。 文中还称,这类协调模型一旦进入施工阶段,可把变更单减少 60% 到 80%。 原文顺带提到一个更小的示例:Kimi K3 + Blender MCP,模型可以自己搭三维场景、看效果并修正错误。
Dreamina 预告 Seedance 2.5 即将上线,方向不是单纯“提示词出片”,而是把 AI 视频往更可控的创作流程推进。 帖子给出的具体能力包括: 单次生成可使用最多 50 个多模态参考 支持最长 30 秒的连续视频输出 可通过白模和绿幕参考实现类似 R2V 的控制 从一次性生成,转向更完整的多步骤创作管线
有用户发现,Netflix 在纪录片《The Investigation of Lucy Letby》中,没有采用传统的模糊面部处理,而是使用 Deepfake 技术将受访者的脸替换成了 AI 生成的面孔。 该用户对此表示强烈反感,认为平台应当像标注「吸烟、暴力」一样,为这种「AI 生成内容」添加明确的免责声明,避免误导观众。

KRAFTON AI 与 SK Telecom 联合发布了从零训练的 210 亿参数语音大模型 A.X K2 Raon-Speech。该模型支持语音理解等功能,并在韩语相关榜单上取得了第一名的成绩。