toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

154 条动态

全部模型智能体产品多模态
最新
20小时前
20小时前多模态X

Stream3D 用有界记忆把冻结 3D 生成器变成流式模型

Stream3D 被 CVPR Workshop 接收,研究的是如何从单目流里做长时序 3D 资产生成。它把冻结的 3D 生成器包装成流式生成器,用 evidential memory 维持几何和外观一致性,而且不需要重新训练。 项目强调三个点:常数级内存占用、长序列一致性更好、以及一个训练无关的 wrapper,会为每个 3D token 选择最有证据价值的历史视图。项目页还给出了在 GSO 和 NAVI 上的定量提升。 基于冻结单视图 3D 生成器的训练免费包装器 跨 chunk 的内存有界,与序列长度无关 按 token 选择最相关历史视图

20小时前
20小时前多模态X

创作者用 Agent One 做出 90 秒电影感恐怖预告

一位创作者用 Agent One 做出了一支 90 多秒的电影感恐怖预告片,而且不是单镜头直叙,而是按真正的电影 teaser 方式剪成了碎片化场景。 叙事围绕“主角在精神病院醒来、所有人都消失了、黑暗中有东西在靠近”展开。 创作重点是通过递进式紧张感、诡异对白和反复出现的怪物,模拟真实电影预告的节奏。 原帖还表示会继续公布这支 trailer 的完整制作流程。

21小时前
21小时前多模态X

AI 生成图从写实改到丝网印刷,因摩尔纹被迫收手

Emollick 讲的是一张 AI 生成图的风格迭代过程: 最初版本偏写实。 他要求更有创意后,模型改成了双色漫画风。 但那样会产生太多摩尔纹,所以最后改成了更像 丝网印刷 的风格。 他自己最重要的建议,是把戒指部分的灵感改成 Klimt。 配图展示了多个风格实验版本,包括最终更像海报印刷的效果。

21小时前
21小时前多模态X

Magnific 实现一站式视频与配乐生成工作流

Magnific Spaces 展现了其作为多模态创作工具的强大“一站式”能力。创作者们不仅利用该工具生成了具有低沉工业噪声风格的音轨,还通过名为“ASHES SEQUENCE”的拼接工作流,制作出包含连贯角色、世界观和道具的 60 秒长视频。这表明单一工具链已能独立完成从影像到配乐的完整复杂创作。

21小时前
21小时前多模态X

Magnific Spaces 演示 60 秒连贯同角色场景

作者先指出:做出一个 5 秒 AI 片段 很容易,但要让 60 秒长场景 在同一角色、同一世界观、同一关键道具下保持连贯,就难得多。 他用 Magnific Spaces 做了整套流程。 叙事设定是:一个快递员、一个濒死的火山殖民地、一个密封箱子。 帖子强调会公开完整工作流,并提供了可直接尝试的入口。

21小时前
21小时前多模态X

Fish Audio 开源 S2:用 1000 万小时音频训练的可控 TTS

Fish Audio 开源了 S2,这是一款强调 语音情绪与韵律细粒度控制 的 TTS 模型。 它支持在文本中插入自然语言式控制指令,例如 [laugh]、[whispers],也可以用类似 [professional broadcast tone] 这样的开放式描述,把控制放到具体词或短语位置。官方称该系统在约 50 种语言、超过 1000 万小时 音频上训练,并结合了强化学习对齐与双自回归架构。发布内容还包括模型权重、微调代码和基于 SGLang 的流式推理引擎;文中给出的基准结果显示,它在若干评测上超过 Seed-TTS、MiniMax-Speech 以及 gpt-4o-mini-tts。

21小时前
21小时前多模态X

“以前一切都很简单”调侃早期 Illusion Diffusion 时代

这条用“以前一切都很简单”来接一个关于 Illusion Diffusion 的引用,后者被称作建立在早期 QR Code LoRA 技巧上的“时代性应用”。 整体语气更像是在怀念图像生成早期的单纯和惊艳:那时候一个小技巧就能做出刷屏效果,如今这个领域已经复杂得多。

21小时前
21小时前多模态X

Claude 加 Kling MCP,一张图就能生成四种电影感视频

这条帖介绍了一个可复用的 multishot-quartet 技能:把 一张图 自动扩展成 4 个电影感不同的视频方向,几乎不需要手工提示词。 它基于 Claude + Kling MCP。流程是先加载一次 skill,之后每次上传图片,系统会先分析画面,再提 4 个问题,然后并行发起 4 个 image_to_video 任务,分别走不同的 cinematic register。原帖还附了可直接复制的完整 skill prompt。

21小时前
21小时前多模态X

实测Invideo Agent One仅靠对话生成电影感预告片

Invideo推出的Agent One工具展示了其强大的对话式视频生成能力。多位用户实测表明,只需提供核心创意,通过多轮自然语言对话进行持续反馈,该工具就能从零开始打磨出完整的故事线、视觉世界、氛围、镜头运动和节奏,最终端到端生成一支极具电影质感的预告片。

21小时前
21小时前多模态X

Claude 结合 Higgsfield MCP,把奥德赛神话做成 40 秒电影视频

一位创作者称,只给 Claude 一张角色设定表,再接上 Higgsfield MCP,就能把奥德修斯神话直接做成一段 40 多秒的电影感视频。 Demo 里是一位美丽的塞壬唱歌,引诱整船船员走向沉船。 作者强调,不需要手工拆提示词。 这套流程被包装成「Claude + Higgsfield MCP」的神话到电影生成工作流。

上一页7 / 7
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报