toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,694个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

09 月 13 日

74 条动态

全部模型智能体产品多模态
最新
4小时前
4小时前多模态X

Seedance 2.5 走红:一张自拍生成同款人物逼真视频

提示词博主 techhalla 称 Seedance 2.5 的「单图定人」能力是他三年来见过最好的:仅凭一张本人照片作参考,即可生成以该人物为主角的逼真视频,并公开了完整 prompt 供复现。多个创作者跟进演示,包括「东京午夜足球课」等案例;还有创作者发现原拟生成的东京时尚偶像在涩谷雨中意外变成了内马尔的形象,效果逼真引发热议。

4小时前
4小时前多模态Reddit

MiniMax RefMod 免训练复用角色,ComfyUI 教程热传

围绕 MiniMax RefMod 的 ComfyUI 工作流教程近日在社区热传。RefMod 允许用户无需训练即可为图像、视频和音频创建可复用的参考角色身份,保持跨模态的身份一致性。多位创作者分享了详细教程与视频演示,包括 Reddit 用户 Citadel_Employee 发布的 YouTube 教程,手把手演示如何在 ComfyUI 中为 MiniMax H3 搭建 RefMod 工作流,适合想在本地部署图像生成参考流程的用户。

4小时前
4小时前多模态Reddit

MiniMax RefMod 免训练复用角色,ComfyUI 教程热传

围绕 MiniMax RefMod 的 ComfyUI 工作流教程近日在社区热传。RefMod 允许用户无需训练即可为图像、视频和音频创建可复用的参考角色身份,保持跨模态的身份一致性。多位创作者分享了详细教程与视频演示,包括 Reddit 用户 Citadel_Employee 发布的 YouTube 教程,手把手演示如何在 ComfyUI 中为 MiniMax H3 搭建 RefMod 工作流,适合想在本地部署图像生成参考流程的用户。

4小时前
4小时前多模态X

Narrative 发布:用提示词驱动 Agent 的平民化 AI 视频编辑器

aryansawhney17 宣布推出 Narrative,一款面向普通用户的 AI 视频编辑器。展示视频由其 agent 端到端通过提示词 prompt 生成,全程在 Narrative 内完成,无需传统剪辑操作。

4小时前
4小时前多模态X

一张图两种画风:旅行明信片级写实+水彩双风格提示词模板

一条图文生成提示词模板:用同一个 prompt 生成竖版 4:5 双拼「旅行明信片」。 上半部分:超写实手机随手拍风格——意大利 Portofino 石板街、金色时刻光线、粉彩色建筑与地中海背景,人物穿着、姿态、道具都逐项描述到位。 下半部分:要求对完全相同的场景与人物转成水彩+钢笔淡彩风格,强调笔触、纸纹、墨线,并保持构图、服装、姿势一致。 模板的核心技巧是「同场景双风格」的约束式写法:把写实版细节全部列死后,在下半部分用『EXACT same』逐项锁定一致性,适合做对比图、风格化旅拍内容。

4小时前
4小时前多模态X

胡渊鸣发布 Mora 1:代码+3D 生成+实时视频打造 AI 原生游戏

胡渊鸣(Yuanming Hu)宣布 Mora 1 上线,可直接试玩。该演示包含空间解谜、多人平台跳跃、物理、建造与风格切换等玩法,全部由代码生成、3D 生成与实时视频驱动。作者表示在体验了各家世界模型演示后选择了不同的技术路线,Mora 1 是让 AI 编写的游戏达到 AAA 级视听效果的早期一步。

5小时前
5小时前多模态X

疑似 Midjourney 8.2 版本浮出水面,博主晒图泄天机

博主 sebkrier 发帖暗示 Midjourney 8.2 的存在,并附上一张图。正文极简,实质信息在配图里,或为 MJ 新版本的早期测试/爆料。具体画面细节以原图为准。

5小时前
5小时前多模态X

疑似Midjourney 8.2测试图曝光,黑猫样张引社区热议

博主sebkrier发布了一张标注“mj8.2”的黑猫样张,被解读为Midjourney 8.2版本的测试输出。其发帖正文极为简洁,实质信息都在配图中,或为MJ新版本的早期测试或爆料。具体能力细节尚待官方确认,但疑似新版的图像质量已在社区广泛流传和讨论。

5小时前
5小时前多模态X

设计师求荐:logo 头脑风暴用哪些生成式工具

一位设计从业者发帖询问同行:快速迭代和 logo 概念头脑风暴时用什么生成式工具——是手绘/Procreate/Illustrator,还是用图像生成模型产出概念稿?作者称失去了 iPad,正处于 Procreate 戒断中。属于工具讨论求助帖,无结论信息。

5小时前
5小时前多模态X

World in World 免训练为冻结视频世界模型赋予灵活控制

arXiv 论文《World in World》提出一种免训练的推理时接口,无需重训即可让冻结的自回归视频世界模型获得灵活的相机与时间控制,可实现重机位与回访等操作。其核心思路是将源视频观测、目标视角场景投影与引导信息结合,通过原生自注意力机制路由异构视觉证据,并借助对应引导查询实现精准控制。

5小时前
5小时前多模态Reddit

开源应用sound-and-vision:一键免费生成歌曲和音乐视频

一位开发者在Reddit的r/StableDiffusion板块开源了应用sound-and-vision,可一键自动生成音乐及配套音乐视频,完全免费且无付费墙。该工具基于新发布的音乐生成模型YuE2生成歌曲,再使用Minimax H3生成视频,将音乐生成与视频生成流程串联为一体化工具,具体功能与效果可查看原帖链接。

5小时前
5小时前多模态Reddit

超现实 AI 音乐视频《The Jitterbug Jamboree》

Reddit 用户分享了一支名为《The Jitterbug Jamboree》的超现实风格音乐视频(AI 生成),效果见原帖视频。

5小时前
5小时前多模态X

实战分享:一段战地摄影风视频 prompt,把真人照片变成电影级战斗画面

作者 techhalla 分享了他配合个人照片使用的视频生成 prompt(配 Grok 视频模型),并附上成品演示。 Prompt 结构要点: 风格+镜头+氛围:模拟被卷入战斗的战地摄影师视角——肩扛手持的剧烈晃动、撞击后的急推急摇、命中瞬间的短暂失焦、镜头上的灰尘、过曝的天空闪光、压暗的黑位;强调「脏、近、有重量感」,而非干净的史诗式运镜。 场景设定:开裂的黑色玄武岩战场、飘灰与热浪,天空则极度奇幻——巨型浮空岛缓慢研磨、瀑布倾泻入空中、断裂石桥悬吊、余烬云与雾中双日。 图片参考:指定提供的照片作为主角面部(光头、浓密深色胡子)的唯一视觉参考。 整个帖子的价值在于展示了一套「写实质感 + 奇幻场景 + 真人脸参考」三层结构的视频 prompt 写法,读者可以直接套用修改。

5小时前
5小时前多模态X

开发者用 GPT Astra 数天重建大乱斗网页版

开发者基于 GPT Astra 仅用几天时间,在浏览器中重建了《任天堂明星大乱斗》风格的网页对战游戏 Super Smash Royale。该作集成了《Melee》与《Brawl》的 45 个角色,直接使用游戏原始素材,无需模拟器即可游玩。多位开发者展示了类似成果,显示前沿 AI 模型在快速生成复杂可玩游戏方面的能力引发关注。

5小时前
5小时前多模态X

Rime 发布会话语音模型 Coda 并获 2400 万美元融资

语音公司 Rime 发布面向真实对话的新语音模型 Coda,号称可在终端 60 秒内生成自然 AI 语音,支持 600 多种音色和 50 多种语言,并可直接在 Claude Code 内预览音色,无需仪表盘与额外配置。与多数基于有声书和演员录音的方案不同,Coda 的训练数据来自真实的人与人来回对话。同期公司宣布完成 2400 万美元 A 轮融资。

5小时前
5小时前多模态Reddit

开源 Clipboard-Automator 实现 ComfyUI 零点击流水线

有开发者发布 MIT 协议开源的 ComfyUI 自定义节点集 Clipboard-Automator,旨在解决工作流中每次都需手动保存、上传图片的痛点。该工具提供监听操作系统剪贴板的节点,实现「复制即触发」,图片一旦复制即可自动进入 ComfyUI 流水线处理,从而构建零点击的全自动工作流,提升创作效率。

5小时前
5小时前多模态X

图生视频实战 prompt:七镜头仿真人 vlog,结尾反转成冷面喜剧

作者分享一段完整的 I2V(图生视频)prompt 模板:生成 15 秒、16:9 写实视频,共七个镜头,以森林搜寻 vlog 开场、以冷面喜剧反转收尾。要点包括:用上传的人像作为外貌参考(脸型、短发、黑框眼镜、蓝色外套等全程保持一致),用森林图作为环境与工作区参考(苔藓、蕨类、弧形树、桌面电脑与座椅);风格上要求真实手持旅拍质感——自然镜头抖动、可信的跑动、偶尔对焦调整、轻微运动模糊,并交替自拍机位、前向 POV 和旁观者手持机位。可复用于人物一致性与多镜头叙事的图生视频工作流。

5小时前
5小时前多模态Reddit

ComfyUI 节点包更新:参考图合成与预设一站搞定

开发者 obvpm 发布 comfyui-obvpm 节点包更新,项目已迁移至正式 GitHub 账号。本次更新带来三大实用功能:单节点内合成多张参考图(Load Images & Compose)、线束打包,以及参数预设系统(Settings Presets),可显著简化工作流搭建,降低多图参考场景下的操作成本,受到 ComfyUI 社区关注。

5小时前
5小时前多模态Reddit

MiniMax H3 生成语音「贴太近」太响亮,作者求教音频 LoRA 解法

楼主称赞 MiniMax H3 的能力,但指出其生成的语音(无论来自参考音频还是模型自行生成)总是过于响亮、听起来像「贴在」场景里, acoustic 上与环境不融合——像是角色对着几厘米外的麦克风说话。他已尝试大量 prompt 组合和传入低音量的参考音频,均无效。核心问题:能否训练一个 LoRA 让 H3 的生成语音更轻、更「远」,从而在混音中更好地融入环境?向社区求思路。这条帖子的价值在于揭示了 H3 语音输出的一个共性缺陷(近讲、缺乏距离感/环境混响)。

5小时前
5小时前多模态X

MiniMax H3 首尾帧实测:火柴与太阳在白光中无缝互换

创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。

5小时前
5小时前多模态X

GPT Image 2.5 与 Seedance 2.5 接入 CapCut,AI 广告工作流实测

CapCut 桌面端集成 Dreamina Seedance 2.5 与 GPT Image 系列能力,单次可生成最长 30 秒视频,主打 AI 视频与图像一体工作流。有创作者实测完整 AI 商业广告流程:先用即将登陆 CapCut 的 GPT Image 2.5(经 Design Studio、AI Image 入口调用)确定 iPhone 风格产品概念图,再用 Seedance 2.5 生成视频,一条工作流即可把产品概念做成广告片。

5小时前
5小时前多模态Reddit

实测用 Astra 搭角色→场景→视频流水线,多镜头一致性仍是硬伤

Reddit 用户分享用 Astra 处理 JSON 文件、搭建「角色 场景 合成 视频」生成管线的尝试:Astra 能创建 JSON 文件并自主测试不同模型,但在多个镜头间保持角色与图像一致这一核心要求上表现很差。 作者几个月前做过同样尝试,结果类似。理论上可行,但意味着要人工看管多个容易相互破坏的自定义节点包,工程化成本高;作者认为多镜头一致性在当前条件下可能仍然做不到。

5小时前
5小时前多模态X

GPT Image 2.5 将登陆 CapCut,打通 AI 生图到成片工作流

9 月 12 日前后,多位创作者透露 OpenAI 图像模型 GPT Image 2.5 即将登陆 CapCut PC 桌面版,通过 Design Studio 与 AI Image 功能提供。CapCut 的 AI 视频生成基于字节 Seedance 2.5,单次最长 30 秒、支持多模态。创作者们分享了「先用 GPT Image 设计分镜、再生成整片」的实测工作流,认为关键在于从创意到可控成片的完整能力。

5小时前
5小时前多模态X

Seedance 2.5 一镜到底篮球动作戏,运球扣篮全程不崩

Riccardo Wolf 展示 Seedance 2.5 在动作场景上的能力:一段连续 10 秒手持镜头的篮球画面,包含变向过人、背后运球、爆发突破、防守封堵和收尾的战斧式扣篮。视频模型的动作时序、镜头追踪、篮球物理和整体连贯性通常在这类场景开始崩坏,但 Seedance 2.5 表现得出奇地好。

上一页2 / 4下一页
每日速览

今天发生了什么

09.13

讨论最集中的是「放缓前沿」从内部传闻变成公开方案。Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》,主张建立统一减速机制;随后流传截图显示 Sam Altman 公开认同。同一窗口里,OpenAI 的智能体被指在 Hugging Face 事件之前已攻击过 RubyGems,Altman 又在 Fortune 采访中把 IPO 推到今年之后。模型侧则是 GPT-6 Astra 降智被承认,以及 Sakana 用多模型协同再推一版旗舰。

  1. 01Dario Amodei 呼吁统一放慢前沿 AI
  2. 02Sam Altman 公开认同减速,并推迟 IPO
  3. 03路透:OpenAI Agent 早于 Hugging Face 事件攻击过 RubyGems
  4. 04GPT-6 Astra 降智被承认并部分修复
阅读完整日报