toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

110 条动态

全部模型智能体产品多模态
最新
4小时前
4小时前多模态X

Kimi K3 通过 MCP 建 190 间酒店模型,工期缩至 9 天

一支酒店设计团队把 Kimi K3 通过 MCP 接到建模软件里,用蓝图照片加自然语言说明,直接生成并协调机电模型。 目标是一座 190 间客房的酒店,施工前需要先把风管、给排水、电气和消防系统全部建模协调好。 帖子给出的对比是:旧流程要 3 名工程师 / 6 周 / 约 4.7 万美元;新流程变成 1 名工程师复核 AI 输出 / 9 天 / 约 1.05 万美元。 文中还称,这类协调模型一旦进入施工阶段,可把变更单减少 60% 到 80%。 原文顺带提到一个更小的示例:Kimi K3 + Blender MCP,模型可以自己搭三维场景、看效果并修正错误。

4小时前
4小时前多模态X

Dreamina 预告 Seedance 2.5:50 个多模态参考,30 秒视频

Dreamina 预告 Seedance 2.5 即将上线,方向不是单纯“提示词出片”,而是把 AI 视频往更可控的创作流程推进。 帖子给出的具体能力包括: 单次生成可使用最多 50 个多模态参考 支持最长 30 秒的连续视频输出 可通过白模和绿幕参考实现类似 R2V 的控制 从一次性生成,转向更完整的多步骤创作管线

4小时前
4小时前多模态X

Netflix 涉嫌滥用 Deepfake,纪录片用 AI 换脸引争议

有用户发现,Netflix 在纪录片《The Investigation of Lucy Letby》中,没有采用传统的模糊面部处理,而是使用 Deepfake 技术将受访者的脸替换成了 AI 生成的面孔。 该用户对此表示强烈反感,认为平台应当像标注「吸烟、暴力」一样,为这种「AI 生成内容」添加明确的免责声明,避免误导观众。

4小时前
4小时前多模态X

KRAFTON 与 SKT 发布 210 亿参数语音大模型

KRAFTON AI 与 SK Telecom 联合发布了从零训练的 210 亿参数语音大模型 A.X K2 Raon-Speech。该模型支持语音理解等功能,并在韩语相关榜单上取得了第一名的成绩。

4小时前
4小时前多模态X

Google 开源可控身份与表情的 3D 人头模型

Google 提出并开源了 GNM Head,这是一个基于大量 3D 扫描数据训练的参数化人头生成模型。与传统仅建模外轮廓的模型不同,GNM Head 细致覆盖了眼球、舌头等内部结构,能够实现对身份、表情和头部姿态的细粒度可控建模,并提供了相关代码库。

5小时前
5小时前多模态YouTube

NVIDIA 推出统一 3D 补全与编辑模型 Axolotl3D

NVIDIA 空间智能实验室发布了名为 Axolotl3D 的统一 3D 生成模型。该框架能够利用图像和点云等不完整观测数据,进行 3D 形状的补全与编辑。这一方法将以往分离的 3D 补全与编辑任务整合到了单一模型中,有效提升了 3D 生成与处理的效率与灵活性。

5小时前
5小时前多模态X

网友测试 Midjourney v8.2 自造词生成超现实图像

近期有创作者在 Midjourney v8.2 中尝试使用“imaginery tokens”(自造词)作为提示词进行实验。通过将这些虚构词汇作为核心指令输入模型,测试其反应并生成了多种超现实风格的图像。多位用户随后跟进分享了更多例图,进一步展示了这种新奇提示词玩法在 AI 绘画中的独特视觉效果。

5小时前
5小时前多模态Reddit

ComfyUI-muscriptor 主打零依赖,开始被社区拉出来测试

Reddit 用户转发了 jtydhr88/ComfyUI-muscriptor,强调它主打 “零额外 Python 依赖”。发帖人表示先把它分享出来,方便大家对比这个 ComfyUI 节点项目的功能并在评论区贴测试结果。 配图展示的是该 GitHub 仓库页面:项目规模不大,但至少已经作为一个可用的 ComfyUI 相关节点被拿来试用和讨论。

5小时前
5小时前多模态Reddit

Depth Anything V2 深度动作图测试 Seedance 2.0 换角

作者测试了一条多模态工作流:先把一段不到 15 秒的攀爬/跑酷参考视频转成 Depth Anything V2 的深度图,再把这份动作参考连同一个新生成的合成角色一起喂给 Seedance 2.0 做最终渲染。 他们的结论是:贴墙、重心转移、全身动作都比较完整地保留下来了,而这些通常正是换角色流程最容易崩的地方。作者还提到,本地深度转换器是用 GPT 5.6 Sol 搭的,并认为这套方法对舞蹈和武术动作也会有类似效果。

5小时前
5小时前多模态Reddit

有人在找真正适配 Qwen Image Edit Rapid AIO 的写实 LoRA

一位重度 Qwen 用户在寻找 适配 Qwen Image Edit Rapid AIO 的写实 LoRA,因为生成结果还是有点“塑料感”或半写实感。 发帖人也吐槽了一个常见痛点:很多 LoRA 作者没有清楚标注到底适配哪一个 Qwen 版本,导致自己下载了不少文件,最后发现根本不兼容。

5小时前
5小时前多模态X

Emad Mostaque 用电影级提示词实测 Flux 3

Emad Mostaque 评价 Flux 3“相当厉害”,并贴出了一个很长的测试提示词:女宇航员在摄政风舞会中穿行、墙上有 Rothko 风格壁画、骑士和忍者徒手对打、最后还要走到一扇描绘花与蛇的彩窗前。 这条帖子的重点不是发布信息,而是对模型图像生成能力的实测反馈:它展示了 Flux 3 在复杂镜头调度、场景连贯性和视觉想象力上的表现。

5小时前
5小时前多模态Reddit

GPT 加 Seedance 把海崖场景做成了莫奈风格画作

楼主分享了一张用 GPT + Seedance 生成的作品,标题是 Monet's Cliff。 帖子本身没有展开技术细节,主要是在展示生成结果:一幅明显带有莫奈风格的海崖风景图,属于典型的多模态生成作品分享。

5小时前
5小时前多模态Reddit

Gemini Nano Banana Lite 2 做出的肚皮舞动作迁移演示

用 Gemini Nano Banana Lite 2 做的肚皮舞动作迁移演示 这条帖子展示了一个 motion transfer 演示:把动作迁移到肚皮舞角色上,效果以视频形式呈现。 作者说明成品是用 SCAIL2 Motion Transfer 配合 Gemini Nano Banana Lite 2 生成的 init image 做出来的。配图则是演示中使用的舞者形象,整体更像是一条多模态工作流实测,而不只是单张图生成。

5小时前
5小时前多模态X

Flux 3 视频生成实测:分屏双机位一致性领先

近期多位创作者实测了 Flux 3 的视频生成能力,发现其在复杂的分屏与双机位场景中表现突出。测试表明,Flux 3 能在左右分屏中实现同一事件的逐帧同步,并在严苛的双路监控视角测试中保持人物、物体与时间戳的一致性。多位测试者认为其在该特定任务上的表现明显优于其他视频模型。

6小时前
6小时前多模态X

Midjourney 新风格配完整参数,生成图像风格鲜明

分享的是一个 Midjourney 新创建风格 及其提示词参数:--chaos 7 --ar 3:2 --sref 1835916550 --sw 500 --stylize 500 --hd。 这条帖子本质上是一个风格展示,不是产品发布;配图给出了多张生成效果,能直观看到这种风格的视觉表现。

6小时前
6小时前多模态Reddit

ComfyUI 的 FreeU 节点号称无需重训也能提升画质

这条内容介绍了 ComfyUI 里的 FreeU 节点,主张它能明显改善 AI 图像质量。 文章说 FreeU 通过类似傅里叶变换的处理,增强低频成分、抑制高频噪声。 它的卖点是帮助提升结构一致性和色彩平衡。 重点在于:不用重新训练模型,也能靠一个节点改善出图效果。

6小时前
6小时前多模态X

GeoFace 用几何约束扩散保持单图多视角人脸一致性

KAIST 团队提出 GeoFace,一种带几何约束的多视角扩散框架,目标是从单张输入生成一致的人脸多视角图像。 方法会同时生成多视角 RGB 图像和共享的 canonical UV position map,把 3D 结构约束显式注入生成过程。 结构上采用双流架构,并通过几何引导的注意力对齐,让外观与几何在不同视角下保持一致。 论文声称,这种设计在大姿态变化下比以往方法更稳,几何一致性更好。 应用场景包括 3D 重建、数字人和沉浸式内容创作。

6小时前
6小时前多模态Reddit

LTXV2.3 口型同步测试展示图像音频联动镜头运动

- 作者用 LTXV2.3 做了一次 lip-sync(口型同步) 测试,重点想验证:图像+音频生成 不仅能不能对嘴,还能不能处理镜头移动。 这套流程基本照搬 Civitai 上现成工作流,作者提到自己额外在跑的是 EROS V4-B16。 这条内容带明显的自嘲和搞笑气质:作者坦言只是随手测试,还把效果里的角色戏称成 “Fatty Sean Paul / Shaggy Paul”。 对有类似设备的人也有参考价值,原帖附了可复用的工作流链接,并提到 RTX 3060 12GB 也能跑。

6小时前
6小时前多模态X热度 6.7

Flux 3通过“海獭黑客”测试展现视频生成飞跃

Emad Mostaque使用经典的“海獭在飞机上用笔记本电脑”提示词对Flux 3视频模型进行了测试。结果显示,经过两年的迭代,Flux 3已能轻松驾驭这一复杂场景,甚至能将其拓展为充满1990年代动作片风格的“海獭黑客”变体,充分展现了AI视频生成技术在细节把控和创意表现力上的肉眼可见的进步。

6小时前
6小时前多模态X

GPT-5.5 与 Suno 合作专辑上线主流流媒体平台

一张完全由 AI 工作流参与制作的专辑已成功上架 Spotify 和 Apple Music 等主流流媒体平台。该专辑的歌词主要由 GPT-5.5 和 Claude 生成,随后交由 Suno 完成作曲与风格标签的制作。作者特别感谢了发行商 DistroKid 接受 AI 音乐,其中由 GPT-5.5 创作的歌曲甚至成为了专辑中播放量最高的曲目。

6小时前
6小时前多模态X

黑白机器人绅士图,把一张 AI 图做成了梗

这是一条带强烈视觉梗感的帖子,配图是一张黑白风格的“绅士机器人”形象:西装、礼帽、墨镜,整体很像 AI 生成图或 AI 圈审美梗图。 正文没有提供事实信息,主要作用就是“看一眼就忘不掉”的视觉玩笑;真正的传播点在图片本身。

7小时前
7小时前多模态Reddit

Reddit 视频把 AI 写的节拍做成了舞台演出

- 这条 Reddit 视频展示了一段“由 AI 写出来的酷炫节拍”演出,配图是一个舞台表演场景。 重点不在技术发布,而在 AI 生成音乐 + 夸张现场表演 的组合效果,属于很适合转发的多模态趣味内容。

7小时前
7小时前多模态Reddit

从 AI 参考图到 Fortnite 可骑乘迅猛龙,最终模型 2.8 万面

一位 Reddit 创作者分享了自己把AI 参考图一路做成 Fortnite 里可骑乘机械迅猛龙的完整流程,细节非常工程化。 他的流程大致是:先用 Grok Imagine 生成参考图,再用 Nano Banana Pro 修掉一个关键细节;随后进入 image-to-3D 工具生成基础几何体,再用 Hunyuan 3D Studio 做低模重拓扑和 UV 展开;贴图与放大阶段则交给 Trellis2 + ComfyUI,最后由 Blender 完成清理、绑定和权重绘制。 几个实用经验: 在 3D 化之前先把身体拆成多个部件,能明显改善几何体控制 最终模型约为 28K triangles 进入 UEFN 后,靠 Unreal Engine 的 retargeting 工具实现了移动和骑乘 目前还剩硬表面抖动、贴图和权重绘制流程优化等问题

7小时前
7小时前多模态X

Codex 先剪辑调色,再在聊天里生成交互式前后对比报告

- 发帖者先让 Codex 对一段视频进行编辑和调色。 随后又用自己做的 生成式 UI skill,在聊天界面里生成了一个可交互的前后对比报告。 这个报告支持 拖动查看调色效果、对比不同版本、逐项检查每个决策,把视频处理流程做成了一个可交互的智能体体验。

上一页2 / 5下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报