toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

120 条动态

全部模型智能体产品多模态
最新
6小时前
6小时前多模态X

Flux 3 视频生成实测:分屏双机位一致性领先

近期多位创作者实测了 Flux 3 的视频生成能力,发现其在复杂的分屏与双机位场景中表现突出。测试表明,Flux 3 能在左右分屏中实现同一事件的逐帧同步,并在严苛的双路监控视角测试中保持人物、物体与时间戳的一致性。多位测试者认为其在该特定任务上的表现明显优于其他视频模型。

7小时前
7小时前多模态X

Midjourney 新风格配完整参数,生成图像风格鲜明

分享的是一个 Midjourney 新创建风格 及其提示词参数:--chaos 7 --ar 3:2 --sref 1835916550 --sw 500 --stylize 500 --hd。 这条帖子本质上是一个风格展示,不是产品发布;配图给出了多张生成效果,能直观看到这种风格的视觉表现。

7小时前
7小时前多模态Reddit

ComfyUI 的 FreeU 节点号称无需重训也能提升画质

这条内容介绍了 ComfyUI 里的 FreeU 节点,主张它能明显改善 AI 图像质量。 文章说 FreeU 通过类似傅里叶变换的处理,增强低频成分、抑制高频噪声。 它的卖点是帮助提升结构一致性和色彩平衡。 重点在于:不用重新训练模型,也能靠一个节点改善出图效果。

7小时前
7小时前多模态X

GeoFace 用几何约束扩散保持单图多视角人脸一致性

KAIST 团队提出 GeoFace,一种带几何约束的多视角扩散框架,目标是从单张输入生成一致的人脸多视角图像。 方法会同时生成多视角 RGB 图像和共享的 canonical UV position map,把 3D 结构约束显式注入生成过程。 结构上采用双流架构,并通过几何引导的注意力对齐,让外观与几何在不同视角下保持一致。 论文声称,这种设计在大姿态变化下比以往方法更稳,几何一致性更好。 应用场景包括 3D 重建、数字人和沉浸式内容创作。

7小时前
7小时前多模态Reddit

LTXV2.3 口型同步测试展示图像音频联动镜头运动

- 作者用 LTXV2.3 做了一次 lip-sync(口型同步) 测试,重点想验证:图像+音频生成 不仅能不能对嘴,还能不能处理镜头移动。 这套流程基本照搬 Civitai 上现成工作流,作者提到自己额外在跑的是 EROS V4-B16。 这条内容带明显的自嘲和搞笑气质:作者坦言只是随手测试,还把效果里的角色戏称成 “Fatty Sean Paul / Shaggy Paul”。 对有类似设备的人也有参考价值,原帖附了可复用的工作流链接,并提到 RTX 3060 12GB 也能跑。

7小时前
7小时前多模态X热度 6.7

Flux 3通过“海獭黑客”测试展现视频生成飞跃

Emad Mostaque使用经典的“海獭在飞机上用笔记本电脑”提示词对Flux 3视频模型进行了测试。结果显示,经过两年的迭代,Flux 3已能轻松驾驭这一复杂场景,甚至能将其拓展为充满1990年代动作片风格的“海獭黑客”变体,充分展现了AI视频生成技术在细节把控和创意表现力上的肉眼可见的进步。

7小时前
7小时前多模态X

GPT-5.5 与 Suno 合作专辑上线主流流媒体平台

一张完全由 AI 工作流参与制作的专辑已成功上架 Spotify 和 Apple Music 等主流流媒体平台。该专辑的歌词主要由 GPT-5.5 和 Claude 生成,随后交由 Suno 完成作曲与风格标签的制作。作者特别感谢了发行商 DistroKid 接受 AI 音乐,其中由 GPT-5.5 创作的歌曲甚至成为了专辑中播放量最高的曲目。

7小时前
7小时前多模态X

黑白机器人绅士图,把一张 AI 图做成了梗

这是一条带强烈视觉梗感的帖子,配图是一张黑白风格的“绅士机器人”形象:西装、礼帽、墨镜,整体很像 AI 生成图或 AI 圈审美梗图。 正文没有提供事实信息,主要作用就是“看一眼就忘不掉”的视觉玩笑;真正的传播点在图片本身。

8小时前
8小时前多模态Reddit

Reddit 视频把 AI 写的节拍做成了舞台演出

- 这条 Reddit 视频展示了一段“由 AI 写出来的酷炫节拍”演出,配图是一个舞台表演场景。 重点不在技术发布,而在 AI 生成音乐 + 夸张现场表演 的组合效果,属于很适合转发的多模态趣味内容。

8小时前
8小时前多模态Reddit

从 AI 参考图到 Fortnite 可骑乘迅猛龙,最终模型 2.8 万面

一位 Reddit 创作者分享了自己把AI 参考图一路做成 Fortnite 里可骑乘机械迅猛龙的完整流程,细节非常工程化。 他的流程大致是:先用 Grok Imagine 生成参考图,再用 Nano Banana Pro 修掉一个关键细节;随后进入 image-to-3D 工具生成基础几何体,再用 Hunyuan 3D Studio 做低模重拓扑和 UV 展开;贴图与放大阶段则交给 Trellis2 + ComfyUI,最后由 Blender 完成清理、绑定和权重绘制。 几个实用经验: 在 3D 化之前先把身体拆成多个部件,能明显改善几何体控制 最终模型约为 28K triangles 进入 UEFN 后,靠 Unreal Engine 的 retargeting 工具实现了移动和骑乘 目前还剩硬表面抖动、贴图和权重绘制流程优化等问题

8小时前
8小时前多模态X

Codex 先剪辑调色,再在聊天里生成交互式前后对比报告

- 发帖者先让 Codex 对一段视频进行编辑和调色。 随后又用自己做的 生成式 UI skill,在聊天界面里生成了一个可交互的前后对比报告。 这个报告支持 拖动查看调色效果、对比不同版本、逐项检查每个决策,把视频处理流程做成了一个可交互的智能体体验。

8小时前
8小时前多模态X

Grok Build 网页演示把摄像头变成实时现实扭曲应用

一个在网页端制作并发布的 Grok Build 演示,核心是名为 RIFT 的实时视频反馈特效应用。 页面支持调用摄像头或上传视频片段,再套用 Liquid Chrome、Prism Cathedral、Temporal RGB、Heat Mirage、Event Horizon 等视觉效果。 工具还提供导出功能,注明可生成适合 X 的 H.264 MP4,并开放 Intensity / Chaos / Feedback / Mix 等参数调节。 这个 demo 的定位是 “live reality distortion”,主打把摄像头画面做成无限反馈、扭曲和燃烧式的视觉效果。

8小时前
8小时前多模态X

Pika 预告 Seedance 2.5 很快登陆其视频平台

Pika 正在预热 Seedance 2.5,上线时间被明确指向“很快”,并将率先在 Pika 里开放。 这条帖子的核心信息不是技术细节,而是视频生成产品的近期开启预告:作者称目前看到的 teaser 视频是“迄今最好的一版”。

8小时前
8小时前多模态X

Inpaint-Anything 升级为 SAM3 和 ProPainter,专做第一人称视频处理

Inpaint-Anything 时隔三年迎来升级,作者把它重新面向第一人称数据做了一轮重构。 这次主要更新包括: 分割模型从 SAM 迁移到 SAM3 视频修复骨干从 STTN 换成 ProPainter 增加了更多面向 egocentric data 的处理能力 作者提到,最近 EgoEngine 等工作会用它来去除第一人称视频里的手臂和手部,这让他认为这套工具可以扩展成更通用的 ego data processing 方案。

8小时前
8小时前多模态Reddit

AI 生成“时光旅行者皮包”里的 54 张人类史照片

像从时光旅行者皮包里翻出的 54 张“历史照片” 这组作品的设定是:一只属于未知时间旅行者的旧皮包被发现,里面装着 54 张跨越人类历史的实体照片。作者明确说明,这些照片都是 AI 生成的虚构影像,并非真实档案或“隐藏历史”证据。 作品使用 ChatGPT Sol5.6 Max Work Mode 逐场景生成,单张图大约耗时 7–10 分钟。 对于没有现存照片的年代,作者用博物馆、考古资料、历史记载和原始文献作为参考锚点,再做“推测性重建”。 创作目标不是精修概念图,而是做出那种粗糙、带点瑕疵、像真实旧照片一样的人类瞬间。 这只是 Part 1,作者表示如果大家感兴趣,会继续发 Part 2 和 Part 3。

8小时前
8小时前多模态Hugging Face

Google DeepMind 发现视频模型更吃视觉提示词工程

Google DeepMind 发现,visual prompt engineering(VIPE) 能通过直接编辑任务图像来提升视频模型的推理表现。核心思路是:把输入视觉内容改写成模型更容易推理的形式。 例子:把一个类似草图的物理场景,先转成更接近照片风格的版本,再让模型推理。 结果:VIPE 在多个任务上都能提分,而且有时比传统文本 prompt engineering 或 test-time scaling 更有效。 结论:对视频模型来说,prompt engineering 不只是改文本,视觉侧的预处理也可能是低算力成本的提升手段。

8小时前
8小时前多模态Hugging Face

月之暗面发布视觉感知基准 PerceptionBench

月之暗面发布了包含 3000 道题目的 PerceptionBench 基准测试。该基准专注于评估多模态大模型的原子视觉感知能力,试图将纯粹的感知错误与推理、知识错误剥离开来。测试结果显示,目前前沿多模态模型在该项基础感知能力上的表现均未突破 60%,暴露出当前模型在底层视觉理解上的短板。

8小时前
8小时前多模态Hugging Face

OmniDelta 用技能驱动分配压缩多模态 token

OmniDelta 用技能驱动重分配多模态 token 预算 OmniDelta 是一个训练无关的多模态 token 压缩框架,目标不是只做“删 token”,而是先解决预算该分给音频还是视频、以及各自内部该怎么分的问题。作者认为,直接用查询和音视频 token 的相似度来做跨模态预算分配并不可靠,而固定的模态内均匀预算也容易漏掉关键信息、保留冗余内容。 方法 先构建音频技能池和视频技能池,根据查询意图动态调整保留预算。 再结合局部复杂度和时间冗余,在音频片段与视频帧之间重分配预算。 该方法可以和现有 pruning 策略叠加,在不改变总保留比例的前提下,改变预算花在哪里。 结果 在 4 个音视频 benchmark 和 2 个 Qwen2.5-Omni 模型上验证。 在不同剪枝比例下,取得新的准确率-效率 Pareto 前沿。 在 Qwen2.5-Omni-7B 上保留 25% token 时,GPU 显存下降 22.0%,端到端推理速度提升 1.64 倍。

8小时前
8小时前多模态X

Google联合高校推出VGGRPO提升视频生成物理一致性

Google联合哥本哈根大学与牛津大学的研究人员提出了VGGRPO(Visual Geometry GRPO)方法,旨在解决视频生成中“画面好看但物理崩坏”的问题。该方法通过在隐空间引入几何奖励对齐视频扩散模型,利用潜空间几何模型来提升视频生成的物理一致性与几何稳定性。

9小时前
9小时前多模态Reddit

GPT Image 2 把旧救生塔做成了怀旧夏日写真

作者分享了一个用 GPT Image 2 生成的夏日怀旧风作品:以一位合成角色坐在老旧救生塔上为核心,追求“韩式夏日日记”般的气质。 他详细讲了哪些视觉细节决定了成片效果:旧塔必须显得风化而不是刚刷漆,配上快融化的冰棒、挂在手腕上的复古相机、风筝、漂浮的手写笔记,以及大量留白的浅蓝天空;再用胶片颗粒和低对比度,把画面压成像老相册里翻出来的照片,而不是明显的渲染图。

9小时前
9小时前多模态Hugging Face

Adobe Wonder 把图片变成可控相机的视频世界模型

Adobe Research 和 Johns Hopkins 提出了 Wonder,一个面向实时、可由相机控制的通用视频世界模型。它可以从一张图或一段条件视频出发,构建一个可交互的“可玩世界”,用户能通过移动镜头探索未见区域,并在长时间跨度里回看已见内容。 论文的关键设计包括: 密集坐标场式的相机条件:把镜头运动直接转成视觉证据。 稀疏注意力记忆机制:在长上下文里快速检索相关信息。 蒸馏流程修正:增强学生模型对控制信号的服从度,同时保留多样性和长期记忆。 系统可在 16 FPS 下生成分钟级视频,也支持对已有动态场景做实时重拍式生成。

10小时前
10小时前多模态X

开发者用 Claude Code 搭建全自动 AI 视频流水线

多位开发者成功将 Claude Code 改造为完整的 AI 影视工作室系统,构建出可落地的六阶段短片生产管线。其中一位开发者受 Netflix 斥资 5.87 亿美元收购 AI 创意公司的启发,从零搭建了全自动 AI 视频生成工作流。这套方案并非依赖单一提示词,而是深度结合了子智能体、技能模块、Bash 脚本与工程化编排,实现了高度自动化的视频内容生产。

10小时前
10小时前多模态X

创作者用 Flux 3 做出名为《Contaminated》的 AI 恐怖片预告

创作者用 Flux 3 制作 AI 恐怖片预告片 原帖说,作者开始用 Flux 3 制作 AI 恐怖电影预告片,这支作品的名字叫 《Contaminated》。 它不是产品发布,而是一个很具体的创作 demo:用视频生成能力做类型片预告,重点展示的是多模态生成在叙事和风格化内容上的可玩性。

10小时前
10小时前多模态X

有人用 Opus 5 测试 three.js 复现工厂照片

有人在尝试用 Opus 5 + three.js 把一张工厂照片尽量复现成可交互场景。 转推者认为它对细小资产的还原做得不错,说明这不是普通的文生图展示,而是偏向基于图片参考的三维/场景重建实测。

上一页3 / 5下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报