toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

141 条动态

全部模型智能体产品多模态
最新
12小时前
12小时前多模态微信

DyRef 让多参考图像编辑分数从 4.97 提到 8.38

- DyRef 解决的是复杂多参考图像生成:模型要同时处理身份、背景、姿态、光照和风格,而且这些参考条件之间不能互相打架。 团队还构建了 OmniRef-Bench,包含 395 个样本,覆盖 5 类参考图,每个样本 2 到 7 张参考图,最多同时出现 4 类参考信息。 方法上,DyRef 采用两阶段训练:先监督微调打基础,再用强化学习做 动态奖励优化,让更难的样本在训练中占更大权重。 在 OmniRef-Bench 上,文中称 Qwen-Image-Edit-2511 的 MLLM 平均分从 4.97 提升到 8.38,缩小了与 NanoBananaPro 的差距,并超过了 Seedream4.5。 文章还提到,它在 MultiBanana、OmniContext 以及单图编辑基准 ImgEdit、DreamBench++ 上也有提升。

13小时前
13小时前多模态Reddit

Krea 2 Turbo 手机写实的 6 步流程在 Reddit 走红

Reddit 总结出一套 Krea 2 Turbo 手机写实流程 这条帖子给出一套不靠 LoRA、也能把 Krea 2 Turbo 拉到接近手机照片质感的流程,并配了对比图展示效果变化。作者认为,按这套做法通常能达到“90% 以上”的手机写实度;如果再叠加写实 LoRA,还能继续提升。 核心步骤包括: 1. 把正向提示词写得足够具体,不要只写“手机照片”。 2. 分辨率提高到约 2MP。 3. 改成 9:16 纵向比例。 4. 把采样步数提高到 8、11 甚至 14。 5. 用 CFG 1.2 并加入负向提示词,压掉 DSLR、虚化、胶片感等元素。 6. 额外描述背景细节,增强真实感。 作者还提到,某些 bypass LoRA 能改善提示词服从度,尤其是表情和体型控制;但 CFG 过高也会带来更强饱和、重复和图像“炸裂”问题。

13小时前
13小时前多模态X

Gemini 被曝可一键生成脚本并完成视频剪辑

近期 Gemini 被宣传为一款端到端的视频创作与编辑工具。据帖子透露,用户仅需一条提示词,Gemini 即可在几分钟内完成视频脚本生成、剪辑和润色,主打无需手动拖拽时间线或切镜头。其展现出的自动化创作能力,直接使其被拿来与剪映、CapCut 等主流视频编辑工具进行对比,引发了关于 AI 改变视频创作流程的讨论。

13小时前
13小时前多模态Reddit热度 5.1

LTX 2.3结合自训LoRA生成Pixar风格视频

近日,有创作者测试了LTX 2.3视频生成工作流,通过使用自训的“penny”LoRA模型,成功生成了一段Pixar风格的动画视频。该演示作品名为“Penny's first day as a barista”,展示了该模型在特定风格化视频生成上的潜力。目前作者仍在持续优化提示词,以进一步提升生成效果。

14小时前
14小时前多模态Reddit

Reddit 演示了 Seedance 2 生成短打斗片段

这条 Reddit 展示了用 Seedance 2 做出来的短打斗片段。它更像是一个直接的模型演示,而不是讨论帖,重点在于视频生成已经能做出相当连贯的动作编排和镜头表现。

14小时前
14小时前多模态Reddit

Reddit 实测称 LTX 2 扩图效果强且搭建很省事

一位 Reddit 用户在测试 LTX 2 outpainting 后表示,效果“强到让人压倒”,而且搭建成本很低。 这次测试做的是《指环王》IMAX 风格的扩图。 作者也承认有一些瑕疵,比如个别人脸被替换成了兽人。 但他认为整体质量已经足够惊艳,缺点只是次要问题。

14小时前
14小时前多模态Reddit

Krea 2 加载 LoRA 致生成速度锐降,开发者求助优化方案

一位开发者在 Reddit 求助,称在 ComfyUI 中使用 Krea 2 模型时,一旦加载任何尺寸的 LoRA,图像生成时间就会延长 2 至 4 倍。他附上了自己的启动脚本参数(包含 --lowvram、--disable-smart-memory 等显存优化选项),询问社区是否有针对性的调整建议,以解决 LoRA 导致的严重性能损耗问题。

14小时前
14小时前多模态Reddit

Reddit 分享了 Black Weep 风格化视频作品

这条 Reddit 只写了 “Black Weep” 并附上一个视频片段,属于典型的视觉作品展示帖。正文没有更多解释,但从呈现方式看,它更像是为了审美和传播效果而做的生成或剪辑作品。

15小时前
15小时前多模态X热度 6.2

Mirage发布Avatar X:10秒生成高保真数字人

Captions公司旗下的Mirage发布了全新AI数字人模型Avatar X。该模型仅需10秒视频素材即可生成高保真个人分身,并将技术重点从单一的口型对齐升级为身份保真与情绪反馈。多位实测者认为其微表情和肢体反馈自然度明显优于现有产品,有效解决了长视频生成中的细节漂移问题。

15小时前
15小时前多模态X

创作者称超过 90% 的 AI 视频仍缺少故事性

这条帖子的核心判断很直接:超过 90% 的 AI 视频缺少故事性。 它指出当前 AI 视频内容的主要问题并不只是画面质量,而是叙事结构、情节推进和“为什么要看下去”的动机不足。

16小时前
16小时前多模态Reddit

开发者修复 ComfyUI 视频超分插件,大幅降低显存占用

一名开发者在 GitHub 上传了 ComfyUI-SeedVR2_VideoUpscale 的修复分支,重点解决了启用 ConvRot INT8/NVFP4 时的显存(VRAM)占用问题。 该开发者已在 Windows 11、RTX 5060Ti 16GB 环境下完成测试,并提供了基准测试数据,证实显存消耗得到显著降低。此外,他建议在使用 NVFP4 时仅对 VAE 应用 Torch Compile。由于官方仓库已长达七个月未更新,作者目前对是否提交 PR 持观望态度。

16小时前
16小时前多模态X

Seedance 2.5 将很快登陆 ImagineArt

ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。

16小时前
16小时前多模态X

Runway Seedance 2 做出 NERF 到写实的转场视频

又一条用 Runway 上的 Seedance 2 做出的 NERF → 写实 风格转换测试视频。作者表示这个效果足够有趣,甚至考虑围绕它做成一部电影;最终成片还用了 CapCut 做剪辑。

16小时前
16小时前多模态X

Cartesia:TTS 评测不能只看“像不像人声”

Cartesia 认为,判断一个 TTS 模型好不好,远比一句“听起来不错”复杂。文章把质量拆成至少五个维度:正确性、音频质量、上下文正确性、自然度、鲁棒性。 核心结论是:模型越强,评测越难。等到明显的口误、杂音、失真都被修掉后,真正难测的是名字、数字、混语、上下文歧义这些更贴近生产环境的问题。

16小时前
16小时前多模态X

跳出超写实陷阱:用 Gabor 小波教神经网络作画

这是一篇深度技术博客的第一部分,作者分享了历时四个月的实验:尝试教导神经网络使用 Gabor 小波(Gabor wavelets)来渲染自然图像。 在各大厂商追求超写实图像/视频生成模型的热潮下,作者反其道而行之,探索更小、独特且自训练的模型。作者以这种熟悉的 Gabor 表示为切入点,在 Claude 的辅助下进行机器学习探索,旨在发现创意工具并实现更具表现力的图像生成路径。

16小时前
16小时前多模态Reddit

Krea 2 模型新 LoRA:一键生成 Mad 杂志 Don Martin 搞笑画风

开发者发布了适用于 Krea 2 模型的 Don Martin LoRA,能够生成 Mad 杂志传奇漫画家 Don Martin 标志性的夸张、搞怪风格图像。 该模型训练至 1200 步,在大多数情况下无需特定触发词即可生效。作者表示,如果提示词中包含过多其他风格描述(如“neon”等),添加“a cartoon”或“an illustration”能获得更稳定的效果。模型已在 Civitai 和 Hugging Face 上开源。

17小时前
17小时前多模态Reddit

Krea-2 Depth LoRA 发布:两阶段训练生成高质量图像深度图

开发者发布了一款专为 Krea-2 模型设计的 Depth LoRA,能够将任意输入图像转化为高质量的深度图(Depth Map)。 该 LoRA 采用了两阶段渐进式分辨率训练策略: 阶段一(512分辨率预训练):在2000对公开数据集上训练,利用 VLM 重新生成描述以增强图文对齐,建立稳定的深度结构先验。 阶段二(1536高分辨率微调):专注于细节重建,优化边缘和精细几何结构,采用余弦学习率以稳定收敛。 使用注意:必须配合 ComfyUI-EditUtils 插件才能正常工作,建议输入图像最长边在 1024 至 2048 像素之间以获得最佳效果。

17小时前
17小时前多模态X

一段给 Higgsfield 用户看的实操视频

这条帖子是在推荐一段关于 Higgsfield 的视频,作者直说“任何想用 Higgsfield 的人都值得看”。 帖子本身没有展开更多技术细节,但语境表明它更像是一段面向实操用户的讲解或评测,重点是帮助理解这款视频生成产品的使用方式。

17小时前
17小时前多模态X

Magnific 预告接入 Seedance 2.5

Magnific 预告即将接入由 BytePlusGlobal 提供支持的 Seedance 2.5 视频生成模型。据预告信息显示,新版本功能大幅提升,最多可支持 50 张参考图,并能够生成最长 30 秒的视频。目前该功能已进入上线倒计时阶段,引发社区广泛关注。

17小时前
17小时前多模态Reddit

Krea 2低资源LoRA快训教程与工具发布

社区近期推出了针对Krea 2模型的快速LoRA训练工具与实操教程。该工具主打在极低资源环境下的可用性,仅需11GB显存和16GB内存即可运行。配套的开源教程详细展示了数据重标注、自适应学习率调整等核心微调技巧,能够帮助开发者在两分钟内快速完成Krea 2的LoRA训练。

17小时前
17小时前多模态X

Claude Code 通过 Higgsfield MCP 在聊天里给 demo 视频加配音

作者分享了一个把 Codex、Claude Code 和 Higgsfield MCP 串起来的实战工作流:先让 Codex 为 Open Field 做出完整 demo,再让它生成带有“ScreenStudio 风格”的发布视频、交互式 UI 和用户视角录制,最后切到 Claude Code,通过 Higgsfield 的 MCP 直接在聊天线程里给视频补上配音。 具体流程包括: 用 Codex 生成 demo、时间轴和旁白文稿 在 Claude 里直接挑选并测试不同声音 把旁白按动作节奏对齐到视频里 在同一个对话中完成视频润色和语音添加 作者的观点是:所谓“AGI”更像是把一堆现成工具正确拼接起来;前沿实验室已经把能力拆成了很多可组合的模块。帖子最后还介绍了 Open Field:一个面向数学和科学开放问题的平台,主张通过公开验证、独立审计和链上可追溯记录来处理新发现。

17小时前
17小时前多模态X

动画渲染连试四次才保住同一角色一致性

这条帖在讲一个生成式渲染里的角色一致性事故:为了保住同一个人物,制作方前后试了四次失败渲染;三次单独生成各自产出了三个不同的女孩,连 QC 工具拿着作者自己的外形都判定成了“完全不同的角色”。 作者说,真正的修正办法不是继续硬生成,而是回到单次渲染内的连续性:靠一张 model sheet、三个嘴型、裁切和循环来维持一致。文末还提到,那个缠着绷带的喉部设定在所有变体里都保住了。

17小时前
17小时前多模态X热度 4.2

多款视频生成模型即将密集发布

泄露的时间表显示,视频生成模型即将迎来密集发布期。Hailuo 3 预计于 7 月 29 日登场,Seedance 2.5 也有望在 7 月 31 日左右上线。此外,FLUX 3 和 WAN 3 分别预计于 8 月 4 日和 6 日接连发布,行业即将进入视频模型的新一轮激烈角逐。

17小时前
17小时前多模态X

一款本地 iPhone 修图应用开启 beta,主打端侧视觉模型

一个“有点诡异”的修图应用已经开放 beta 测试。它用 seam carving 做内容感知缩放,并结合 Apple Vision 和 Roboflow RF-DETR 来识别人、物体和图片中的关键区域。 作者强调,这套流程 全部在 iPhone 本地运行,后续还会公开给更多用户试用。

上一页5 / 6下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报