toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

154 条动态

全部模型智能体产品多模态
最新
17小时前
17小时前多模态X

Seedance 2.5 将很快登陆 ImagineArt

ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。

17小时前
17小时前多模态X

Runway Seedance 2 做出 NERF 到写实的转场视频

又一条用 Runway 上的 Seedance 2 做出的 NERF → 写实 风格转换测试视频。作者表示这个效果足够有趣,甚至考虑围绕它做成一部电影;最终成片还用了 CapCut 做剪辑。

17小时前
17小时前多模态X

Cartesia:TTS 评测不能只看“像不像人声”

Cartesia 认为,判断一个 TTS 模型好不好,远比一句“听起来不错”复杂。文章把质量拆成至少五个维度:正确性、音频质量、上下文正确性、自然度、鲁棒性。 核心结论是:模型越强,评测越难。等到明显的口误、杂音、失真都被修掉后,真正难测的是名字、数字、混语、上下文歧义这些更贴近生产环境的问题。

17小时前
17小时前多模态X

跳出超写实陷阱:用 Gabor 小波教神经网络作画

这是一篇深度技术博客的第一部分,作者分享了历时四个月的实验:尝试教导神经网络使用 Gabor 小波(Gabor wavelets)来渲染自然图像。 在各大厂商追求超写实图像/视频生成模型的热潮下,作者反其道而行之,探索更小、独特且自训练的模型。作者以这种熟悉的 Gabor 表示为切入点,在 Claude 的辅助下进行机器学习探索,旨在发现创意工具并实现更具表现力的图像生成路径。

17小时前
17小时前多模态Reddit

Krea 2 模型新 LoRA:一键生成 Mad 杂志 Don Martin 搞笑画风

开发者发布了适用于 Krea 2 模型的 Don Martin LoRA,能够生成 Mad 杂志传奇漫画家 Don Martin 标志性的夸张、搞怪风格图像。 该模型训练至 1200 步,在大多数情况下无需特定触发词即可生效。作者表示,如果提示词中包含过多其他风格描述(如“neon”等),添加“a cartoon”或“an illustration”能获得更稳定的效果。模型已在 Civitai 和 Hugging Face 上开源。

17小时前
17小时前多模态Reddit

Krea-2 Depth LoRA 发布:两阶段训练生成高质量图像深度图

开发者发布了一款专为 Krea-2 模型设计的 Depth LoRA,能够将任意输入图像转化为高质量的深度图(Depth Map)。 该 LoRA 采用了两阶段渐进式分辨率训练策略: 阶段一(512分辨率预训练):在2000对公开数据集上训练,利用 VLM 重新生成描述以增强图文对齐,建立稳定的深度结构先验。 阶段二(1536高分辨率微调):专注于细节重建,优化边缘和精细几何结构,采用余弦学习率以稳定收敛。 使用注意:必须配合 ComfyUI-EditUtils 插件才能正常工作,建议输入图像最长边在 1024 至 2048 像素之间以获得最佳效果。

18小时前
18小时前多模态X

一段给 Higgsfield 用户看的实操视频

这条帖子是在推荐一段关于 Higgsfield 的视频,作者直说“任何想用 Higgsfield 的人都值得看”。 帖子本身没有展开更多技术细节,但语境表明它更像是一段面向实操用户的讲解或评测,重点是帮助理解这款视频生成产品的使用方式。

18小时前
18小时前多模态X

Magnific 预告接入 Seedance 2.5

Magnific 预告即将接入由 BytePlusGlobal 提供支持的 Seedance 2.5 视频生成模型。据预告信息显示,新版本功能大幅提升,最多可支持 50 张参考图,并能够生成最长 30 秒的视频。目前该功能已进入上线倒计时阶段,引发社区广泛关注。

18小时前
18小时前多模态Reddit

Krea 2低资源LoRA快训教程与工具发布

社区近期推出了针对Krea 2模型的快速LoRA训练工具与实操教程。该工具主打在极低资源环境下的可用性,仅需11GB显存和16GB内存即可运行。配套的开源教程详细展示了数据重标注、自适应学习率调整等核心微调技巧,能够帮助开发者在两分钟内快速完成Krea 2的LoRA训练。

18小时前
18小时前多模态X

Claude Code 通过 Higgsfield MCP 在聊天里给 demo 视频加配音

作者分享了一个把 Codex、Claude Code 和 Higgsfield MCP 串起来的实战工作流:先让 Codex 为 Open Field 做出完整 demo,再让它生成带有“ScreenStudio 风格”的发布视频、交互式 UI 和用户视角录制,最后切到 Claude Code,通过 Higgsfield 的 MCP 直接在聊天线程里给视频补上配音。 具体流程包括: 用 Codex 生成 demo、时间轴和旁白文稿 在 Claude 里直接挑选并测试不同声音 把旁白按动作节奏对齐到视频里 在同一个对话中完成视频润色和语音添加 作者的观点是:所谓“AGI”更像是把一堆现成工具正确拼接起来;前沿实验室已经把能力拆成了很多可组合的模块。帖子最后还介绍了 Open Field:一个面向数学和科学开放问题的平台,主张通过公开验证、独立审计和链上可追溯记录来处理新发现。

18小时前
18小时前多模态X

动画渲染连试四次才保住同一角色一致性

这条帖在讲一个生成式渲染里的角色一致性事故:为了保住同一个人物,制作方前后试了四次失败渲染;三次单独生成各自产出了三个不同的女孩,连 QC 工具拿着作者自己的外形都判定成了“完全不同的角色”。 作者说,真正的修正办法不是继续硬生成,而是回到单次渲染内的连续性:靠一张 model sheet、三个嘴型、裁切和循环来维持一致。文末还提到,那个缠着绷带的喉部设定在所有变体里都保住了。

18小时前
18小时前多模态X热度 4.2

多款视频生成模型即将密集发布

泄露的时间表显示,视频生成模型即将迎来密集发布期。Hailuo 3 预计于 7 月 29 日登场,Seedance 2.5 也有望在 7 月 31 日左右上线。此外,FLUX 3 和 WAN 3 分别预计于 8 月 4 日和 6 日接连发布,行业即将进入视频模型的新一轮激烈角逐。

18小时前
18小时前多模态X

一款本地 iPhone 修图应用开启 beta,主打端侧视觉模型

一个“有点诡异”的修图应用已经开放 beta 测试。它用 seam carving 做内容感知缩放,并结合 Apple Vision 和 Roboflow RF-DETR 来识别人、物体和图片中的关键区域。 作者强调,这套流程 全部在 iPhone 本地运行,后续还会公开给更多用户试用。

18小时前
18小时前多模态Reddit

开源应用用 Gemini 视频理解自动提取高光短片

作者做了一个开源应用,借助 Gemini Video Understanding 自动提取“高影响力、可直接播放”的 reels,不用再手动看文字摘要,也不用拖时间轴。 工具会自动找出值得看的片段。 项目是开源的,并给出了 GitHub 仓库。 这条帖子的重点是:用视频理解能力把“找素材”这件事自动化。 它更像一个基于多模态能力搭出来的实用应用案例。

18小时前
18小时前多模态X

研究者希望 agent 任务结束后直接生成短视频摘要

有人觉得纯文本总结已经不够用了,希望一个大型 agent 任务结束后,直接产出一段 高质量短视频 作为结果摘要。 这条不是在讲某个具体产品发布,而是在表达一个很明确的方向:如果 agent 已经替你做完长规划、长研究,那输出形式也许应该从“又一大坨文字”进化成短小、可视化、便于快速消化的讲解视频。作者认为,模型在生成这种结果视频上的能力还远远不够。

18小时前
18小时前多模态Reddit

WAN Bernini结合Prompt Relay实现长视频精准控时

有开发者分享了一种全新的视频生成工作流,将字节跳动的WAN Bernini视频生成框架与Prompt Relay技术相结合。该方案能够生成10至15秒的视频,并成功实现了将特定动作精确控制在指定时间节点,显著提升了长视频生成的可控性与精准度。

19小时前
19小时前多模态X

HeyGen 将在 7 月 29 日西雅图 Tech Week 演示 HyperFrames

HeyGen 将在西雅图 Tech Week 现场演示 HyperFrames HeyGen 宣布在 Seattle Tech Week 期间,于 INTDEV 举办一场 HyperFrames 现场演示活动,时间是 7 月 29 日周三 18:00–20:00。 这场活动的定位不是普通发布会,而是面向 builder 的 meetup。HeyGen 把 HyperFrames 介绍为一种 programmatic video infrastructure:用 HTML、CSS、JavaScript 和 AI 生成动态视觉内容,不需要时间线和关键帧。 文案里还明确提到,它面向做 数据可视化、内容创作、营销、媒体制作、多模态模型、智能体 和各类视觉体验扩展的开发者。HeyGen 想表达的核心是:未来不仅产品可以由 agent 辅助发布,连发布视频也可以由 agent 一起生成。

19小时前
19小时前多模态X

HeyGen 开源视频特效技能包,支持自然语言调色与渲染

HeyGen 开源了名为 HyperFrames 的视频特效处理技能包。 核心功能:用户无需手动调节各种滑块,直接通过自然语言请求即可完成视频调色。 支持效果:包含轮子、曲线等各项控制,支持录像带、像素化、ASCII、交叉阴影等多种视觉风格,也允许导入自定义外观包。 所见即所得:预览效果即为最终渲染效果。 安装方式:开发者可通过 npx skills add heygen-com/hyperframes --full-depth 快速集成。

19小时前
19小时前多模态X

AI 把旧金山生成成了连锁店和 AI 广告牌海景

作者让 AI 生成一张“被重建后的旧金山”:把单户住宅和高楼换成豪华 five-over-one、公链连锁店,以及巨大的 AI 广告牌。 配图里满是麦当劳、Subway、Google、Anthropic、Apple Store 等标识,整体更像一张拿来调侃 YIMBY 争论的生成图梗图,而不是认真的城市方案。

19小时前
19小时前多模态X

开发者把 ChatGPT 实时语音做成桌面 3D 角色

有人把 ChatGPT 的实时语音做成了一个带脸、身体和性格的桌面 3D 角色。 这个 demo 被拿来类比 OpenAI 可能的 “Codex Pets” 方向:不是只在窗口里聊天,而是一个会说话、常驻桌面的 AI 伴侣。

19小时前
19小时前多模态X

Qwen Audio 3.0实时语音模型实测成本略高于GPT

Artificial Analysis 发布了最新的原生语音到语音模型测评报告。在 Big Bench Audio 子集测试中,阿里 Qwen Audio 3.0 Realtime Plus 展现了较强的推理表现,但其输入音频成本约为每小时 4.42 美元,略高于同级别的 GPT 实时音频模型。这为开发者在语音模型选型时提供了直观的成本与性能参考。

19小时前
19小时前多模态X

Qwen Audio 3.0 Realtime Plus 以 84.1% 登顶语音到语音榜单

阿里发布的 Qwen Audio 3.0 Realtime 在 Artificial Analysis 的 Speech to Speech Index 上拿到新第一,Plus 版 84.1%,领先 GPT-Realtime-2.1 High 的 79.1%。 这次测试显示它在多个分项上都领先:Big Bench Audio、Full Duplex Bench、Tau Voice 都是 Plus 版占优。但代价也很明显:首个音频输出时间偏慢,在榜单里属于较慢的一档。测试对象是阿里云上的中国区 endpoint。

19小时前
19小时前多模态Reddit

AI 黑色喜剧短片把僵尸末日拍成音乐视频

Reddit 上有人分享了 《Zombie World | AI Black Comedy Music Short Film》,是一支带有僵尸末日讽刺感的 AI 黑色喜剧音乐短片。 它更像一个值得转发的奇观作品:重点不在技术发布,而在 AI 生成的视觉效果和荒诞设定本身。

20小时前
20小时前多模态Hugging Face

TILT 用模型内生奖励提升文生图组合一致性

TILT 用模型内生奖励提升组合式文生图 论文 TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward 关注的是文生图模型在处理复杂、多概念提示词时常见的组合失败问题。 方法本身是无需训练的 test-time 方案:通过修改采样轨迹来提升生成结果的组合一致性,而且奖励信号来自基础模型内部,不需要外部监督或单独的奖励模型。 作者把组合失败解释为联合分布与单概念分布之间的重叠模式,并据此推导出一个带 KL 约束的目标函数、闭式的 tilted target distribution,以及适用于扩散采样的引导步骤。 在 T2ICompBench 上,该方法在提升组合对齐的同时尽量保持图像质量;文中还发现,平衡两种引导策略的混合方案效果最好。

上一页6 / 7下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报