toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

128 条动态

全部模型智能体产品多模态
最新
9小时前
9小时前多模态Hugging Face

月之暗面发布视觉感知基准 PerceptionBench

月之暗面发布了包含 3000 道题目的 PerceptionBench 基准测试。该基准专注于评估多模态大模型的原子视觉感知能力,试图将纯粹的感知错误与推理、知识错误剥离开来。测试结果显示,目前前沿多模态模型在该项基础感知能力上的表现均未突破 60%,暴露出当前模型在底层视觉理解上的短板。

9小时前
9小时前多模态Hugging Face

OmniDelta 用技能驱动分配压缩多模态 token

OmniDelta 用技能驱动重分配多模态 token 预算 OmniDelta 是一个训练无关的多模态 token 压缩框架,目标不是只做“删 token”,而是先解决预算该分给音频还是视频、以及各自内部该怎么分的问题。作者认为,直接用查询和音视频 token 的相似度来做跨模态预算分配并不可靠,而固定的模态内均匀预算也容易漏掉关键信息、保留冗余内容。 方法 先构建音频技能池和视频技能池,根据查询意图动态调整保留预算。 再结合局部复杂度和时间冗余,在音频片段与视频帧之间重分配预算。 该方法可以和现有 pruning 策略叠加,在不改变总保留比例的前提下,改变预算花在哪里。 结果 在 4 个音视频 benchmark 和 2 个 Qwen2.5-Omni 模型上验证。 在不同剪枝比例下,取得新的准确率-效率 Pareto 前沿。 在 Qwen2.5-Omni-7B 上保留 25% token 时,GPU 显存下降 22.0%,端到端推理速度提升 1.64 倍。

9小时前
9小时前多模态X

Google联合高校推出VGGRPO提升视频生成物理一致性

Google联合哥本哈根大学与牛津大学的研究人员提出了VGGRPO(Visual Geometry GRPO)方法,旨在解决视频生成中“画面好看但物理崩坏”的问题。该方法通过在隐空间引入几何奖励对齐视频扩散模型,利用潜空间几何模型来提升视频生成的物理一致性与几何稳定性。

10小时前
10小时前多模态Reddit

GPT Image 2 把旧救生塔做成了怀旧夏日写真

作者分享了一个用 GPT Image 2 生成的夏日怀旧风作品:以一位合成角色坐在老旧救生塔上为核心,追求“韩式夏日日记”般的气质。 他详细讲了哪些视觉细节决定了成片效果:旧塔必须显得风化而不是刚刷漆,配上快融化的冰棒、挂在手腕上的复古相机、风筝、漂浮的手写笔记,以及大量留白的浅蓝天空;再用胶片颗粒和低对比度,把画面压成像老相册里翻出来的照片,而不是明显的渲染图。

10小时前
10小时前多模态Hugging Face

Adobe Wonder 把图片变成可控相机的视频世界模型

Adobe Research 和 Johns Hopkins 提出了 Wonder,一个面向实时、可由相机控制的通用视频世界模型。它可以从一张图或一段条件视频出发,构建一个可交互的“可玩世界”,用户能通过移动镜头探索未见区域,并在长时间跨度里回看已见内容。 论文的关键设计包括: 密集坐标场式的相机条件:把镜头运动直接转成视觉证据。 稀疏注意力记忆机制:在长上下文里快速检索相关信息。 蒸馏流程修正:增强学生模型对控制信号的服从度,同时保留多样性和长期记忆。 系统可在 16 FPS 下生成分钟级视频,也支持对已有动态场景做实时重拍式生成。

10小时前
10小时前多模态X

开发者用 Claude Code 搭建全自动 AI 视频流水线

多位开发者成功将 Claude Code 改造为完整的 AI 影视工作室系统,构建出可落地的六阶段短片生产管线。其中一位开发者受 Netflix 斥资 5.87 亿美元收购 AI 创意公司的启发,从零搭建了全自动 AI 视频生成工作流。这套方案并非依赖单一提示词,而是深度结合了子智能体、技能模块、Bash 脚本与工程化编排,实现了高度自动化的视频内容生产。

10小时前
10小时前多模态X

创作者用 Flux 3 做出名为《Contaminated》的 AI 恐怖片预告

创作者用 Flux 3 制作 AI 恐怖片预告片 原帖说,作者开始用 Flux 3 制作 AI 恐怖电影预告片,这支作品的名字叫 《Contaminated》。 它不是产品发布,而是一个很具体的创作 demo:用视频生成能力做类型片预告,重点展示的是多模态生成在叙事和风格化内容上的可玩性。

10小时前
10小时前多模态X

有人用 Opus 5 测试 three.js 复现工厂照片

有人在尝试用 Opus 5 + three.js 把一张工厂照片尽量复现成可交互场景。 转推者认为它对细小资产的还原做得不错,说明这不是普通的文生图展示,而是偏向基于图片参考的三维/场景重建实测。

11小时前
11小时前多模态Reddit

用户对比 Banana Pro 与 ComfyUI,称 Runpod 工作流人像太塑料

一位用户在问:从 Wavespeed / Banana Pro 换到 Runpod + ComfyUI 之后,为什么生成的人像反而变得很“塑料”。 他表示之前的方案能产出更逼真的图片,但新工作流是在 AI 辅助下拼出来的,效果却更像几年前的 ChatGPT 风格。他在纠结要不要推倒重来,还是 Banana Pro 本来就更强,以及怎样写提示词才能把真实感拉回来。

12小时前
12小时前多模态Reddit

用户对比 Krea 和 Anima 动漫生成,Krea 被认为更快也更好训

楼主在问:Krea 是否比 Anima 更适合做动漫模型,并给出了自己目前了解到的几点判断: Krea 速度更快; 它更容易训练新的风格; 已经有比较强、可用的 ControlNet; 相比之下,Anima 自带风格虽然多,但效果被认为偏弱、稳定性也一般,而且 ControlNet 支持仍然有限。 楼主想知道有没有人已经把原来的 Anima 工作流迁移到 Krea,并总结过真实体验和坑点。

12小时前
12小时前多模态X

vLLM 为 2.8T 参数 Kimi K3 提供 Day-0 推理支持

vLLM 宣布为 Moonshot AI 的 2.8 万亿参数 MoE 模型 Kimi K3 提供 Day-0 推理部署支持。该模型支持 100 万 token 上下文与原生视觉能力。通过固定 KDA 状态优化缓存,结合 @inferact 开源的草稿模型实现推测解码,vLLM 将单流吞吐量提升至 370 tok/s,突破了超大规模模型的服务瓶颈。

12小时前
12小时前多模态微信

DyRef 让多参考图像编辑分数从 4.97 提到 8.38

- DyRef 解决的是复杂多参考图像生成:模型要同时处理身份、背景、姿态、光照和风格,而且这些参考条件之间不能互相打架。 团队还构建了 OmniRef-Bench,包含 395 个样本,覆盖 5 类参考图,每个样本 2 到 7 张参考图,最多同时出现 4 类参考信息。 方法上,DyRef 采用两阶段训练:先监督微调打基础,再用强化学习做 动态奖励优化,让更难的样本在训练中占更大权重。 在 OmniRef-Bench 上,文中称 Qwen-Image-Edit-2511 的 MLLM 平均分从 4.97 提升到 8.38,缩小了与 NanoBananaPro 的差距,并超过了 Seedream4.5。 文章还提到,它在 MultiBanana、OmniContext 以及单图编辑基准 ImgEdit、DreamBench++ 上也有提升。

12小时前
12小时前多模态Reddit

Krea 2 Turbo 手机写实的 6 步流程在 Reddit 走红

Reddit 总结出一套 Krea 2 Turbo 手机写实流程 这条帖子给出一套不靠 LoRA、也能把 Krea 2 Turbo 拉到接近手机照片质感的流程,并配了对比图展示效果变化。作者认为,按这套做法通常能达到“90% 以上”的手机写实度;如果再叠加写实 LoRA,还能继续提升。 核心步骤包括: 1. 把正向提示词写得足够具体,不要只写“手机照片”。 2. 分辨率提高到约 2MP。 3. 改成 9:16 纵向比例。 4. 把采样步数提高到 8、11 甚至 14。 5. 用 CFG 1.2 并加入负向提示词,压掉 DSLR、虚化、胶片感等元素。 6. 额外描述背景细节,增强真实感。 作者还提到,某些 bypass LoRA 能改善提示词服从度,尤其是表情和体型控制;但 CFG 过高也会带来更强饱和、重复和图像“炸裂”问题。

12小时前
12小时前多模态X

Gemini 被曝可一键生成脚本并完成视频剪辑

近期 Gemini 被宣传为一款端到端的视频创作与编辑工具。据帖子透露,用户仅需一条提示词,Gemini 即可在几分钟内完成视频脚本生成、剪辑和润色,主打无需手动拖拽时间线或切镜头。其展现出的自动化创作能力,直接使其被拿来与剪映、CapCut 等主流视频编辑工具进行对比,引发了关于 AI 改变视频创作流程的讨论。

12小时前
12小时前多模态Reddit热度 5.1

LTX 2.3结合自训LoRA生成Pixar风格视频

近日,有创作者测试了LTX 2.3视频生成工作流,通过使用自训的“penny”LoRA模型,成功生成了一段Pixar风格的动画视频。该演示作品名为“Penny's first day as a barista”,展示了该模型在特定风格化视频生成上的潜力。目前作者仍在持续优化提示词,以进一步提升生成效果。

13小时前
13小时前多模态Reddit

Reddit 演示了 Seedance 2 生成短打斗片段

这条 Reddit 展示了用 Seedance 2 做出来的短打斗片段。它更像是一个直接的模型演示,而不是讨论帖,重点在于视频生成已经能做出相当连贯的动作编排和镜头表现。

13小时前
13小时前多模态Reddit

Reddit 实测称 LTX 2 扩图效果强且搭建很省事

一位 Reddit 用户在测试 LTX 2 outpainting 后表示,效果“强到让人压倒”,而且搭建成本很低。 这次测试做的是《指环王》IMAX 风格的扩图。 作者也承认有一些瑕疵,比如个别人脸被替换成了兽人。 但他认为整体质量已经足够惊艳,缺点只是次要问题。

13小时前
13小时前多模态Reddit

Krea 2 加载 LoRA 致生成速度锐降,开发者求助优化方案

一位开发者在 Reddit 求助,称在 ComfyUI 中使用 Krea 2 模型时,一旦加载任何尺寸的 LoRA,图像生成时间就会延长 2 至 4 倍。他附上了自己的启动脚本参数(包含 --lowvram、--disable-smart-memory 等显存优化选项),询问社区是否有针对性的调整建议,以解决 LoRA 导致的严重性能损耗问题。

13小时前
13小时前多模态Reddit

Reddit 分享了 Black Weep 风格化视频作品

这条 Reddit 只写了 “Black Weep” 并附上一个视频片段,属于典型的视觉作品展示帖。正文没有更多解释,但从呈现方式看,它更像是为了审美和传播效果而做的生成或剪辑作品。

14小时前
14小时前多模态X热度 6.2

Mirage发布Avatar X:10秒生成高保真数字人

Captions公司旗下的Mirage发布了全新AI数字人模型Avatar X。该模型仅需10秒视频素材即可生成高保真个人分身,并将技术重点从单一的口型对齐升级为身份保真与情绪反馈。多位实测者认为其微表情和肢体反馈自然度明显优于现有产品,有效解决了长视频生成中的细节漂移问题。

15小时前
15小时前多模态X

创作者称超过 90% 的 AI 视频仍缺少故事性

这条帖子的核心判断很直接:超过 90% 的 AI 视频缺少故事性。 它指出当前 AI 视频内容的主要问题并不只是画面质量,而是叙事结构、情节推进和“为什么要看下去”的动机不足。

15小时前
15小时前多模态Reddit

开发者修复 ComfyUI 视频超分插件,大幅降低显存占用

一名开发者在 GitHub 上传了 ComfyUI-SeedVR2_VideoUpscale 的修复分支,重点解决了启用 ConvRot INT8/NVFP4 时的显存(VRAM)占用问题。 该开发者已在 Windows 11、RTX 5060Ti 16GB 环境下完成测试,并提供了基准测试数据,证实显存消耗得到显著降低。此外,他建议在使用 NVFP4 时仅对 VAE 应用 Torch Compile。由于官方仓库已长达七个月未更新,作者目前对是否提交 PR 持观望态度。

15小时前
15小时前多模态X

Seedance 2.5 将很快登陆 ImagineArt

ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。

15小时前
15小时前多模态X

Runway Seedance 2 做出 NERF 到写实的转场视频

又一条用 Runway 上的 Seedance 2 做出的 NERF → 写实 风格转换测试视频。作者表示这个效果足够有趣,甚至考虑围绕它做成一部电影;最终成片还用了 CapCut 做剪辑。

上一页4 / 6下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报