月之暗面发布视觉感知基准 PerceptionBench
月之暗面发布了包含 3000 道题目的 PerceptionBench 基准测试。该基准专注于评估多模态大模型的原子视觉感知能力,试图将纯粹的感知错误与推理、知识错误剥离开来。测试结果显示,目前前沿多模态模型在该项基础感知能力上的表现均未突破 60%,暴露出当前模型在底层视觉理解上的短板。
07 月 29 日
128 条动态
月之暗面发布了包含 3000 道题目的 PerceptionBench 基准测试。该基准专注于评估多模态大模型的原子视觉感知能力,试图将纯粹的感知错误与推理、知识错误剥离开来。测试结果显示,目前前沿多模态模型在该项基础感知能力上的表现均未突破 60%,暴露出当前模型在底层视觉理解上的短板。
OmniDelta 用技能驱动重分配多模态 token 预算 OmniDelta 是一个训练无关的多模态 token 压缩框架,目标不是只做“删 token”,而是先解决预算该分给音频还是视频、以及各自内部该怎么分的问题。作者认为,直接用查询和音视频 token 的相似度来做跨模态预算分配并不可靠,而固定的模态内均匀预算也容易漏掉关键信息、保留冗余内容。 方法 先构建音频技能池和视频技能池,根据查询意图动态调整保留预算。 再结合局部复杂度和时间冗余,在音频片段与视频帧之间重分配预算。 该方法可以和现有 pruning 策略叠加,在不改变总保留比例的前提下,改变预算花在哪里。 结果 在 4 个音视频 benchmark 和 2 个 Qwen2.5-Omni 模型上验证。 在不同剪枝比例下,取得新的准确率-效率 Pareto 前沿。 在 Qwen2.5-Omni-7B 上保留 25% token 时,GPU 显存下降 22.0%,端到端推理速度提升 1.64 倍。
Google联合哥本哈根大学与牛津大学的研究人员提出了VGGRPO(Visual Geometry GRPO)方法,旨在解决视频生成中“画面好看但物理崩坏”的问题。该方法通过在隐空间引入几何奖励对齐视频扩散模型,利用潜空间几何模型来提升视频生成的物理一致性与几何稳定性。

作者分享了一个用 GPT Image 2 生成的夏日怀旧风作品:以一位合成角色坐在老旧救生塔上为核心,追求“韩式夏日日记”般的气质。 他详细讲了哪些视觉细节决定了成片效果:旧塔必须显得风化而不是刚刷漆,配上快融化的冰棒、挂在手腕上的复古相机、风筝、漂浮的手写笔记,以及大量留白的浅蓝天空;再用胶片颗粒和低对比度,把画面压成像老相册里翻出来的照片,而不是明显的渲染图。

Adobe Research 和 Johns Hopkins 提出了 Wonder,一个面向实时、可由相机控制的通用视频世界模型。它可以从一张图或一段条件视频出发,构建一个可交互的“可玩世界”,用户能通过移动镜头探索未见区域,并在长时间跨度里回看已见内容。 论文的关键设计包括: 密集坐标场式的相机条件:把镜头运动直接转成视觉证据。 稀疏注意力记忆机制:在长上下文里快速检索相关信息。 蒸馏流程修正:增强学生模型对控制信号的服从度,同时保留多样性和长期记忆。 系统可在 16 FPS 下生成分钟级视频,也支持对已有动态场景做实时重拍式生成。
多位开发者成功将 Claude Code 改造为完整的 AI 影视工作室系统,构建出可落地的六阶段短片生产管线。其中一位开发者受 Netflix 斥资 5.87 亿美元收购 AI 创意公司的启发,从零搭建了全自动 AI 视频生成工作流。这套方案并非依赖单一提示词,而是深度结合了子智能体、技能模块、Bash 脚本与工程化编排,实现了高度自动化的视频内容生产。

创作者用 Flux 3 制作 AI 恐怖片预告片 原帖说,作者开始用 Flux 3 制作 AI 恐怖电影预告片,这支作品的名字叫 《Contaminated》。 它不是产品发布,而是一个很具体的创作 demo:用视频生成能力做类型片预告,重点展示的是多模态生成在叙事和风格化内容上的可玩性。
有人在尝试用 Opus 5 + three.js 把一张工厂照片尽量复现成可交互场景。 转推者认为它对细小资产的还原做得不错,说明这不是普通的文生图展示,而是偏向基于图片参考的三维/场景重建实测。
一位用户在问:从 Wavespeed / Banana Pro 换到 Runpod + ComfyUI 之后,为什么生成的人像反而变得很“塑料”。 他表示之前的方案能产出更逼真的图片,但新工作流是在 AI 辅助下拼出来的,效果却更像几年前的 ChatGPT 风格。他在纠结要不要推倒重来,还是 Banana Pro 本来就更强,以及怎样写提示词才能把真实感拉回来。

楼主在问:Krea 是否比 Anima 更适合做动漫模型,并给出了自己目前了解到的几点判断: Krea 速度更快; 它更容易训练新的风格; 已经有比较强、可用的 ControlNet; 相比之下,Anima 自带风格虽然多,但效果被认为偏弱、稳定性也一般,而且 ControlNet 支持仍然有限。 楼主想知道有没有人已经把原来的 Anima 工作流迁移到 Krea,并总结过真实体验和坑点。
vLLM 宣布为 Moonshot AI 的 2.8 万亿参数 MoE 模型 Kimi K3 提供 Day-0 推理部署支持。该模型支持 100 万 token 上下文与原生视觉能力。通过固定 KDA 状态优化缓存,结合 @inferact 开源的草稿模型实现推测解码,vLLM 将单流吞吐量提升至 370 tok/s,突破了超大规模模型的服务瓶颈。

- DyRef 解决的是复杂多参考图像生成:模型要同时处理身份、背景、姿态、光照和风格,而且这些参考条件之间不能互相打架。 团队还构建了 OmniRef-Bench,包含 395 个样本,覆盖 5 类参考图,每个样本 2 到 7 张参考图,最多同时出现 4 类参考信息。 方法上,DyRef 采用两阶段训练:先监督微调打基础,再用强化学习做 动态奖励优化,让更难的样本在训练中占更大权重。 在 OmniRef-Bench 上,文中称 Qwen-Image-Edit-2511 的 MLLM 平均分从 4.97 提升到 8.38,缩小了与 NanoBananaPro 的差距,并超过了 Seedream4.5。 文章还提到,它在 MultiBanana、OmniContext 以及单图编辑基准 ImgEdit、DreamBench++ 上也有提升。
Reddit 总结出一套 Krea 2 Turbo 手机写实流程 这条帖子给出一套不靠 LoRA、也能把 Krea 2 Turbo 拉到接近手机照片质感的流程,并配了对比图展示效果变化。作者认为,按这套做法通常能达到“90% 以上”的手机写实度;如果再叠加写实 LoRA,还能继续提升。 核心步骤包括: 1. 把正向提示词写得足够具体,不要只写“手机照片”。 2. 分辨率提高到约 2MP。 3. 改成 9:16 纵向比例。 4. 把采样步数提高到 8、11 甚至 14。 5. 用 CFG 1.2 并加入负向提示词,压掉 DSLR、虚化、胶片感等元素。 6. 额外描述背景细节,增强真实感。 作者还提到,某些 bypass LoRA 能改善提示词服从度,尤其是表情和体型控制;但 CFG 过高也会带来更强饱和、重复和图像“炸裂”问题。

近期 Gemini 被宣传为一款端到端的视频创作与编辑工具。据帖子透露,用户仅需一条提示词,Gemini 即可在几分钟内完成视频脚本生成、剪辑和润色,主打无需手动拖拽时间线或切镜头。其展现出的自动化创作能力,直接使其被拿来与剪映、CapCut 等主流视频编辑工具进行对比,引发了关于 AI 改变视频创作流程的讨论。

近日,有创作者测试了LTX 2.3视频生成工作流,通过使用自训的“penny”LoRA模型,成功生成了一段Pixar风格的动画视频。该演示作品名为“Penny's first day as a barista”,展示了该模型在特定风格化视频生成上的潜力。目前作者仍在持续优化提示词,以进一步提升生成效果。

这条 Reddit 展示了用 Seedance 2 做出来的短打斗片段。它更像是一个直接的模型演示,而不是讨论帖,重点在于视频生成已经能做出相当连贯的动作编排和镜头表现。

一位 Reddit 用户在测试 LTX 2 outpainting 后表示,效果“强到让人压倒”,而且搭建成本很低。 这次测试做的是《指环王》IMAX 风格的扩图。 作者也承认有一些瑕疵,比如个别人脸被替换成了兽人。 但他认为整体质量已经足够惊艳,缺点只是次要问题。

一位开发者在 Reddit 求助,称在 ComfyUI 中使用 Krea 2 模型时,一旦加载任何尺寸的 LoRA,图像生成时间就会延长 2 至 4 倍。他附上了自己的启动脚本参数(包含 --lowvram、--disable-smart-memory 等显存优化选项),询问社区是否有针对性的调整建议,以解决 LoRA 导致的严重性能损耗问题。
这条 Reddit 只写了 “Black Weep” 并附上一个视频片段,属于典型的视觉作品展示帖。正文没有更多解释,但从呈现方式看,它更像是为了审美和传播效果而做的生成或剪辑作品。

Captions公司旗下的Mirage发布了全新AI数字人模型Avatar X。该模型仅需10秒视频素材即可生成高保真个人分身,并将技术重点从单一的口型对齐升级为身份保真与情绪反馈。多位实测者认为其微表情和肢体反馈自然度明显优于现有产品,有效解决了长视频生成中的细节漂移问题。
这条帖子的核心判断很直接:超过 90% 的 AI 视频缺少故事性。 它指出当前 AI 视频内容的主要问题并不只是画面质量,而是叙事结构、情节推进和“为什么要看下去”的动机不足。
一名开发者在 GitHub 上传了 ComfyUI-SeedVR2_VideoUpscale 的修复分支,重点解决了启用 ConvRot INT8/NVFP4 时的显存(VRAM)占用问题。 该开发者已在 Windows 11、RTX 5060Ti 16GB 环境下完成测试,并提供了基准测试数据,证实显存消耗得到显著降低。此外,他建议在使用 NVFP4 时仅对 VAE 应用 Torch Compile。由于官方仓库已长达七个月未更新,作者目前对是否提交 PR 持观望态度。

ImagineArt 表示,Seedance 2.5 将很快上线其平台,并通过 BytePlus 提供支持。 这条信息没有给出太多技术细节,但它仍然是一个明确的产品动态:一个媒体生成模型正进入面向用户的创作工具。对关注视频生成或多模态创作工作流的人来说,这意味着该模型又多了一个分发入口。
又一条用 Runway 上的 Seedance 2 做出的 NERF → 写实 风格转换测试视频。作者表示这个效果足够有趣,甚至考虑围绕它做成一部电影;最终成片还用了 CapCut 做剪辑。