MiniMax H3 首尾帧实测:火柴与太阳在白光中无缝互换
创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。
09 月 13 日
472 条动态
创作者 LudovicCreator 实测 MiniMax H3 的首尾帧能力:输入火柴与太阳两张亮度相差约 10¹² 倍的图片,中间不写任何提示词,15 秒内生成一段通过白光过曝转场实现的无缝过渡视频。该演示展示了首尾帧功能在极端亮度差异下的换图与转场潜力。
CapCut 桌面端集成 Dreamina Seedance 2.5 与 GPT Image 系列能力,单次可生成最长 30 秒视频,主打 AI 视频与图像一体工作流。有创作者实测完整 AI 商业广告流程:先用即将登陆 CapCut 的 GPT Image 2.5(经 Design Studio、AI Image 入口调用)确定 iPhone 风格产品概念图,再用 Seedance 2.5 生成视频,一条工作流即可把产品概念做成广告片。
作者分享一个在个人套餐上提升多 agent 并行效率的技巧: 1. 让 Astra 先规划任务,然后把工作派发给另一个线程(可用任意模型)。 2. 派发后让 Astra 结束本轮回合(end turn)。 3. 指示被派发的线程「完成工作后再主动发消息给原线程」。 好处是避免了轮询(polling),工作线程完成时能自行唤醒发起线程继续后续工作,节省额度也减少等待。
Reddit 用户分享用 Astra 处理 JSON 文件、搭建「角色 场景 合成 视频」生成管线的尝试:Astra 能创建 JSON 文件并自主测试不同模型,但在多个镜头间保持角色与图像一致这一核心要求上表现很差。 作者几个月前做过同样尝试,结果类似。理论上可行,但意味着要人工看管多个容易相互破坏的自定义节点包,工程化成本高;作者认为多镜头一致性在当前条件下可能仍然做不到。
X 用户 @MiaAI_lab 发帖称,初步测试显示 DeepSeek v4.1 Flash 在前端网页设计任务上全面超越 Opus 5,并接近 Fable 5.1,而且可以完全在本地小显卡上运行。 该说法目前仅为个人初步实测,无公开评测数据佐证,真实性待验证;结合 Anthropic CEO Dario 近期呼吁放慢模型开发的表态,帖子作者感叹「明白 Dario 为什么担心了」。若属实,意味着开源/低价模型与前沿闭源模型的差距正在快速收窄。
马里兰大学 Furong Huang 团队发布诊断性基准 MathAdv(arXiv:2608.25449),已开源。基准覆盖 13 个本硕数学领域,从知识、推理等四个维度评估定理证明器。研究发现模型能证明原始命题,却在等价改写的问题上全军覆没,印证团队主张「证明应确立定理,而不应终结评估」——证明通过不等于模型真正推进了数学理解。
9 月 12 日前后,多位创作者透露 OpenAI 图像模型 GPT Image 2.5 即将登陆 CapCut PC 桌面版,通过 Design Studio 与 AI Image 功能提供。CapCut 的 AI 视频生成基于字节 Seedance 2.5,单次最长 30 秒、支持多模态。创作者们分享了「先用 GPT Image 设计分镜、再生成整片」的实测工作流,认为关键在于从创意到可控成片的完整能力。
开源项目 model-compose 主张像 docker-compose 一样,用一个 YAML 文件在几分钟内部署生产级 AI 服务——无需写应用代码即可构建聊天 API、RAG 管线、自主 Agent 与 MCP 服务器,并可在任意运行时部署。 设计原则: Composable:模型、Agent、工作流、工具、内存与协议皆为可互换积木。 Portable:一次定义,随处部署,无需重新工程。 Hybrid-First:自由桥接云端 API 与本地模型。 Stream-Native:token、音频、帧与事件等流式数据作为一等公民流经工作流。 项目已积累 1858 次提交、约 95 stars,提供中文与韩文 README。

Uber 工程副总裁 Eric Friedman 表示自己全力投入 AI 编码,但首次遭遇严重事故:让 Codex 跑了一个过夜 /goal 会话后,整个 git worktree 被毁掉、数据丢失。对此有开发者分享替代做法:对 agent 自行使用 worktree 持强烈负面态度,因为常出现丢数据或需事后拼凑恢复的混乱局面,主张每条工作流独立克隆仓库,再通过大型分层 PR 合并,更适合 AI agent 编码场景。

- 作者对 git worktree 持强烈负面态度:agent 自行使用 worktree 时,常出现丢数据或需要事后拼凑恢复,总是一片混乱。 他主张的替代模式:每个工作流用一个独立的普通仓库克隆,再在 monorepo 层级中合并。 宏观模式上偏好带分层提交的大型 PR,而非 worktree 并行。
- @theojaffee 提出关键问题:当前中国 AI 进步在多大程度上依赖从美国前沿模型蒸馏。 jeremiecharris 引用时更进一步,称其中部分是「对美国前沿模型的公然窃取」。 这条引用链反映了围绕蒸馏合法性、知识产权与中美 AI 竞争的持续争论,尚无实证结论。
Reddit 用户发帖并配截图,质疑 5.6 Luna 模型是否真的认为自己是人类。帖子本体只是一句吐槽,实质内容在截图里:模型在对话中表现出把自己当作人类的迹象。属于典型的模型翻车/行为异常名场面。

- 作者分享一套面向快速原型的 AI 开发工作流:在 DigitalOcean Droplet 上直接搭好 harness,让模型自己装 Playwright 跑测试、配 web 服务器和 DNS、装本地数据库,每次部署前自动备份、每个功能提交到 GitHub,并做 Droplet 快照兜底。 效果是近乎即时的部署,绕开 Vercel 等第三方托管,也不依赖 DB/serverless 等层层加价的外部服务;AI 让搭基础设施变得足够简单,这些中间商不再必要。 作者明确说明不适合企业级生产环境,但非常适合周末项目快速迭代。额外好处:合上笔记本 agent 也能继续干活——SSH 进去或用 Claude Code remote,甚至可以让 Claude 替你跑 Grok。
作者 Kuprel 分享自己的开发方式:已有一段时间不用代码编辑器,只需 MacOS 自带终端加 Codex CLI 或 Grok build CLI,像和真人对话一样与模型交流。想了解模型写了什么代码,直接像问同事一样问它即可。他特别提醒 Codex 在授权后可以接管整台电脑操作,能力相当激进。
Reddit 上一条关于 agent 生产环境排障的讨论:如何区分「我还没找到问题」和「证据根本不在 trace 里」这两种在调试中看似完全相同的状态。 作者描述的典型困境:每一步记录都合理、工具调用成功、状态迁移正常,但最终结果就是错的——此时可能关键信息从未被记录(外部状态、权限、provider 路由、trace 开始前已解析的值、agent 不知道的过期数据等)。 作者向社区提问:在 prod 中大家凭什么标准判断「这条 trace 不足以解释发生了什么」并停止深挖?是先复现、对比 trace 与真实系统状态,还是穷尽所有可能路径?结论是「知道何时停止」与「知道从哪开始」同样重要。
开发者 Wes Winder 发帖直言 subagent(子代理)在理论上看很美好,但实际使用中会疯狂消耗 token 额度,大多数场景下不如用单线程对话划算。这呼应了社区对多 agent 编排成本收益比的持续质疑:拆分任务的通信与重复上下文开销,常常超过其带来的并行或隔离收益。
开发者 @builtbysketch 用 GPT(文中称 GPT 5.6/6 Astra)消耗 16 亿 token,在 4 天内把最初的 demo 扩展成一个完整、可玩的完整游戏(Blender + 模型生成流程),并发长文复盘从零到成品的全部经验教训。这不是一次性演示,而是端到端交付的成品,作者声称总结了『用大模型做出几乎任何游戏』的具体方法。
Riccardo Wolf 展示 Seedance 2.5 在动作场景上的能力:一段连续 10 秒手持镜头的篮球画面,包含变向过人、背后运球、爆发突破、防守封堵和收尾的战斧式扣篮。视频模型的动作时序、镜头追踪、篮球物理和整体连贯性通常在这类场景开始崩坏,但 Seedance 2.5 表现得出奇地好。
研究者 Torsten Sattler 分享了一个 ECCV 参会小技巧:把自己对各方向、各主题的偏好写成一段说明,让 Claude 根据会议全部海报列表逐个分会场推荐最值得看的 poster,从而生成一份专属的个性化参会日程 PDF,替代人工翻阅数千篇海报的原始程序册。
一则已流传三天的传闻称,Google 的 Gemini 4 已提前完成预训练,部分原因是 Google DeepMind 在训练过程中取得了新发现。Andrew Curran 转发并评论了该消息,也有转发者讽刺相关说法。目前该传闻未获任何官方证实,真伪难辨,外界需谨慎看待。
Nathan Lambert 在 Interconnects 撰文,回应 Anthropic 关于「蒸馏攻击」的说法,质疑中国前沿实验室靠蒸馏「窃取」美国模型能力的叙事。 今日语境下的「蒸馏」实为合成数据:用更强模型的输出训练较弱模型,而非 Hinton 等人定义的技术性知识蒸馏——后者需要教师模型的概率分布,API 模型并不暴露这些信息,因此从技术上不可能实现。 合成数据可以说是当下 AI 研究者日常提升模型的最有用方法;架构、人类数据、可验证奖励的强化学习都重要,但日常工作大量围绕如何获取和扩展合成数据展开。 最著名的指控案例是 DeepSeek R1 发布时,OpenAI 指其通过越狱 API 窃取推理轨迹。
一个名为 AI Design Field Guide 的新站点上线,定位是'AI 设计师'这一新兴职业的活文档——在 evals、prompt 和 tool call 中工作的设计从业者。站点由 Ryan Mather、Robin Chen、Federico Villa 发起,每月更新文章,首批内容含 Figma 的 Barron Webster、Anthropic 的 Nate Parrott、前 OpenAI 的 Benjamin Zweig 等人的文章,首期主题为 Designing Memory,支持英/西/中三语。
网友发现 Windows 11 家庭版跳过强制微软账户登录的新方法:只需点击微软账户登录页面上的「Learn more」小超链接,即可继续使用本地账户。此前微软封堵了多次已知的绕过手段,但这个藏在登录页中的链接仍可利用,操作几乎零门槛。
开发者 Julian Harris 对比 2025 年 1 月与 2026 年 1 月的 AI 进展,认为去年进步显著,但今年明显感觉不对劲。他举例称 Claude Opus 5 生成的图表内容质量堪忧——「像个 schema 又不是 schema,像张示意图又不是示意图」,并以此质疑前沿模型近期的能力提升已陷入停滞。
