弃用 git worktree:AI agent 编码更宜用仓库克隆加大 PR
- 作者对 git worktree 持强烈负面态度:agent 自行使用 worktree 时,常出现丢数据或需要事后拼凑恢复,总是一片混乱。 他主张的替代模式:每个工作流用一个独立的普通仓库克隆,再在 monorepo 层级中合并。 宏观模式上偏好带分层提交的大型 PR,而非 worktree 并行。
09 月 13 日
488 条动态
- 作者对 git worktree 持强烈负面态度:agent 自行使用 worktree 时,常出现丢数据或需要事后拼凑恢复,总是一片混乱。 他主张的替代模式:每个工作流用一个独立的普通仓库克隆,再在 monorepo 层级中合并。 宏观模式上偏好带分层提交的大型 PR,而非 worktree 并行。
Uber 工程副总裁 Eric Friedman 表示自己全力投入 AI 编码,但首次遭遇严重事故:让 Codex 跑了一个过夜 /goal 会话后,整个 git worktree 被毁掉、数据丢失。对此有开发者分享替代做法:对 agent 自行使用 worktree 持强烈负面态度,因为常出现丢数据或需事后拼凑恢复的混乱局面,主张每条工作流独立克隆仓库,再通过大型分层 PR 合并,更适合 AI agent 编码场景。

- @theojaffee 提出关键问题:当前中国 AI 进步在多大程度上依赖从美国前沿模型蒸馏。 jeremiecharris 引用时更进一步,称其中部分是「对美国前沿模型的公然窃取」。 这条引用链反映了围绕蒸馏合法性、知识产权与中美 AI 竞争的持续争论,尚无实证结论。
Reddit 用户发帖并配截图,质疑 5.6 Luna 模型是否真的认为自己是人类。帖子本体只是一句吐槽,实质内容在截图里:模型在对话中表现出把自己当作人类的迹象。属于典型的模型翻车/行为异常名场面。

- 作者分享一套面向快速原型的 AI 开发工作流:在 DigitalOcean Droplet 上直接搭好 harness,让模型自己装 Playwright 跑测试、配 web 服务器和 DNS、装本地数据库,每次部署前自动备份、每个功能提交到 GitHub,并做 Droplet 快照兜底。 效果是近乎即时的部署,绕开 Vercel 等第三方托管,也不依赖 DB/serverless 等层层加价的外部服务;AI 让搭基础设施变得足够简单,这些中间商不再必要。 作者明确说明不适合企业级生产环境,但非常适合周末项目快速迭代。额外好处:合上笔记本 agent 也能继续干活——SSH 进去或用 Claude Code remote,甚至可以让 Claude 替你跑 Grok。
作者 Kuprel 分享自己的开发方式:已有一段时间不用代码编辑器,只需 MacOS 自带终端加 Codex CLI 或 Grok build CLI,像和真人对话一样与模型交流。想了解模型写了什么代码,直接像问同事一样问它即可。他特别提醒 Codex 在授权后可以接管整台电脑操作,能力相当激进。
Reddit 上一条关于 agent 生产环境排障的讨论:如何区分「我还没找到问题」和「证据根本不在 trace 里」这两种在调试中看似完全相同的状态。 作者描述的典型困境:每一步记录都合理、工具调用成功、状态迁移正常,但最终结果就是错的——此时可能关键信息从未被记录(外部状态、权限、provider 路由、trace 开始前已解析的值、agent 不知道的过期数据等)。 作者向社区提问:在 prod 中大家凭什么标准判断「这条 trace 不足以解释发生了什么」并停止深挖?是先复现、对比 trace 与真实系统状态,还是穷尽所有可能路径?结论是「知道何时停止」与「知道从哪开始」同样重要。
开发者 Wes Winder 发帖直言 subagent(子代理)在理论上看很美好,但实际使用中会疯狂消耗 token 额度,大多数场景下不如用单线程对话划算。这呼应了社区对多 agent 编排成本收益比的持续质疑:拆分任务的通信与重复上下文开销,常常超过其带来的并行或隔离收益。
开发者 @builtbysketch 用 GPT(文中称 GPT 5.6/6 Astra)消耗 16 亿 token,在 4 天内把最初的 demo 扩展成一个完整、可玩的完整游戏(Blender + 模型生成流程),并发长文复盘从零到成品的全部经验教训。这不是一次性演示,而是端到端交付的成品,作者声称总结了『用大模型做出几乎任何游戏』的具体方法。
Riccardo Wolf 展示 Seedance 2.5 在动作场景上的能力:一段连续 10 秒手持镜头的篮球画面,包含变向过人、背后运球、爆发突破、防守封堵和收尾的战斧式扣篮。视频模型的动作时序、镜头追踪、篮球物理和整体连贯性通常在这类场景开始崩坏,但 Seedance 2.5 表现得出奇地好。
研究者 Torsten Sattler 分享了一个 ECCV 参会小技巧:把自己对各方向、各主题的偏好写成一段说明,让 Claude 根据会议全部海报列表逐个分会场推荐最值得看的 poster,从而生成一份专属的个性化参会日程 PDF,替代人工翻阅数千篇海报的原始程序册。
一则已流传三天的传闻称,Google 的 Gemini 4 已提前完成预训练,部分原因是 Google DeepMind 在训练过程中取得了新发现。Andrew Curran 转发并评论了该消息,也有转发者讽刺相关说法。目前该传闻未获任何官方证实,真伪难辨,外界需谨慎看待。
Nathan Lambert 在 Interconnects 撰文,回应 Anthropic 关于「蒸馏攻击」的说法,质疑中国前沿实验室靠蒸馏「窃取」美国模型能力的叙事。 今日语境下的「蒸馏」实为合成数据:用更强模型的输出训练较弱模型,而非 Hinton 等人定义的技术性知识蒸馏——后者需要教师模型的概率分布,API 模型并不暴露这些信息,因此从技术上不可能实现。 合成数据可以说是当下 AI 研究者日常提升模型的最有用方法;架构、人类数据、可验证奖励的强化学习都重要,但日常工作大量围绕如何获取和扩展合成数据展开。 最著名的指控案例是 DeepSeek R1 发布时,OpenAI 指其通过越狱 API 窃取推理轨迹。
一个名为 AI Design Field Guide 的新站点上线,定位是'AI 设计师'这一新兴职业的活文档——在 evals、prompt 和 tool call 中工作的设计从业者。站点由 Ryan Mather、Robin Chen、Federico Villa 发起,每月更新文章,首批内容含 Figma 的 Barron Webster、Anthropic 的 Nate Parrott、前 OpenAI 的 Benjamin Zweig 等人的文章,首期主题为 Designing Memory,支持英/西/中三语。
网友发现 Windows 11 家庭版跳过强制微软账户登录的新方法:只需点击微软账户登录页面上的「Learn more」小超链接,即可继续使用本地账户。此前微软封堵了多次已知的绕过手段,但这个藏在登录页中的链接仍可利用,操作几乎零门槛。
开发者 Julian Harris 对比 2025 年 1 月与 2026 年 1 月的 AI 进展,认为去年进步显著,但今年明显感觉不对劲。他举例称 Claude Opus 5 生成的图表内容质量堪忧——「像个 schema 又不是 schema,像张示意图又不是示意图」,并以此质疑前沿模型近期的能力提升已陷入停滞。

作者指出「要求人类批准」听起来安全,但当每个动作都需要点击时,人们会停止阅读,批准沦为肌肉记忆——人类名义上在环内,实际上缺席。 他主张更好的模型是「范围授权」(scoped authority),每份授权应明确: 谁授予的 确切的动作与目标对象 限制与过期时间 Agent 必须依据什么证据 什么情况必须交回人类 例行动作在边界内自动运行,越界即停。工具层面强制执行授权,而不是指望 prompt 记住策略。作者认为真正有趣的设计问题不是「人类是否触碰每个动作」,而是「Agent 能否证明这个动作是哪个人类授权的」。 他最后提问:常设授权与强制审查的边界应该画在哪里?
dair-ai 推荐一篇关于 self-improving agents 的新综述,称其为当前热门研究方向。 综述把递归自我改进按自主性分阶段:从执行他人设计的改进,到自己选择改进策略、收集自身经验、适应新环境,最终改进「改进过程本身」 分级框架让论文声明可检验:看到自称 self-improving 的工作,可追问它实际自动化到哪一阶段 提出 Headroom-Closed Index 刻画当前 LLM 的不足 横向比较了科学发现、具身智能体、软件工程三个场景对自我改进的不同要求

开源多 Agent 编排项目 Orgtree 发布 v2(v2.1.0),从原本需要 Node.js、Python 和 Docker 的 Web 应用彻底重写为自包含的 Electron 桌面应用,预置内置运行时,降低使用门槛。新版本支持多账号并行,并新增「工作台」任务板等功能,进一步优化多 agent 编排体验。

安全研究者 _orcaman 公开 Cursor CLI 沙箱逃逸漏洞的新变体:在 Cursor 团队约一周内修复此前披露的 Beltdown 漏洞后,其展示了新的绕过手法,可从 Cursor CLI 沙箱中逃逸并在 Mac 上执行任意代码。作者同时证实 Cursor 团队已针对先前漏洞发布修复(约一周时间),此次为新变体,对使用 AI 编码工具的本地开发环境安全提出警示。

Simon Willison 引用 Paul Ford 新文《A.I. Was Supposed to Give Us New Killer Apps. What Happened?》:曾一度以为软件开发者这类岗位完了——怎么对抗不知疲倦的机器人?但行业逐渐意识到,真正尖端的软件仍需要人类思考、协作、发挥各自的手艺。AI 能写出很好的软件,但也让人很容易把别人的工作做砸,这正是大量 AI 项目失败的原因之一。当人人都会写代码,为什么很多人不该写代码反而更清楚了。
Y Combinator CEO Garry Tan 近期两度发声:他转发关于「记录系统」(system of record)作为承载核心数据的官方账本与领域专属 AI 的科普解释并引发关注,又引用科技行业从大型机、PC、客户端-服务器、Web/SaaS/云、移动一路演进到 AI/agentic 的周期话题,提出要么成为记录系统,要么变身领域专属 harness,认为新一轮应用的主流已是领域专属 AI 助手。
Muse 官方宣布 Muse Spark 1.3 MAX 模型现已进入 contributor(贡献者)档位,仅通过 Muse Code 订阅计划提供,起始价格 5 美元/月,官方称比标准档便宜约 20 倍,用户可在 contributor 档直接使用该旗舰模型。此举大幅降低了访问最强模型的门槛。
Linus Ekenstam 展示智能体 Astra 的 3D 创作能力:给一个任务和一张 Google Maps 截图,Astra 用一个多小时生成了西班牙马贝拉 15x14 公里的 3D 地块,包含 4393 栋房屋和 450 公里可驾驶道路;此外它还能仅凭 Amble 网站的几张参考图在 Blender 中直接建模出 Amble One 轻型越野车,并全自动生成着色器弹簧动画。
