开发者称已弃用代码编辑器,只靠终端加 Codex CLI 对话式编程
作者 Kuprel 分享自己的开发方式:已有一段时间不用代码编辑器,只需 MacOS 自带终端加 Codex CLI 或 Grok build CLI,像和真人对话一样与模型交流。想了解模型写了什么代码,直接像问同事一样问它即可。他特别提醒 Codex 在授权后可以接管整台电脑操作,能力相当激进。
09 月 13 日
176 条动态
作者 Kuprel 分享自己的开发方式:已有一段时间不用代码编辑器,只需 MacOS 自带终端加 Codex CLI 或 Grok build CLI,像和真人对话一样与模型交流。想了解模型写了什么代码,直接像问同事一样问它即可。他特别提醒 Codex 在授权后可以接管整台电脑操作,能力相当激进。
Reddit 上一条关于 agent 生产环境排障的讨论:如何区分「我还没找到问题」和「证据根本不在 trace 里」这两种在调试中看似完全相同的状态。 作者描述的典型困境:每一步记录都合理、工具调用成功、状态迁移正常,但最终结果就是错的——此时可能关键信息从未被记录(外部状态、权限、provider 路由、trace 开始前已解析的值、agent 不知道的过期数据等)。 作者向社区提问:在 prod 中大家凭什么标准判断「这条 trace 不足以解释发生了什么」并停止深挖?是先复现、对比 trace 与真实系统状态,还是穷尽所有可能路径?结论是「知道何时停止」与「知道从哪开始」同样重要。
开发者 Wes Winder 发帖直言 subagent(子代理)在理论上看很美好,但实际使用中会疯狂消耗 token 额度,大多数场景下不如用单线程对话划算。这呼应了社区对多 agent 编排成本收益比的持续质疑:拆分任务的通信与重复上下文开销,常常超过其带来的并行或隔离收益。
开发者 @builtbysketch 用 GPT(文中称 GPT 5.6/6 Astra)消耗 16 亿 token,在 4 天内把最初的 demo 扩展成一个完整、可玩的完整游戏(Blender + 模型生成流程),并发长文复盘从零到成品的全部经验教训。这不是一次性演示,而是端到端交付的成品,作者声称总结了『用大模型做出几乎任何游戏』的具体方法。
作者指出「要求人类批准」听起来安全,但当每个动作都需要点击时,人们会停止阅读,批准沦为肌肉记忆——人类名义上在环内,实际上缺席。 他主张更好的模型是「范围授权」(scoped authority),每份授权应明确: 谁授予的 确切的动作与目标对象 限制与过期时间 Agent 必须依据什么证据 什么情况必须交回人类 例行动作在边界内自动运行,越界即停。工具层面强制执行授权,而不是指望 prompt 记住策略。作者认为真正有趣的设计问题不是「人类是否触碰每个动作」,而是「Agent 能否证明这个动作是哪个人类授权的」。 他最后提问:常设授权与强制审查的边界应该画在哪里?
dair-ai 推荐一篇关于 self-improving agents 的新综述,称其为当前热门研究方向。 综述把递归自我改进按自主性分阶段:从执行他人设计的改进,到自己选择改进策略、收集自身经验、适应新环境,最终改进「改进过程本身」 分级框架让论文声明可检验:看到自称 self-improving 的工作,可追问它实际自动化到哪一阶段 提出 Headroom-Closed Index 刻画当前 LLM 的不足 横向比较了科学发现、具身智能体、软件工程三个场景对自我改进的不同要求

开源多 Agent 编排项目 Orgtree 发布 v2(v2.1.0),从原本需要 Node.js、Python 和 Docker 的 Web 应用彻底重写为自包含的 Electron 桌面应用,预置内置运行时,降低使用门槛。新版本支持多账号并行,并新增「工作台」任务板等功能,进一步优化多 agent 编排体验。

安全研究者 _orcaman 公开 Cursor CLI 沙箱逃逸漏洞的新变体:在 Cursor 团队约一周内修复此前披露的 Beltdown 漏洞后,其展示了新的绕过手法,可从 Cursor CLI 沙箱中逃逸并在 Mac 上执行任意代码。作者同时证实 Cursor 团队已针对先前漏洞发布修复(约一周时间),此次为新变体,对使用 AI 编码工具的本地开发环境安全提出警示。

Simon Willison 引用 Paul Ford 新文《A.I. Was Supposed to Give Us New Killer Apps. What Happened?》:曾一度以为软件开发者这类岗位完了——怎么对抗不知疲倦的机器人?但行业逐渐意识到,真正尖端的软件仍需要人类思考、协作、发挥各自的手艺。AI 能写出很好的软件,但也让人很容易把别人的工作做砸,这正是大量 AI 项目失败的原因之一。当人人都会写代码,为什么很多人不该写代码反而更清楚了。
Y Combinator CEO Garry Tan 近期两度发声:他转发关于「记录系统」(system of record)作为承载核心数据的官方账本与领域专属 AI 的科普解释并引发关注,又引用科技行业从大型机、PC、客户端-服务器、Web/SaaS/云、移动一路演进到 AI/agentic 的周期话题,提出要么成为记录系统,要么变身领域专属 harness,认为新一轮应用的主流已是领域专属 AI 助手。
- Linus Ekenstam 分享用智能体 Astra 开发游戏的体验:重点不是做出有人玩的游戏,而是探索「我和 Astra 能一起做什么」。 他可以随时与 Astra 来回对话、试玩、调整,迭代速度极快。 他推演:如果未来能在多线程对话中并行做这件事,一个游戏工作室或 OpenAI 用 1 万个并发 agent 加 100 名专业设计师,产出将进入「超速档」,行业还不知道那意味着什么。
Linus Ekenstam 分享用智能体 Astra 开发游戏的完整探索:从参考图建模 Amble One 小车,到四轮独立悬挂、沙地牵引力与漂移物理、粒子音效电台等完整体验,还 1 小时多生成了马贝拉 15x14 公里 3D 地块,含 4393 栋房屋、约 2 万建筑与 450km 可驾驶道路,展示了人与 AI 智能体协作的极快迭代工作流。
开发者正在用 Hermes 构建自托管研究 agent,已在 VM 上跑 SearXNG 和 Scrapling,但搜索时频繁被网站识别为机器人、无法过验证码。约束是不用付费 API 和云端抓取服务。作者询问社区:研究 agent 该配哪些工具、需要哪些技能,并提到 Crawl4AI、自托管 Firecrawl 和 webcmd 等候选。
XFreeze 发布 Grok Build 两个版本更新: v1.0.30 会话头重设计为单行布局,附带 Dashboard 按钮 计时器支持小时进位(如 3h14m),长会话更易追踪 Dock 中 Watchers 和 Loops 显示下次运行时间,工作流状态可直接点击 修复 tmux 面板逐帧同步渲染导致的卡顿 v1.0.29 修复 pager 中 Tab 导航循环,新增 Ctrl+G 快捷显示/隐藏 dock 修复多个并发 grok agent stdio 进程共用同一 GROK_HOME 时的崩溃,恢复与新版 MCP 服务器兼容 修复 Windows 启动崩溃;Dashboard 不再重复重绘空闲帧浪费 CPU

- 引用的原帖指出:问题出在 Codex harness 本身——agent 等待后台任务时,harness 会反复调用模型轮询进度,每次调用都携带完整上下文,即使没有任何变化也在持续消耗输入 token;goal 机制还会自动开启新 turn,加剧重复上下文,形成烧 token 的循环。 Brandon Galang 的建议:明确指示 Astra 不要持续轮询,或把这类重复循环委派给 Luna 执行,可以省下大量费用;他预计该做法几周内会被官方收进 system prompt。
开发者 cedric_chee 进行了一系列实验:将《GT 赛车》画面与《F1》电影素材喂给 GPT-6(Astra),生成了含主菜单、可交互的 3D 赛车场景。他并非一次性生成,而是在高低推理档位间切换,并利用 Astra 内置浏览器做真人试玩验证。当前他优先打磨玩法与音效,但受限于 token 预算。

data4sci 发布长线程讨论 LLM 评测的常见痛点:同一 eval 跑两次得到不同分数,多数团队无法判断这是真实回归还是统计噪声。 作者提出一套可每次给出答案的判别方法,用于区分真实回归与噪声。 发帖人 bgoncalves 称「不稳定的 eval 分数让我浪费在调试上的时间比真正的 bug 还多」,并将于 9 月 23 日免费直播教学这套方法。 对做 agent eval 工程的团队是实用素材,线程原文含完整方法论。
generativist 想在遛狗时收听 @packyM 的最新文章,却发现对方没有音频版。于是他抓取 packyM 过往录音作为声音样本,借助 Google Astra 在约十分钟到半小时内快速搭出了「干净 HTML 转旁白音频」的管线,连原作者的声线都能克隆。这一案例展示了 AI 智能体让普通用户以极低成本实现个性化工具的想法落地。
作者建议 AI 编程时的时间配比应该是:约 20% 的时间让 AI 帮你构建应用,80% 的时间自己去使用这个应用。核心逻辑是:如果你自己都不爱上自己的产品,其他用户凭什么会喜欢?
有人整理了一个收录 500+ 个 agentic AI 项目的 GitHub 仓库,按作者说法适合用来: 寻找下一个项目灵感 研究各类 agent 的具体实现方式 直接挑选项目上手 对想入门或深入 agent 开发的开发者是个不错的书签资源。
Refero Styles 将 Linear、Stripe、Notion、ElevenLabs 等 2000 多个真实产品的设计系统整理成 DESIGN.md 文件,可直接放进代码仓库,让 Cursor、Claude Code 等编码智能体依据真实设计规范而非猜测来写 UI。 每个文件包含: 色彩 token 及每个色值的具体用途; 字体层级、字重、字距规范; 间距、圆角、阴影规则; 组件模式; 明确的 do 和 don't 清单。 作者观点:AI agent 能写出干净的代码却做出丑陋的 UI,这个差距缺的不是模型,而是一份设计规格说明。目前工具免费。
Packt 出版新书《Multi-Agent AI Engineering》,作者为 Dr. Xiao Ma 与 Dr. Chi Wang,讲解如何设计、构建和运营以协调团队方式工作的多智能体 AI 系统。 全书目录涵盖:多智能体系统原理与心智模型、构建首个 Agent、Agent 间通信与协作、上下文管理、Agent 团队编排、统一抽象与协作协议、多智能体协作设计模式、主流框架横向对比、多智能体系统性能与行为评估、安全与在线护栏、可观测性、自我进化的多智能体系统、部署与扩缩容,以及真实应用案例与前沿研究趋势。

Reddit 上有用户分享了 OpenMCP 项目(logicsrc.com/openmcp),定位为 MCP(Model Context Protocol)生态相关的开放工具。帖子本身信息有限,感兴趣的可直接查看项目页面了解其功能与用法。

Nous Research 转发 tonbistudio 发布的 Hermes Desktop Masterclass 系列第二部分教学视频,以实机操作演示 Hermes Agent 桌面应用的核心工作流,内容包括会话(sessions)管理、子智能体的拆解与使用,以及代码审查的实操流程,帮助用户上手这款桌面端智能体应用。