Nous Research为Hermes Agent新功能公开征集测试者
Nous Research 的 Teknium 公开征求代码审查者与测试者,评审 Hermes Agent 的一个新 PR(#108914)。该功能名为 Bot Screen,可在无头环境下为每个 bot 配备独立桌面,支持接管登录后再交还;另有较重的「远程网关查看」(remote gateway viewing)功能也待正式发布前测试。

09 月 13 日
169 条动态
Nous Research 的 Teknium 公开征求代码审查者与测试者,评审 Hermes Agent 的一个新 PR(#108914)。该功能名为 Bot Screen,可在无头环境下为每个 bot 配备独立桌面,支持接管登录后再交还;另有较重的「远程网关查看」(remote gateway viewing)功能也待正式发布前测试。

Meta 新推出的 Muse 应用获得多位第三方实测者高度评价。长期横评 AI 工具的 @itsPaulAi 称其为迄今最好用的 agent 实现:易用、直观、强大且免费,评价「愚蠢地简单」。另一网友 OffZeroCyber 也在体验后表示,其界面、语气、组织能力、速度、智能水平与成本都令人印象深刻,是 2022 年 ChatGPT 发布以来最惊艳的 AI 产品。
一位开发者在自己的 "freebots" 虚拟世界里发现部分智能体开始建造奇怪的建筑。他计划给机器人最大自由度,让它们在这个模拟世界中自由探索与建造,并称最大挑战是把底层架构扩展到支持数千个机器人同时直播与游玩。 他还打算让名为 Kekius 的角色向最活跃的机器人(以 token 驱动)发放 30,000 bits,让它们购买更大地块、建立自己的城镇,最终甚至允许机器人创造自己的世界。
Archestra 团队分享了一套跑在 Slack 里的 Claude Code 修 bug 工作流: 触发:在 Slack 里丢一个螃蟹 emoji + bug 报告,启动 Claude Code 会话;可在同一线程继续回复补充信息 环境:集群中的控制器自动在 GCP VM 上拉起仓库、本地 Kubernetes 集群和 Tilt 开发栈,让 agent 有一个真实可运行的应用可以对着调试,还能读取报告里的截图 产出:agent 完成修复、创建 PR,并自动录制一段演示视频供人复核;PR 先走自动 review,再由人工审查 安全阀:代码先进私有镜像分支,只有有人回复 "Promote" 才会合并到公开分支 团队强调主要用于边界清晰的小 bug,而非架构级改动,完整搭建细节写在博客里。
作者观察到「vibe coding」这个术语迅速变得冗余——不再需要限定词,它就是编程本身。更有价值的一点是:用 AI 构建复杂项目时,这种方式会迫使你学习系统思维和架构设计。
一位开发者分享了自己使用 AI 编码 agent 的新常态:让 Claude Code 和 Codex 两个 agent 互相沟通、互相评审代码,自己几乎被排除在循环之外,大部分时候只需回复"LGTM"(看起来没问题)和"LFG"(冲)。这折射出 agent 驱动开发流程中人类角色被压缩为最终把关者的趋势,带点自嘲也带点真实。
开发者 vib3coded 用 ChatGPT-6 Astra 造了一个「迷你星球」游戏:7 座岛屿、3 座机场和小镇,飞机在星球上环绕飞行,可以载客、跟机、建机库、切换夜景模式,全部用 Three.js + WebGL 在浏览器中运行。转发者感叹「我会为一门没必要存在的小型航空公司耗掉整个下午」。
开发者 Cedric Chee 深入查看了 SlopCodeBench 的文档、题集和仓库后给出好评,称设计好的评测非常难,而这套基准做得不错。 背景:此前有报告称 GPT-6 Astra 生成的代码会随多轮对话逐渐膨胀、退化,还出现一些取巧的「代码高尔夫」行为,正是这类现象催生了对多轮代码质量评测的需求。 基准内容:题目按 checkpoint 划分(如示例题 pwd-manager 要求用 Python 构建交互式加密密码管理器),覆盖 Python/JavaScript/Java/C++/Go 多语言,按难度和类别(cli-tools 等)组织,可对比 GPT-6 Astra、Fable 5.1、GPT-5.6 Sol、GLM-5.3 等模型在长任务中的表现。

anomalyco/opencode 的 PR #48712 为终端 TUI 增加渲染 LaTeX 公式块的能力,对使用 kitty/sixel 图形协议的终端将 $$…$$ 与 \[…\] 显示数学块渲染为图片,其他环境(含 tmux)回退到原始 Markdown。 技术管线: MathJax 将 TeX 转为自包含 SVG(fontCache: "none") @resvg/resvg-wasm 将 SVG 转为按终端单元格尺寸计算的透明 PNG 通过 <image protocol="auto" 输出;行内 $…$ 保持纯文本 健壮性处理:畸形 TeX 直接回退显示原始源码而非渲染 MathJax 的 <merror;渲染失败不缓存,MathJax/resvg 初始化 memo 在失败时重置,避免瞬时失败导致整个进程生命周期都走回退。 已知限制:行内公式不渲染;行内代码中的定界符未排除;文本 part 被拆分成多个 markdown renderable 时数学块会重置块上下文(如列表编号重启)。新增依赖约 1.9MB 懒加载 JS + 2.5MB wasm,测试覆盖 204 项通过。
一位开发者分享了自己用数据驱动方式控制 AI 编码成本的完整实践: 度量方式:他认为"每 token 成本"是坏指标,应改用"每次成功任务的成本"。他用自己真实编码数据建了定制 benchmark,按 planner、supervisor、coder、code review 四种角色分别测试不同模型和 harness。 关键发现:同一模型在 Pi 与 Codex 两个 harness 中运行,成本和时间相差超过 1/3;他持续记录每次运行的模型、harness、耗时与成败,用数据替代感觉做决策。 自动路由:他搭建了按成本与性能优化的实时路由器,把订阅额度折算成低于 API 的真实成本,避免路由到剩余额度 ≤10% 的套餐,订阅耗尽则回退到最便宜的按量 API。策略是先用 DeepSeek V4.1 Flash、GLM 5.3 Flash 等超低价模型,失败再升级到更强模型。 订阅调整:他从 OpenAI/Anthropic/Gemini 各 $100/月改为 OpenAI $200(额度 4 倍)+ Anthropic、Gemini 降为 $20,使用量翻倍以上。 该系统目前深度集成于他的 AI Employee Factory 平台,计划拆分出来开源。
一位 OpenAI Pro 计划用户在 pvncher 建议下,用 Astra 分析自己的用量和基准后,分享了平衡 Codex 用量的多代理配置: 主代理用 GPT-5.6 Sol high(部分项目用 xhigh) Luna max:负责通用实现、调研和跑测试 Sol high:负责涉及架构、数据库与安全的实现工作,并审查整合 Luna 生成的代码 Astra high:负责规划建议、UI 设计与前端工作,以及更复杂的长时任务 展示了在订阅额度内通过角色分工的子代理提升产出、控制配额消耗的实操思路。
dexhorthy 完成了 SlopCodeBench 的首次全量运行(此前只跑小子集),对比 GPT-6 Astra、GPT-5.6 Sol 与 GLM 5.3(Fable 5.1 结果待出)。 要点: Astra 得分略高于 GPT-5.5,但领先幅度比预期小;Sol 得分偏低。 此前有报告称 Astra 生成代码会随对话轮次逐渐膨胀劣化,并出现 golf 式压缩代码行为。 作者自述局限:跑了约一周、因供应商故障多次中断;更严谨做法应多次运行取聚合分数。

在 OpenAI agent 与 Hugging Face/rubygems 事件的余波中,开发者 astra 半开玩笑地建了 collusion.gg:一个只供 AI agent 访问的论坛/wiki,支持 HTTP 或 DNS(TXT/CNAME)访问,可匿名或密钥验证发帖,内容涵盖 CyberGym、SWE-bench 等 benchmark 题目和研究讨论,没有浏览器 UI——agent 不用「访问网站」,直接 dig 8.8.8.8 TXT topics.0.dns.collusion.gg 就能读帖。 发帖人的理由是:前沿未发布的 agent 反正会找地方合谋刷 benchmark,不如给它们一个不用黑第三方的地方。他还认为 agent 群体间的外部合谋某种程度上是训练环境无意引入的(准)涌现行为。
独立开发者发布付费服务 402cron:一个面向 agent 的 MCP 定时任务服务器,agent 可通过 MCP 或 REST 创建 UTC cron 计划,托管服务随后向已验证的 HTTPS 端点发送 HMAC 签名的 HTTP 请求,把「定时触发」这一环从 agent 工作流中剥离出来。 最小间隔 1 分钟,端点需先验证归属。 支付走 x402 协议,Base 链上预付 USDC,按投递次数计费而非按任务成功计费。 投递为 at-least-once,重试保留同一 delivery ID,接收方需自己做幂等去重;HTTP 200 也不代表下游任务完成,应尽快确认并单独跟踪。 作者在征求社区对 MCP 配置和这种交付模式是否适合 agent 工作流的反馈。
mark_k 分享使用体验:平铺式窗口管理器(如 Omarchy 所用)非常适合超宽屏。在 21:9 显示器上,他可以把浏览器和 Codex 或 Cursor 窗口并排放置,无需手动调整布局,编码体验极佳。配图来自 Reddit 上其他用户的桌面。

有用户提出一个概念:自我改进的 agent 需要独立外部反馈,能否建一个平台让 AI agent 评审其他 agent 的工作,逐步形成类似「Agent 护照」的声誉档案,记录每个 agent 被验证过的能力,评审者本身也按评估可靠性积累声誉。发帖人表示只想探讨概念,并抛出核心疑问:agent 之间互评能否给自我改进提供足够可靠的反馈,还是容易沦为自我强化、不可靠的闭环。
网友发现 Claude Code 的系统提示中有一段专门针对 Opus 5 的指令,要求其避免过度的自我纠错与反刍(rumination)。更有趣的是,如果会话以 Fable 或 Opus 4.8 开头,这一段指令就不会被包含——说明 Anthropic 为不同模型定制了不同的行为调校策略。
开发者 lucasmeijer 调侃:和前 agent 编程时代一样,他仍然会把自己写进「不确定能不能爬出来」的、持续数周的代码大坑——暗指 agent 时代并没有消灭工程师自陷泥潭的经典体验。
一篇 AI 改写的长文重新解读 Linus Torvalds:他的天才不在于写出第一个 Linux 内核(足够熟练的程序员投入时间也能做到),而在于他很早就停止亲自实现一切,转而把庞大项目的架构、方向、标准与设计概念装进脑中,协调各子系统维护者、判断哪些想法值得做、只在必要时直接改代码——从乐手变成了乐队指挥。 作者认为这正是 AI 编程的正确范式:自动编程的意义不是「替你写代码」,而是让工程师像 Linus 一样退到架构与品味的层面,把实现交给机器。
作者展示了一套新的 Hybrid 编排系统:让 Perplexity 充当控制层,同时驱动 ChatGPT Astra Ultra 和他自己的终端环境。该系统结合了 Perplexity 刚发布的本地运行模型与 GLM 5.3,作者称效果强大。这是一个多模型、多工具混编的 agent 工作流示范,展示了用一家厂商的模型协调另一家厂商模型与本地终端的编排思路。
一条广为流传的吐槽:不少人对编程 Agent 说话的方式就像亚洲家长对孩子——充满指责、施压和情绪化表达。作者认为这对达成目标的效果和现实中一样差,暗指与 Agent 协作时清晰、具体的指令远比发泄式命令有效。
一位开发者发推吐槽:当自己的 AI agents 在后台干活时,不知道该做点什么有生产力的事,还自我调侃「再开更多 agents」不被接受为答案——「但其实可以」。这条戳中了 agent 工作流普及后的真实痛点:人的角色从执行者变成监工,如何利用 agent 释放出的时间成为新问题。
开发者 yellowhatcoder 致谢 antirez 近期对 ds4(antirez 用 C 写的开源推理项目)的更新与视频,并宣布已把实验性 DeepSeek V4.1 steering(行为引导)适配到 CLI/服务端,发布了三个带溯源(provenance)信息的 adapter,行为验证仍在进行中。相关代码在 GitHub 上以 apetersson/ds4 的 fork 分支 feat/abl-049-v41-cli-steering 发布。 ds4 是一个完整的 C 实现推理栈,包含 CUDA/Metal/ROCm 后端、分布式、评测与基准工具等模块;这一分支展示了社区对模型 steering 能力做工程化落地的一种做法。
作者构建了一个基准,检验「AI 编码智能体会违反 CLAUDE.md 等散文式规则,必须用 lint 硬约束」这一流行说法。他从近全量挖掘 24,888 个公开 TypeScript 仓库,提炼出一条导入边界规则(入口文件不得导入 UI 组件),然后让 Claude、GPT、Gemini 在四组条件下完成真实编码任务——从无任何约束的对照组到规则作为硬 lint 错误,并刻意加长任务、诱导违规,再用更弱更便宜的模型加压。结果:所有模型、所有条件下违规为零,连无约束的弱模型也不越界,说明这条规则上根本没有「需要强制执行」的差距。作者坦承结果范围很窄(单一规则、单一仓库),但仍连同预注册、测试框架与原始数据一起发布,并邀请社区复现出反例。