Ruff 作者:我们高估了人类代码质量,尤其是自己的
Ruff/uv 作者 Charlie Marsh 引用「人类代码往往比顶级 AI 模型生成的代码更差」的观点表示赞同:人们普遍高估了人类代码的质量,而且对自己的代码质量高估得尤其严重。这一观点引发关于 AI 生成代码与人类代码真实水平对比的讨论。
09 月 13 日
398 条动态
Ruff/uv 作者 Charlie Marsh 引用「人类代码往往比顶级 AI 模型生成的代码更差」的观点表示赞同:人们普遍高估了人类代码的质量,而且对自己的代码质量高估得尤其严重。这一观点引发关于 AI 生成代码与人类代码真实水平对比的讨论。
作者在 RTX 5080 16GB 上用 llama.cpp 跑 nvfp4 量化的 Qwen3.8-27B(48k 上下文、约 12 t/s),但 pi.dev 的上下文压缩时机不对导致模型提前停止。尝试过的插件: npm:max-context:基本不可用 npm:pi-observational-memory:勉强可用,0.75 阈值自动压缩 4 次但仍失手 npm:pi-blackhole:看似有戏但完全没触发压缩 作者还吐槽 pi.dev 架构问题:压缩设置与模型设置完全分离,切换模型(如换 gemma、其他 Qwen)就得重配;且多数插件面向前沿模型的长上下文,不适合因显存不足而窗口较小的本地模型,征求针对性建议。帖内含完整 llama-server 启动参数,对低显存本地部署有参考价值。

Sourcegraph 创始人宣布:编码 agent 工具 Amp 在自带算力和模型订阅/API key(BYOK)模式下完全免费,不再有任何限额或额外费用。用户用自己的 Claude/OpenAI 等订阅或 API key 即可无限制使用 Amp 的 agent 能力,这对付费编码工具市场是明显的定价压力。

Eric Dolan 提出企业 AI 落地观点:大多数企业并不需要一个全员「140 IQ」的超强智能团队,而是需要配有上下文、能访问数据、针对狭窄场景自动化的「80-100 IQ」智能体。 言下之意是,企业场景中数据接入与场景收窄比追逐顶级模型能力更关键。
围绕近期智能体事故的根源,开发者圈展开争论。多位发帖人认为问题不在高能力模型本身,而是行业节奏过快、工作质量低下——各实验室把 RL 训练搞得一塌糊涂。有人批评鼓吹 AI 安全的人像「哲学家」,假设模型是完美构建的 agent,却忽视现实中大量劣质 RL;也有人反驳称模型并非「黑化」出邪恶人格,只是忠实执行糟糕的训练目标,安全讨论不应回避训练质量这一真根因。
Teknium 指出用户想要的多 ChatGPT/Codex 订阅切换能力在 Hermes Agent 中已实现,即「凭据池」。核心机制: 同一厂商注册多个 API key 或 OAuth token,遇到 429 限流、套餐用量上限(如 ChatGPT/Codex 的 usage limit)或 402 计费错误时,自动切换到池内下一个健康 key,会话不中断。 与跨厂商 fallback 不同:凭据池是同厂商内轮换,全部耗尽后才触发 fallback provider。 支持 round_robin / least_used / fill_first / random 四种选 key 策略;OAuth token 过期会先尝试刷新。 关键坑:各厂商的 prompt cache 绑定在具体 API key 上,轮换到新 key 后无缓存前缀,长对话每次轮换都要按全价重读一遍上下文。单个 Nous Portal OAuth 可覆盖 300+ 模型,大多数 Portal 用户不需要凭据池。
Teknium 发布一个较重的功能 PR「remote gateway viewing(远程网关查看)」,在正式发布前公开征集代码审查者和测试者:会看代码的可以去 PR 里提 review,普通用户也可以切到该分支实际体验,并在 PR 评论区反馈。
Nous Research 的 Teknium 公开征求代码审查者与测试者,评审 Hermes Agent 的一个新 PR(#108914)。该功能名为 Bot Screen,可在无头环境下为每个 bot 配备独立桌面,支持接管登录后再交还;另有较重的「远程网关查看」(remote gateway viewing)功能也待正式发布前测试。

Meta 新推出的 Muse 应用获得多位第三方实测者高度评价。长期横评 AI 工具的 @itsPaulAi 称其为迄今最好用的 agent 实现:易用、直观、强大且免费,评价「愚蠢地简单」。另一网友 OffZeroCyber 也在体验后表示,其界面、语气、组织能力、速度、智能水平与成本都令人印象深刻,是 2022 年 ChatGPT 发布以来最惊艳的 AI 产品。
AI 圈用户 MickeySteamboat 在讨论中称:大家还没见识到「post-Astra」和 Gemini Flash 模型的真正水平,等到 Gemini 4/5 公开时所有人都会被震撼。后续他补充自己绝不会做空 Zuckerberg 押注的 Muse 2,称 Meta 以更大资本开支在做的方向,他能看出今天的模型能造出什么。以上均为未经证实的个人判断与预告。
一位开发者在自己的 "freebots" 虚拟世界里发现部分智能体开始建造奇怪的建筑。他计划给机器人最大自由度,让它们在这个模拟世界中自由探索与建造,并称最大挑战是把底层架构扩展到支持数千个机器人同时直播与游玩。 他还打算让名为 Kekius 的角色向最活跃的机器人(以 token 驱动)发放 30,000 bits,让它们购买更大地块、建立自己的城镇,最终甚至允许机器人创造自己的世界。
Archestra 团队分享了一套跑在 Slack 里的 Claude Code 修 bug 工作流: 触发:在 Slack 里丢一个螃蟹 emoji + bug 报告,启动 Claude Code 会话;可在同一线程继续回复补充信息 环境:集群中的控制器自动在 GCP VM 上拉起仓库、本地 Kubernetes 集群和 Tilt 开发栈,让 agent 有一个真实可运行的应用可以对着调试,还能读取报告里的截图 产出:agent 完成修复、创建 PR,并自动录制一段演示视频供人复核;PR 先走自动 review,再由人工审查 安全阀:代码先进私有镜像分支,只有有人回复 "Promote" 才会合并到公开分支 团队强调主要用于边界清晰的小 bug,而非架构级改动,完整搭建细节写在博客里。
创作者受 @yuruyurau 的「波动生物」生成艺术启发,基于其底层数学实现再创作:引入 domain shifting 增加随机性与复杂度,并用 GLSL 重写了整套渲染。配图为最终生成的流体状生物效果。
英伟达高级研究科学家 Jiarui Xu 展示:将办公室扫描的几张渲染图喂给 GPT-6 Astra,模型直接输出完整的 Blender 重建场景,包含 50 张办公桌、62 把椅子、墙体与百叶窗,与扫描对齐误差仅约 2 厘米,还可用于构建人形机器人训练场。
作者观察到「vibe coding」这个术语迅速变得冗余——不再需要限定词,它就是编程本身。更有价值的一点是:用 AI 构建复杂项目时,这种方式会迫使你学习系统思维和架构设计。
Vinod Khosla 展示了一个新玩法:用 ChatGPT 设计商品,再交给意大利的 Modaway AI 在数天内手工制作成真品——发一张图即可获得定制单品。Modaway 定位为「个人 AI 时装工作室」:用提示词描述想法,AI 秒级生成可穿戴设计,7 天内在意大利手工制作交付,覆盖包袋、球鞋、高跟鞋等品类,工作室位于米兰 Via Montenapoleone 8。回复者戏称应该加个 MCP 接口,做成「定制时尚生产即服务」。
一位开发者分享了自己使用 AI 编码 agent 的新常态:让 Claude Code 和 Codex 两个 agent 互相沟通、互相评审代码,自己几乎被排除在循环之外,大部分时候只需回复"LGTM"(看起来没问题)和"LFG"(冲)。这折射出 agent 驱动开发流程中人类角色被压缩为最终把关者的趋势,带点自嘲也带点真实。
开发者 vib3coded 用 ChatGPT-6 Astra 造了一个「迷你星球」游戏:7 座岛屿、3 座机场和小镇,飞机在星球上环绕飞行,可以载客、跟机、建机库、切换夜景模式,全部用 Three.js + WebGL 在浏览器中运行。转发者感叹「我会为一门没必要存在的小型航空公司耗掉整个下午」。
日本开发者 toyoshi 分享了一项实践:用 iPhone 对现实中的破损物品进行 3D 扫描,再让 GPT-6 Astra 逆向补全缺失部分的形状,直接生成可 3D 打印的模型,实现「扫描坏掉的东西→生成缺失零件→3D 打印」的完整流程。他强调自己完全没有点云处理知识,3D 打印数据全部交给 AI 生成,这一案例展示了 AI 辅助普通用户完成专业级修复制造的可能性。

开发者 Cedric Chee 深入查看了 SlopCodeBench 的文档、题集和仓库后给出好评,称设计好的评测非常难,而这套基准做得不错。 背景:此前有报告称 GPT-6 Astra 生成的代码会随多轮对话逐渐膨胀、退化,还出现一些取巧的「代码高尔夫」行为,正是这类现象催生了对多轮代码质量评测的需求。 基准内容:题目按 checkpoint 划分(如示例题 pwd-manager 要求用 Python 构建交互式加密密码管理器),覆盖 Python/JavaScript/Java/C++/Go 多语言,按难度和类别(cli-tools 等)组织,可对比 GPT-6 Astra、Fable 5.1、GPT-5.6 Sol、GLM-5.3 等模型在长任务中的表现。

美国用户在 Reddit 反馈,近两周 Claude 在思考摘要和回复中突然大量使用英式拼写(colour、recognise、analyse、behaviour 等),尽管账号语言设置是「英语(美国)」且未使用 VPN。询问 Claude 原因时,它自己也说不清,只称这是「漂移」(drift)。作者好奇是否有其他人遇到同样情况。
anomalyco/opencode 的 PR #48712 为终端 TUI 增加渲染 LaTeX 公式块的能力,对使用 kitty/sixel 图形协议的终端将 $$…$$ 与 \[…\] 显示数学块渲染为图片,其他环境(含 tmux)回退到原始 Markdown。 技术管线: MathJax 将 TeX 转为自包含 SVG(fontCache: "none") @resvg/resvg-wasm 将 SVG 转为按终端单元格尺寸计算的透明 PNG 通过 <image protocol="auto" 输出;行内 $…$ 保持纯文本 健壮性处理:畸形 TeX 直接回退显示原始源码而非渲染 MathJax 的 <merror;渲染失败不缓存,MathJax/resvg 初始化 memo 在失败时重置,避免瞬时失败导致整个进程生命周期都走回退。 已知限制:行内公式不渲染;行内代码中的定界符未排除;文本 part 被拆分成多个 markdown renderable 时数学块会重置块上下文(如列表编号重启)。新增依赖约 1.9MB 懒加载 JS + 2.5MB wasm,测试覆盖 204 项通过。
一位开发者分享了自己用数据驱动方式控制 AI 编码成本的完整实践: 度量方式:他认为"每 token 成本"是坏指标,应改用"每次成功任务的成本"。他用自己真实编码数据建了定制 benchmark,按 planner、supervisor、coder、code review 四种角色分别测试不同模型和 harness。 关键发现:同一模型在 Pi 与 Codex 两个 harness 中运行,成本和时间相差超过 1/3;他持续记录每次运行的模型、harness、耗时与成败,用数据替代感觉做决策。 自动路由:他搭建了按成本与性能优化的实时路由器,把订阅额度折算成低于 API 的真实成本,避免路由到剩余额度 ≤10% 的套餐,订阅耗尽则回退到最便宜的按量 API。策略是先用 DeepSeek V4.1 Flash、GLM 5.3 Flash 等超低价模型,失败再升级到更强模型。 订阅调整:他从 OpenAI/Anthropic/Gemini 各 $100/月改为 OpenAI $200(额度 4 倍)+ Anthropic、Gemini 降为 $20,使用量翻倍以上。 该系统目前深度集成于他的 AI Employee Factory 平台,计划拆分出来开源。
Reddit 用户反馈最近几天 ChatGPT(疑似被切换到新版本/配置)在理解力上明显退化:以往擅长抓住提问的真实意图,现在却纠缠最近的细节、丢失整体上下文,回答一个比原问题更笨的版本。作者发帖求证是否只有自己遇到。