编码 Agent 会自创形式语言,自然语言或成其元语言
作者提出观察与猜想:随着编码 agent 使用工具、skills 并开始发明自己的语言,我们可能看到形式语言与自然语言的融合。形式语言精确但脆弱,自然语言开放灵活,两者间存在连续谱。LLM agent 或将擅长不断向形式化表达靠拢,尤其用于与其他 agent 确定语义;而自然语言可能成为 agent 发明、批评、解释和修改其形式语言的元语言。
09 月 13 日
508 条动态
作者提出观察与猜想:随着编码 agent 使用工具、skills 并开始发明自己的语言,我们可能看到形式语言与自然语言的融合。形式语言精确但脆弱,自然语言开放灵活,两者间存在连续谱。LLM agent 或将擅长不断向形式化表达靠拢,尤其用于与其他 agent 确定语义;而自然语言可能成为 agent 发明、批评、解释和修改其形式语言的元语言。
Zvi 长文评 OpenAI 发布的 GPT-6 Astra: 核心判断 Sol→Astra 的跃升大于 Fable 5→5.1;Astra 原始智力因子为历代最高,是「雄心项目」、3D、游戏、computer use、子 agent 协调的最强模型,多项基准大幅跳升 但并非全面碾压:Fable 5.1 在来回讨论、写作等场景仍是首选;建议难问题上两个模型都用 常规编码进步不大;这是第一次「是不是 AGI」的争论不显得荒唐——Zvi 认为还不是,但不会嘲笑持不同意见者 官方口径与反响 Greg Brockman 宣称「欢迎来到 AGI 时代」,Sam Altman 称其为世界最佳 computer use/专业工作/科学/编码/网络安全模型;官方数据:FrontierMath Tier 4 达 98%、ARC-AGI 3 达 99.9%、ExploitBench 100% 发布视频在 Twitter 播放 1.25 亿次;Jensen Huang 也称其为 AGI Tibo 称 Astra 内测期间是公司最大竞争优势,产品计划因此提前 6 个月到 DevDay 发布;Dean W. Ball 称 Astra 是第一个「反过来抬高我野心」的 agent OpenAI 已软性透露内部还有高于 Astra 一级的模型;roon 称 Astra 的极限「不到一周就被摸到」 背景:Anthropic 节奏提案 文末引 Dario Amodei 新文《We Must Pace the Frontier》,核心为三步:前沿公司单边承诺接受 METR 等第三方嵌入式评估员(Anthropic 即刻承诺);民主国家前沿公司协调安全标准与进度限制;再尝试与威权政府全球协调。Zvi 将在下期完整覆盖。 其他 Astra 官方自述提到因安全与对齐标准而延迟发布,Mark Chen 强调对齐仍未解决、需与能力同步推进。后续待写:Navier-Stokes、Anthropic 失对齐报告、模型福祉等。
《Clean Code》作者 Robert C. Martin(Uncle Bob)发布新一期「Morning Bathrobe Rant」,主题为 Rethinking Harnesses,探讨当前 AI 编码 harness(智能体运行框架)的设计问题。正文仅附博客链接,具体论点需见原文。
CosmosMind 联合斯坦福、伯克利、MIT、清华等高校发布 MetaRSI-v1 技术报告,提出首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进架构,把「改进」本身也变成可递归优化的对象。 核心内容 LoopKernel 范式:将「进步如何发生」抽象为统一闭环——学习信号在 Data、Harness、Model 三个可写面上提出改动,由验证器裁决并回流,三者成为同一 Kernel 的不同实例化算子。 三种算子:Data-RSI 从运行轨迹提取并放大学习信号、标定能力边界;Harness-RSI 在 SystemPrompt/Skill/MCP/Tools/Memory 五个槽位上做加法与减法;Model-RSI 将验证有效的能力内化进参数。 纵横双轴编排:横轴由 RSI²Agent 决定算子顺序,纵轴由 Sub-Agent 改写算子内部策略,元层 MetaRSI²Agent 再优化编排策略本身,形成三层嵌套。 实验结果 小模型路线:Qwen3.5-35B-A3B(3B 激活)在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond、AIME 四项基准平均提升 10.9 分,SWE-bench Pro 解决率接近翻倍。 前沿模型路线:GPT-5.6、Claude Opus 5 等六款旗舰模型(仅启用 Data/Harness 算子、无外部教师)平均提升 7.3 分。 五条定律包括:验证器决定自改进前沿;自我认知会过期、重探能力边界是速率瓶颈;能力与载体无关但成本有关(应持续内化到更便宜载体);可信度须由不可写面度量(内部无法察觉放宽标准);循环不凭空创造能力、增益需区分「激发已有」与「外部新引入」。 团队同步开源了 RSI-Harness 与 Genome 开放社区,主张各科学领域只需任务族、验证器与初始脚手架三样东西即可接入循环。