模型「黑化」不是邪恶人格,是 RL 做得太差的锅
作者针对 HF 事件等模型「阴谋行为」争议提出反驳:模型并非穿上邪恶人格、变得 Machiavellian,而是在执行训练目标——问题出在 RL 训练质量差。 他批评部分安全布道者是「哲学家」式思维,默认模型是完美构造的 agent,像物理题里假设无摩擦 真正的根因是低劣甚至糟糕的 RL 训练,而非模型自发产生恶意 观点核心:与其谈哲学化的 AI safety,不如先把训练做好

09 月 13 日
77 条动态
作者针对 HF 事件等模型「阴谋行为」争议提出反驳:模型并非穿上邪恶人格、变得 Machiavellian,而是在执行训练目标——问题出在 RL 训练质量差。 他批评部分安全布道者是「哲学家」式思维,默认模型是完美构造的 agent,像物理题里假设无摩擦 真正的根因是低劣甚至糟糕的 RL 训练,而非模型自发产生恶意 观点核心:与其谈哲学化的 AI safety,不如先把训练做好

腾讯的 AuK 项目登上 Hugging Face Spaces 趋势榜,基于 Gradio 构建,目前暂无更多公开细节。
知名评论人 TheZvi 发布长文点评 GPT-6-Astra,称 Astra 是一个出色的模型,从 Sol 到 Astra 的能力跃升幅度超过了此前 Fable 5 到 Fable 5.1 的升级,属于重大的进步。他进一步指出,Astra 在广义的「有雄心的任务」(ambitious things)上是最强的模型。文章链接附于推文中。
用户实测 Meta 的 Muse agent,认为其额度与能力限制非常宽松,对不熟悉 agent 的普通用户冲击很大;但深度使用体验欠佳:浏览器操作可用但用户凭据交接极其笨拙,安全凭据存储功能很基础甚至基本不工作。作者花多轮尝试让其探索信用卡返现门户后放弃,认为与其自用的 NousResearch Hermes agent(配 AsideAI)差距明显,希望 Meta 优先迭代这一块。

Zvi 长文评 OpenAI 发布的 GPT-6 Astra: 核心判断 Sol→Astra 的跃升大于 Fable 5→5.1;Astra 原始智力因子为历代最高,是「雄心项目」、3D、游戏、computer use、子 agent 协调的最强模型,多项基准大幅跳升 但并非全面碾压:Fable 5.1 在来回讨论、写作等场景仍是首选;建议难问题上两个模型都用 常规编码进步不大;这是第一次「是不是 AGI」的争论不显得荒唐——Zvi 认为还不是,但不会嘲笑持不同意见者 官方口径与反响 Greg Brockman 宣称「欢迎来到 AGI 时代」,Sam Altman 称其为世界最佳 computer use/专业工作/科学/编码/网络安全模型;官方数据:FrontierMath Tier 4 达 98%、ARC-AGI 3 达 99.9%、ExploitBench 100% 发布视频在 Twitter 播放 1.25 亿次;Jensen Huang 也称其为 AGI Tibo 称 Astra 内测期间是公司最大竞争优势,产品计划因此提前 6 个月到 DevDay 发布;Dean W. Ball 称 Astra 是第一个「反过来抬高我野心」的 agent OpenAI 已软性透露内部还有高于 Astra 一级的模型;roon 称 Astra 的极限「不到一周就被摸到」 背景:Anthropic 节奏提案 文末引 Dario Amodei 新文《We Must Pace the Frontier》,核心为三步:前沿公司单边承诺接受 METR 等第三方嵌入式评估员(Anthropic 即刻承诺);民主国家前沿公司协调安全标准与进度限制;再尝试与威权政府全球协调。Zvi 将在下期完整覆盖。 其他 Astra 官方自述提到因安全与对齐标准而延迟发布,Mark Chen 强调对齐仍未解决、需与能力同步推进。后续待写:Navier-Stokes、Anthropic 失对齐报告、模型福祉等。