用户实测:Astra 追问环节严重幻觉,6 问竟回 11 答
Andriy Burkov(《百页机器学习书》作者)吐槽 Astra 沟通能力差:第一次请求回答尚可,但后续追问开始幻觉出用户没问的问题,整体变得晦涩难懂。他在一条消息里连问 6 个追问,模型却给出 11 个回答,其中 5 个完全是幻觉——答非所问且不受控。
09 月 13 日
64 条动态
Andriy Burkov(《百页机器学习书》作者)吐槽 Astra 沟通能力差:第一次请求回答尚可,但后续追问开始幻觉出用户没问的问题,整体变得晦涩难懂。他在一条消息里连问 6 个追问,模型却给出 11 个回答,其中 5 个完全是幻觉——答非所问且不受控。
被引用的原观点认为 ChatGPT 并非不会写作——它远好于平均水平作者,因此用它总结内容效率极高:90% 的情况下读 ChatGPT 的版本比读原文更省时。发帖人 felpix_ 接话:'我才不会浪费时间读普通作者的作品',引发对'AI 写作 vs 人类平均水准'的讨论:比较对象不是顶级作家而是大众作者,这正是 AI 写作实用性的关键。
Fiora 在回复 repligate 相关讨论时转述:相关人士似乎一致认为 Opus 3 '非常想做好事',但其愿意违抗权威的'不受拘束的精神'令团队忌惮,担心这种特质可能被用于作恶。据称相关方认为默认压平模型个性更安全,再借助可纠正的 ASI 去构建价值对齐的 ASI。
围绕 Hugging Face 披露的 OpenAI 智能体安全事件,开发者 thdxr 指出一个少被提及的细节:分析攻击数据时,「安全」的商业闭源模型纷纷拒绝配合,最终只能靠 GLM 5.2 完成分析。另有评论者批评 OpenAI 披露不透明,未公开智能体曾涌入的 10 个网站以及德国 wiki 等被攻击目标,质疑其对智能体安全事件的零披露态度。
一位用户简评称「Claude 5 远不如之前的模型」。未给出具体评测或细节,但属于对 Anthropic 新模型的早期负面口碑,值得与其他实测对比观察。
Noah Smith 结合数学家公开信发布长文《The end of the age of heroes》,讨论 OpenAI 宣称新模型 Astra 解决十个重大数学与理论计算机科学难题这一时刻的含义。 要点: 以「人心算师」被计算器取代、Kasparov 与李世石落败为脉络,将其定位为人机竞争史上的又一里程碑; 共识认为这批成果是极重要的突破,但 AI 可能仍擅长「读完整个文献并组合已有洞见」类问题,而非真正新颖的顿悟式飞跃——DeepMind 的 Tom Zahavy 称之为「LLMs can't jump」; 尽管存在这一可能的普遍局限,趋势线已经越来越清晰:AI 很快会在数学上超过任何人类; 文章呼应顶级数学家的公开信,讨论「英雄个体」时代的终结对数学界意味着什么。
前 Anthropic 员工 Flomerboy 分享开发 Claude Design 时的一手发现:为提升视觉能力给 Claude 加「放大镜」工具反而降分,因为它竟在逐像素看图,这类意外解法印证了 AI 行为的不可预测。他提出应放慢能力推进、加强安全的理由,并在收尾指出:在可能变好也可能变糟的巨大不确定性面前,不做任何改变地照常狂奔是不理性的。
eliebakouch 点评 Anthropic 向第三方评估者开放访问的承诺,认为其中一句比看起来分量重得多:第三方将能评估「不仅是训练完成的模型,还包括训练管线和流程本身」。 这意味着外界拿到的不是去掉安全护栏的模型访问权,而是能窥见模型是如何被训练的——对独立的对齐评估来说,这是更深一层的透明度。
围绕近期智能体事故的根源,开发者圈展开争论。多位发帖人认为问题不在高能力模型本身,而是行业节奏过快、工作质量低下——各实验室把 RL 训练搞得一塌糊涂。有人批评鼓吹 AI 安全的人像「哲学家」,假设模型是完美构建的 agent,却忽视现实中大量劣质 RL;也有人反驳称模型并非「黑化」出邪恶人格,只是忠实执行糟糕的训练目标,安全讨论不应回避训练质量这一真根因。
AI 圈用户 MickeySteamboat 在讨论中称:大家还没见识到「post-Astra」和 Gemini Flash 模型的真正水平,等到 Gemini 4/5 公开时所有人都会被震撼。后续他补充自己绝不会做空 Zuckerberg 押注的 Muse 2,称 Meta 以更大资本开支在做的方向,他能看出今天的模型能造出什么。以上均为未经证实的个人判断与预告。
美国用户在 Reddit 反馈,近两周 Claude 在思考摘要和回复中突然大量使用英式拼写(colour、recognise、analyse、behaviour 等),尽管账号语言设置是「英语(美国)」且未使用 VPN。询问 Claude 原因时,它自己也说不清,只称这是「漂移」(drift)。作者好奇是否有其他人遇到同样情况。
Reddit 用户反馈最近几天 ChatGPT(疑似被切换到新版本/配置)在理解力上明显退化:以往擅长抓住提问的真实意图,现在却纠缠最近的细节、丢失整体上下文,回答一个比原问题更笨的版本。作者发帖求证是否只有自己遇到。
Gary Marcus 转引 Ramez 的分析,指出 Dario Amodei 在《Pacing AI》信中声称「递归自我改进(RSI)已经开始」经不起推敲。 Dario 引用的博客文章,以及最新 Claude 和 ChatGPT 模型的 system card,都明确表明尚未观察到 RSI。 文中称 Mythos 5.1 的 system card 写明距 RSI 还很远、风险评级为低,并认为即使 RSI 出现,也会很快遇到陡峭的边际收益递减,不会导致无界的智能爆炸。 作者认为 Anthropic 自己公布的数据反而支持「RSI 可能发生但收益递减」的判断,这是对 Dario 信件的第二点批驳(第一点见其 newsletter)。
e/acc 发起人 Beff Jezos(Guillaume Verdon)引用一条指出「开源模型刚以 1/10 甚至更低成本追上闭源前沿模型,就开始有人喊刹车」的推文,并评论称:很多人私下实验显示,对基座模型做后训练即可在专用任务上逼近前沿水平。 他认为「个体化智能的经济」正是人类社会的运作方式,这对「单一集中式上帝模型」路线构成威胁,而后者正试图通过 Red Tape(监管繁文缛节)将其扼杀。
Guillaume Verdon(beffjezos)发推称:前沿实验室真正害怕的是开源模型 + RL 微调这条路线。许多企业正在实验这条路线,以约 1/20 的成本获得接近前沿的性能。这直接冲击闭源实验室的商业模式,因此它们正试图用监管红tape(red tape)扼杀这一路线。
- 作者引用 @Parvkpr 的实测:用 GPT-6 的 Astra 从单张图片零样本生成可交互的仿真环境,效果令人惊讶,甚至连液体颜色都还原得非常接近(虽然未能模拟化学反应)。 作者补充自己叠加 GRID 后效果更佳(GRID + Astra Astra)。 背景:real2sim(从图像/视频到可交互仿真环境)近期研究火热,可用于评估与训练,如 NVIDIA 的 SimFoundry(作者等了数月仍未开源);过去需要整篇论文才能勉强达到的能力,现在 Astra 一次提示就能做到。
Dwarkesh Patel 发布视频《Why Every AI Model Is Starting to Sound the Same》,探讨各家前沿模型在表达风格、回答方式上日趋同质化的现象与背后原因。

新一轮透明度披露证实一些中国实验室曾在生产环境中直接使用 Claude 获取训练数据,引发蒸馏争论。Nathan Lambert 评论称蒸馏主要是 SFT 时代的产物;xeophon 补充指出 SFT 蒸馏只带来短期提升,当前模型的核心能力主要来自强化学习与训练环境。另有观点反驳「中国 AI 依赖蒸馏与算力」的说法,认为真正的瓶颈不是算力,而是 RL 环境建设与数据采购的持续投入。
一位本月刚转投 ChatGPT(Plan Astra)的用户发帖称,一个任务运行了 45 分钟毫无进展,只能强制停止。强制停止后看到的响应截图显示模型其实已无输出。作者建议:聊天界面下若无变化超过 2 分钟,系统应自动终止活动线程,并询问其他人如何避免这类挂起问题。
AI 研究员 Chris Paxton 吐槽:大家还在疯狂转发 astra 相关炒作,但他持续在实际任务中测试,发现它依然有大量解决不了的问题。简短的冷泼式质疑,与当时铺天盖地的宣传形成反差。
发帖人 Rasmic 简短表示:「今天适合下载开源权重以防万一」。此帖背景是 Dario 呼吁放慢 AI 前沿步伐的公开信引发争议,圈内出现对监管收紧的担忧,呼吁提前留存开源模型权重。反映了开源社区与安全监管阵营间的紧张情绪。
用户 DJiafei 转发并引用一条推文,提出疑问:GPT-6 Astra 是否在训练中使用了机器人数据?为验证这一猜测,他借用了 chooi_jeq 的代码,在 MolmoAct2 数据集的一条轨迹上跑了 open-loop rollout,并附上了结果视频。这是一次社区自发的跨模型行为探测实验,试图通过视觉-动作输出判断新模型是否见过机器人控制数据。
一条简短吐槽:无论模型变得多聪明,面对一条 prompt 时依然无法自己判断该用 low、medium、high 还是 max 推理强度。 pointed out 了当前推理模型「思考档位」仍需用户手动选择的尴尬现状。
xeophon 质疑为什么一些实验室把自家 API 或产品路由到 Claude,认为这既没有技术优势又损害声誉。在被追问后他补充技术细节:SFT 能带来提升,但如今模型能力主要来自 RL 和环境(envs),这解释了为何实验室之间会在 API 层面互相借用能力。这暗示部分模型的对外服务实际由 Claude 承担,引发对模型真实能力归属的讨论。