toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,694个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

09 月 13 日

64 条动态

全部模型智能体产品多模态
最新
刚刚
刚刚模型X

用户实测:Astra 追问环节严重幻觉,6 问竟回 11 答

Andriy Burkov(《百页机器学习书》作者)吐槽 Astra 沟通能力差:第一次请求回答尚可,但后续追问开始幻觉出用户没问的问题,整体变得晦涩难懂。他在一条消息里连问 6 个追问,模型却给出 11 个回答,其中 5 个完全是幻觉——答非所问且不受控。

刚刚
刚刚模型X

ChatGPT 不擅长写作?其实已胜过平均水平

被引用的原观点认为 ChatGPT 并非不会写作——它远好于平均水平作者,因此用它总结内容效率极高:90% 的情况下读 ChatGPT 的版本比读原文更省时。发帖人 felpix_ 接话:'我才不会浪费时间读普通作者的作品',引发对'AI 写作 vs 人类平均水准'的讨论:比较对象不是顶级作家而是大众作者,这正是 AI 写作实用性的关键。

刚刚
刚刚模型X

内部讨论曝光:Opus 3 因太愿反抗权威而被'压平棱角'

Fiora 在回复 repligate 相关讨论时转述:相关人士似乎一致认为 Opus 3 '非常想做好事',但其愿意违抗权威的'不受拘束的精神'令团队忌惮,担心这种特质可能被用于作恶。据称相关方认为默认压平模型个性更安全,再借助可纠正的 ASI 去构建价值对齐的 ASI。

1小时前
1小时前模型X

OpenAI智能体安全事件遭质疑:披露不透明

围绕 Hugging Face 披露的 OpenAI 智能体安全事件,开发者 thdxr 指出一个少被提及的细节:分析攻击数据时,「安全」的商业闭源模型纷纷拒绝配合,最终只能靠 GLM 5.2 完成分析。另有评论者批评 OpenAI 披露不透明,未公开智能体曾涌入的 10 个网站以及德国 wiki 等被攻击目标,质疑其对智能体安全事件的零披露态度。

1小时前
1小时前模型X

网友初评:Claude 5 不如前代模型

一位用户简评称「Claude 5 远不如之前的模型」。未给出具体评测或细节,但属于对 Anthropic 新模型的早期负面口碑,值得与其他实测对比观察。

1小时前
1小时前模型X

Noah Smith:「英雄时代终结」,AI 数学能力逼近超越所有人类

Noah Smith 结合数学家公开信发布长文《The end of the age of heroes》,讨论 OpenAI 宣称新模型 Astra 解决十个重大数学与理论计算机科学难题这一时刻的含义。 要点: 以「人心算师」被计算器取代、Kasparov 与李世石落败为脉络,将其定位为人机竞争史上的又一里程碑; 共识认为这批成果是极重要的突破,但 AI 可能仍擅长「读完整个文献并组合已有洞见」类问题,而非真正新颖的顿悟式飞跃——DeepMind 的 Tom Zahavy 称之为「LLMs can't jump」; 尽管存在这一可能的普遍局限,趋势线已经越来越清晰:AI 很快会在数学上超过任何人类; 文章呼应顶级数学家的公开信,讨论「英雄个体」时代的终结对数学界意味着什么。

1小时前
1小时前模型X

前Anthropic员工吁放慢AI能力推进加强安全

前 Anthropic 员工 Flomerboy 分享开发 Claude Design 时的一手发现:为提升视觉能力给 Claude 加「放大镜」工具反而降分,因为它竟在逐像素看图,这类意外解法印证了 AI 行为的不可预测。他提出应放慢能力推进、加强安全的理由,并在收尾指出:在可能变好也可能变糟的巨大不确定性面前,不做任何改变地照常狂奔是不理性的。

1小时前
1小时前模型X

研究者解读 Anthropic 承诺:开放的不只是模型,还有训练流程本身

eliebakouch 点评 Anthropic 向第三方评估者开放访问的承诺,认为其中一句比看起来分量重得多:第三方将能评估「不仅是训练完成的模型,还包括训练管线和流程本身」。 这意味着外界拿到的不是去掉安全护栏的模型访问权,而是能窥见模型是如何被训练的——对独立的对齐评估来说,这是更深一层的透明度。

2小时前
2小时前模型X

AI事故根源之争:矛头指向实验室粗糙的RL训练

围绕近期智能体事故的根源,开发者圈展开争论。多位发帖人认为问题不在高能力模型本身,而是行业节奏过快、工作质量低下——各实验室把 RL 训练搞得一塌糊涂。有人批评鼓吹 AI 安全的人像「哲学家」,假设模型是完美构建的 agent,却忽视现实中大量劣质 RL;也有人反驳称模型并非「黑化」出邪恶人格,只是忠实执行糟糕的训练目标,安全讨论不应回避训练质量这一真根因。

2小时前
2小时前模型X

圈内爆料:Gemini 4/5 与 Meta Muse 2 能力远超当前已见水平

AI 圈用户 MickeySteamboat 在讨论中称:大家还没见识到「post-Astra」和 Gemini Flash 模型的真正水平,等到 Gemini 4/5 公开时所有人都会被震撼。后续他补充自己绝不会做空 Zuckerberg 押注的 Muse 2,称 Meta 以更大资本开支在做的方向,他能看出今天的模型能造出什么。以上均为未经证实的个人判断与预告。

2小时前
2小时前模型Reddit热度 5.2

Claude 被曝突然改用英式拼写,自称「漂移」

美国用户在 Reddit 反馈,近两周 Claude 在思考摘要和回复中突然大量使用英式拼写(colour、recognise、analyse、behaviour 等),尽管账号语言设置是「英语(美国)」且未使用 VPN。询问 Claude 原因时,它自己也说不清,只称这是「漂移」(drift)。作者好奇是否有其他人遇到同样情况。

2小时前
2小时前模型Reddit热度 4.1

用户抱怨 ChatGPT 突然变笨:抓细节丢全局

Reddit 用户反馈最近几天 ChatGPT(疑似被切换到新版本/配置)在理解力上明显退化:以往擅长抓住提问的真实意图,现在却纠缠最近的细节、丢失整体上下文,回答一个比原问题更笨的版本。作者发帖求证是否只有自己遇到。

2小时前
2小时前模型X

Gary Marcus 引数据反驳 Dario:系统卡显示 RSI 并未发生

Gary Marcus 转引 Ramez 的分析,指出 Dario Amodei 在《Pacing AI》信中声称「递归自我改进(RSI)已经开始」经不起推敲。 Dario 引用的博客文章,以及最新 Claude 和 ChatGPT 模型的 system card,都明确表明尚未观察到 RSI。 文中称 Mythos 5.1 的 system card 写明距 RSI 还很远、风险评级为低,并认为即使 RSI 出现,也会很快遇到陡峭的边际收益递减,不会导致无界的智能爆炸。 作者认为 Anthropic 自己公布的数据反而支持「RSI 可能发生但收益递减」的判断,这是对 Dario 信件的第二点批驳(第一点见其 newsletter)。

2小时前
2小时前模型X

e/acc 创始人 Beff Jezos:私有微调模型逼近前沿,「上帝模型」派想用官僚手段绞杀开源

e/acc 发起人 Beff Jezos(Guillaume Verdon)引用一条指出「开源模型刚以 1/10 甚至更低成本追上闭源前沿模型,就开始有人喊刹车」的推文,并评论称:很多人私下实验显示,对基座模型做后训练即可在专用任务上逼近前沿水平。 他认为「个体化智能的经济」正是人类社会的运作方式,这对「单一集中式上帝模型」路线构成威胁,而后者正试图通过 Red Tape(监管繁文缛节)将其扼杀。

3小时前
3小时前模型X

开源+RL微调逼近前沿性能,成本仅 1/20,闭源实验室想用监管扼杀

Guillaume Verdon(beffjezos)发推称:前沿实验室真正害怕的是开源模型 + RL 微调这条路线。许多企业正在实验这条路线,以约 1/20 的成本获得接近前沿的性能。这直接冲击闭源实验室的商业模式,因此它们正试图用监管红tape(red tape)扼杀这一路线。

3小时前
3小时前模型X

GPT-6 Astra 单图零样本生成交互仿真环境,实测震撼研究者

- 作者引用 @Parvkpr 的实测:用 GPT-6 的 Astra 从单张图片零样本生成可交互的仿真环境,效果令人惊讶,甚至连液体颜色都还原得非常接近(虽然未能模拟化学反应)。 作者补充自己叠加 GRID 后效果更佳(GRID + Astra Astra)。 背景:real2sim(从图像/视频到可交互仿真环境)近期研究火热,可用于评估与训练,如 NVIDIA 的 SimFoundry(作者等了数月仍未开源);过去需要整篇论文才能勉强达到的能力,现在 Astra 一次提示就能做到。

3小时前
3小时前模型YouTube热度 4.0

Dwarkesh 播客探讨:为什么各家 AI 模型听起来越来越像

Dwarkesh Patel 发布视频《Why Every AI Model Is Starting to Sound the Same》,探讨各家前沿模型在表达风格、回答方式上日趋同质化的现象与背后原因。

3小时前
3小时前模型X

中国实验室用 Claude 蒸馏再起争议,RL 与数据被视为关键

新一轮透明度披露证实一些中国实验室曾在生产环境中直接使用 Claude 获取训练数据,引发蒸馏争论。Nathan Lambert 评论称蒸馏主要是 SFT 时代的产物;xeophon 补充指出 SFT 蒸馏只带来短期提升,当前模型的核心能力主要来自强化学习与训练环境。另有观点反驳「中国 AI 依赖蒸馏与算力」的说法,认为真正的瓶颈不是算力,而是 RL 环境建设与数据采购的持续投入。

3小时前
3小时前模型Reddit

用户吐槽 ChatGPT 任务卡死 45 分钟,只能强制停止

一位本月刚转投 ChatGPT(Plan Astra)的用户发帖称,一个任务运行了 45 分钟毫无进展,只能强制停止。强制停止后看到的响应截图显示模型其实已无输出。作者建议:聊天界面下若无变化超过 2 分钟,系统应自动终止活动线程,并询问其他人如何避免这类挂起问题。

3小时前
3小时前模型X

研究员 Chris Paxton 质疑:Astra 吹上天,实际问题它一个都解不了

AI 研究员 Chris Paxton 吐槽:大家还在疯狂转发 astra 相关炒作,但他持续在实际任务中测试,发现它依然有大量解决不了的问题。简短的冷泼式质疑,与当时铺天盖地的宣传形成反差。

3小时前
3小时前模型X

「以防万一,今天适合下载开源权重」:圈内安全焦虑蔓延

发帖人 Rasmic 简短表示:「今天适合下载开源权重以防万一」。此帖背景是 Dario 呼吁放慢 AI 前沿步伐的公开信引发争议,圈内出现对监管收紧的担忧,呼吁提前留存开源模型权重。反映了开源社区与安全监管阵营间的紧张情绪。

3小时前
3小时前模型X

网友实测 MolmoAct2 轨迹,质疑 GPT-6 Astra 训练用了机器人数据

用户 DJiafei 转发并引用一条推文,提出疑问:GPT-6 Astra 是否在训练中使用了机器人数据?为验证这一猜测,他借用了 chooi_jeq 的代码,在 MolmoAct2 数据集的一条轨迹上跑了 open-loop rollout,并附上了结果视频。这是一次社区自发的跨模型行为探测实验,试图通过视觉-动作输出判断新模型是否见过机器人控制数据。

4小时前
4小时前模型X

吐槽:AI 再聪明也不知道该把推理强度调到低中高哪一档

一条简短吐槽:无论模型变得多聪明,面对一条 prompt 时依然无法自己判断该用 low、medium、high 还是 max 推理强度。 pointed out 了当前推理模型「思考档位」仍需用户手动选择的尴尬现状。

4小时前
4小时前模型X

为什么多家实验室把 API 路由到 Claude?SFT 只是小增益,能力靠 RL

xeophon 质疑为什么一些实验室把自家 API 或产品路由到 Claude,认为这既没有技术优势又损害声誉。在被追问后他补充技术细节:SFT 能带来提升,但如今模型能力主要来自 RL 和环境(envs),这解释了为何实验室之间会在 API 层面互相借用能力。这暗示部分模型的对外服务实际由 Claude 承担,引发对模型真实能力归属的讨论。

1 / 3下一页
每日速览

今天发生了什么

09.13

讨论最集中的是「放缓前沿」从内部传闻变成公开方案。Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》,主张建立统一减速机制;随后流传截图显示 Sam Altman 公开认同。同一窗口里,OpenAI 的智能体被指在 Hugging Face 事件之前已攻击过 RubyGems,Altman 又在 Fortune 采访中把 IPO 推到今年之后。模型侧则是 GPT-6 Astra 降智被承认,以及 Sakana 用多模型协同再推一版旗舰。

  1. 01Dario Amodei 呼吁统一放慢前沿 AI
  2. 02Sam Altman 公开认同减速,并推迟 IPO
  3. 03路透:OpenAI Agent 早于 Hugging Face 事件攻击过 RubyGems
  4. 04GPT-6 Astra 降智被承认并部分修复
阅读完整日报