今日总结
今日 AI 圈由三条主线交织:一是模型军备赛进入白热化——Qwen3.8 横评全面铺开、Kimi K3 登顶 Agent Arena 开权重前列、Inkling 975B 开权重新兵入场,前沿与开源力量分野持续模糊;二是 Claude Fable 因数学梗病毒式传播,成为今日讨论最集中的单一话题;三是算力与政策双线同步收紧,英伟达芯片采购、数据中心融资、国家 AI 监管标准陆续登场。
-
Claude Fable「证明」Jacobian 猜想玩梗全网刷屏 — 一条称 Claude Fable 以"推翻这个百年数学猜想为假"的梗图在 AI 圈大量转发,配图是 Fable 熬夜算数学的名场面。后续澄清与跟帖印证齐发,多方引用显示这是今日传播最广的单一话题。 · 相关讨论
-
Qwen3.8 横评全面铺开,被指或超 GPT-5.6 — Qwen3.8 Max Preview 实测视频与社区横评今日密集涌现,号称 2.4T 参数;评测对比显示在前端编程等方向表现抢眼,有声音称若结果属实则中美模型差距或压缩至约 3 个月。横评 · 预览版更新 · 社区讨论
-
Kimi K3 登顶 Agent Arena 开权重第 4,前 Stability AI 创始人聊算力悖论 — Kimi K3 在 Agent Arena 总榜升至第 4、任务成功率子项领先,被多方称为「开源前沿新王」;与此同时,Emad Mostaque 指出前沿开源权重模型几乎只剩中国在做,美国和欧洲缺乏继续投入的动力。K3 榜单 · 榜单转发 · Emad 观点 · 算力悖论
-
Inkling 975B 开权重发布,Agent Arena 开权重第 9 — Thinking Machines 推出 975B 参数开权重模型 Inkling,在 Agent Arena 以开权重第 9、总榜第 30 首次上榜,被称为「美国目前最强开权重模型」。发布 · 榜单
-
长运行模型研究揭示短评测看不到的安全风险 — 研究者指出,能解决复杂开放式任务的长运行模型,其「持续性」同时带来了新的对齐与监控挑战,并已开始影响评测设计和用户控制机制的制定方向。
-
RL 与预训练最优配比规律出炉:模型越大 RL 占比升至 30% — 以国际象棋为可控实验场的新研究表明,从 50M 到 700M 参数,最优 RL 训练占比从个位数升至约 30%,为预训练-SFT-RL 的资源分配提供了可计算依据。
-
Anthropic 向罕见病研究者开放最高 5 万美元 Claude 额度 — Anthropic AI for Science 计划下的首次定向征集,面向罕见病研究者提供最高 5 万美元的 Claude API 使用额度,用于加速治疗方案与药物发现。
-
美国 AI 安全负责人三个月离职 — 美国一位 AI 安全治理岗负责人仅上任三个月便辞职,此事正值美国 AI 治理体系仍在摸索期,引发对政策执行稳定性的质疑。
-
Z.ai 完成 1GW 全国产芯片数据中心 — 智谱更名后的 Z.ai 建成 1GW 级 AI 数据中心,据报道全部使用中国制造芯片,部分已开始运行,是国产算力自主化进程的重要节点。
-
Google Frozen v2 芯片传闻:把 Gemini 架构写进硅片,目标 TPU 6-10 倍性能 — 传闻 Google 正在开发代号 Frozen v2 的定制芯片,将 Gemini 关键架构直接固化到硅片上,目标效能达现有 TPU 的 6-10 倍。
与昨日对比
-
持续发酵:Qwen3.8 从昨日官宣预告进入今日密集横评阶段,社区评测帖大量涌现并与 Kimi K3 形成正面比较;Kimi K3 讨论从昨日蒸馏路线争议转向今日 Agent Arena 实战排名与「前沿开源新王」定性,持续升温。Claude Code 昨日出现使用体验报告,今日转为官方确认异常修复并在传播,讨论重心从功能转向稳定性。
-
新增热点:Claude Fable 数学梗病毒式爆发(今日传播最集中的单一话题);Inkling 975B 开权重模型正式发布;Google Frozen v2 芯片传闻首次浮出水面;Z.ai 1GW 国产芯片数据中心建成;美国 AI 安全负责人三个月离职;澳大利亚宣布强制推行国家 AI 标准;长运行模型安全风险研究;RL 最优配比规律新论文;Anthropic 罕见病研究资助计划;马斯克 520 亿美元采购英伟达 GB300;黑石 120 亿美元领投 Meta 德州数据中心。
-
明显降温:HuggingFace AI 代理式入侵事件昨日是安全圈双线传播的主话题,今日几乎未见新讨论;Kimi 暂停新订阅与港股上市传闻昨日刷屏,今日已基本沉寂;SOOFI 评测泄漏争议今日未出现后续。