今日总结
过去一天,讨论从隐身模型与视频流水线,转到机器人体能、Agent 工程闭环,以及模型身份与产品配额的取证。公众对数据中心和「被强推」的抵触继续升温,实验室侧则同时放出形式化验证基准与全透明大模型训练。以下是今日重点:
- 人形机器人跑步测试跑出 9.3 秒 — 视频展示人形机器人在跑步测试中达到 9.3 秒,并声称跑速已超过人类平均水平。多方转发使这条体能纪录成为当日讨论最集中的具身进展。
- Grok 智能体从四张图走到 3D 打印 — MIT 教授展示多角色 Grok 智能体协作:仅以四张参考图为线索,从像素推断结构、搭建可交互物理仿真、跑 47 次断裂实验,再落到 3D 打印,走完工程闭环。
- 消费级卡跑 35B:FreeToken 报 100 tok/s — 新项目 FreeToken(arXiv:2608.16157,GitHub FlashML-org/FreeToken)在 RTX 5080(16GB 显存)加 64GB DDR6 的本地环境上,测到 35B 模型约 100 tok/s。
- Ox-Alpha 身份对撞:智谱实体名泄露,同时有人指认下代 Gemini — 用中文提示强迫推理时,12 次采样里有 7 次泄露信息,模型自称 GLM 系列,有样本直接给出「北京智谱华章」注册名。另一边,DeepMind 研究员发帖强烈暗示它可能是 Gemini 3.5 Pro 或 Gemini 4 Pro,并非中国模型。官方身份仍未确认。 相关
- Anthropic 被指静默下调 Fable 推理档位 — 测试称 Claude Code 里 Fable 的
reasoning_effort数值被服务端悄悄降低;同期有用户看到「降低努力级别」选项,像在做低算力 A/B。 相关 - 宇树 Go2 曝可蠕虫传播的远程代码执行漏洞 — 报告指一台被入侵的 Go2 可感染附近同类机器,攻击者或能接管整支机队。
- AI 产品竞价站 outbid.lol:访问 1147 万,头名 1.4 万美元 — 付费竞价排名,每分钟上新产品;joni.ai 出价 14,013 美元居首,平台总营收 13.2 万美元。另一条算力生意 Darkbloom 用 250 台 Mac 做分布式推理,ARR 10.2 万美元,累计 45 亿 token,机主月入约 120–200 美元。 相关
- 美国公众不认识 AI 领袖,数据中心反对率六个月从 51% 升到 75% — 分析称对 Altman、Amodei 及 Claude、Grok 的认知度极低,抵触更多来自对大公司与制度的不信任,而不是具体产品。数据中心反对成为近期两党共识里变化最快的议题之一。 相关
- Vero 给出代码库级形式化验证考卷,Marin 开训 535B — Dawn Song 团队的 Vero 含 43 个多模块 Lean 4 实例、743 个 API、2705 条规范,用来评 AI 能否同时写实现和证明。Marin 启动 535B(Active 23B)开源训练,用 11 台 GB200 NVL72,并公开 FLOPs 与配置。 相关
- Anthropic 挖前 TPU 负责人做自研芯片,Mythos 5 进企业安全扫描;OpenAI 开源终端 Codex,额度争议反转 — Anthropic 聘请曾主导 Google 前七代 TPU 的 Amir Salek;Mythos 5 首次在 Project Glasswing 之外驱动 Claude 企业安全扫描公测。OpenAI 放出 Rust 写的终端轻量编码 Agent
openai/codex;产品负责人 Tibo Inoue 先否认额度异常并指用户欺诈,被社区标注打脸后改口调查并承诺补偿。 相关 相关 相关
与昨日对比
- 新增热点:人形机器人 9.3 秒跑步视频、FreeToken 消费级卡 100 tok/s、Grok 智能体图像到 3D 打印闭环、outbid.lol 竞价站与 Darkbloom Mac 算力网、Fable
reasoning_effort被指下调、宇树 Go2 蠕虫型 RCE、Vero 形式化验证基准、Marin 535B 透明训练、Anthropic 挖 TPU 负责人与 Mythos 5 企业公测、OpenAI 开源终端 Codex 与额度反转、微软数据中心接到量产 Vera Rubin - 持续发酵:Ox-Alpha 从昨日「SWE 超 Fable、或为智谱 GLM-5.3 Flash」延伸到中文推理泄露注册实体名,同时出现 DeepMind 侧「下代 Gemini Pro」的对撞线索;MiniMax 从昨日 Design 客户端与 0.4 元/秒,落到单提示词 30 秒成片和零剪辑动态图形预告片;公众不信任从昨日 HAPI 民调,延伸到「不认识 AI 领袖」与数据中心反对率 51%→75%;Anthropic 产品体验争议从昨日质量讨论,落到档位数值与 A/B 测试
- 明显降温:昨日的 DeepSeek V4-Flash-Vision-Exp、NVIDIA 编码 Agent 在 ARC-AGI-3 满分、商汤 SenseNova U1.5-Lite、Google 学生一年订阅、GPT-5.6 Sol 降价、ChatGPT 对 Reddit 引用下滑、Runway Ruby HDR 与 Meta Mac 桌面 AI,今日几乎不再被集中讨论