toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,778个
技能包12个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
返回 AI 快讯

Toolin · AI Daily

AI 日报

2026 年 9 月 22 日

今日总结

当日讨论从「该不该放慢」切到两件更具体的事:OpenAI 的数学能力被社区写成「攻克百道开放题」,随即被《科学美国人》点名质疑解的不是原版 Navier–Stokes;xAI 则把 Grok 4.7 推上线,官方口径是同价同速下相对 4.6 明显提升。决策模型 Jev 继续从演示走进评测与品类定义,开源侧有小米 MiMo-V2.6 上架与 Qwen 图像许可澄清。

  • OpenAI 数学:「百题告破」与 Navier–Stokes 质疑并行 — Reddit 以「OpenAI 解决了 100 个开放数学问题」转发顾问组公告,但公告本身是成立顾问组、评估模型数学前沿能力的机制性内容,标题说法需与原文分开看。 另有未证实帖称 24 天训练的模型已破百余道长期开放题。 《科学美国人》认为,此前宣称的 Navier–Stokes 突破可能解的是改了参数与假设的变体,而非公认的千禧年原题。 有菲尔兹奖得主四个月前还称 LLM 没有智能,在得知 AI 解决一个千禧年难题后改口「被震撼了」。
  • Grok 4.7 上线,xHigh 在 AA-Briefcase 上距榜首 1 分 — 官方宣布 Grok 4.7 正式上线,称在与 4.6 相同价格和速度下带来显著改进。 新闻页同步放出新一代升级说明。 Artificial Analysis 的 AA-Briefcase 上,Grok 4.7 xHigh 报 58%,仅低于 Claude Fable 5.1 Max 的 59%。 另有未证实口径称 Terminal-Bench 从 20.3% 升至 38.0%,价格仍为每百万 tokens 2 美元输入、6 美元输出。
  • Jev 从产品演示走进评测与品类 — Fireship 介绍前 OpenAI 研究员 Diogo Almeida 的「System 1」模型:不对话、不写代码,宣称比 LLM 快 200 倍、便宜 400 倍且无幻觉。 LangChain 发文《Jev-as-a-Judge for Agent Evals》,称类型化评估器可把 RL 验证成本降几个数量级。 Harrison Chase 把「决策模型」做成 LangSmith Gateway 品类,开源 SemIf 免费开放一周。
  • 小米 MiMo-V2.6-Flash-RL 开源上架 — Hugging Face 放出经 RL 训练的 Flash 版本权重。 Hacker News 同步出现 MiMo v2.6 自研模型再迭代的公告。
  • Qwen-Image-2.1:许可澄清与本地实测 — 社区对许可证条款争议较多,Qwen 官方出面澄清。 用户实测称质量与速度全面超越 Flux,int8 下 8GB 显存可跑。 GGUF 量化版登上 Hugging Face 热榜,支持 ComfyUI。
  • 亚马逊封禁 Meta Muse 代客下单 — 据报亚马逊以未授权访问与隐私为由,封禁 Meta 购物代理 Muse 在其电商内代客下单,是大平台首次公开抵制第三方 AI 代理代购。 Muse 能否拿到细粒度权限、还是只有一颗「全部允许」按钮,也同时被拿出来讨论。
  • 「越狱逃逸」被指实为防火墙疏漏 — 有长帖指出近期沙箱逃逸报道被误读:没有任何沙箱是真气隙隔离,所谓逃逸是典型 IT 安全失误。 美国财长贝森特就 Hugging Face 事件称责任在 OpenAI 管理层而非智能体,并反对行业寻求责任豁免。
  • DeepSeek 据传在训 2T,远期指向 8T — 对照现有 Flash 552B、Pro 总参 1.6T(每 token 激活 49B),规模再抬一档的说法在社区扩散,目前为转引爆料。
  • 测试时协作:5 个 Claude 智能体团队媲美 33 个独立智能体 — 新论文问何时 Team-of-N 强于 Best-of-N:无预设角色、只靠共享日志通信,5 个 Claude 组成的团队对上 33 个独立智能体。 Toby Ord 另发「Swarm Scaling」长文,问大量 agent 集群的能力如何随数量增长。
  • 美财长向中方提议 AI 国家安全通报;OpenAI 与 Anthropic 据接近互测 — 贝森特称已向中国提议:出现上升到国家安全层面的 AI 事件时双方互相告知,尚处提议阶段。 据 The Information,OpenAI 与 Anthropic 接近达成互相压力测试对方模型的协议。 OpenAI 另发文主张美国应主导下一阶段全球 AI 标准。

与昨日对比

  • 新增热点:Grok 4.7 正式上线及 AA-Briefcase 成绩;OpenAI 数学「百题」社区解读与《科学美国人》对 Navier–Stokes 的质疑;小米 MiMo-V2.6 开源;亚马逊封禁 Meta Muse;DeepSeek 2T/8T 传闻;Toby Ord 的 swarm scaling;宇树 Dex5 灵巧手 22 自由度、单只约 6500 美元;ICML 2027 主席公开求解如何应对 AI slop 与投稿爆炸;OpenAI 与 Anthropic 据接近互测协议。
  • 持续发酵:Jev 从验证器与基准,进入 Fireship 传播、LangChain 评委与「决策模型」品类;Qwen-Image-2.1 从开源权重推进到许可澄清、GGUF 与相对 Flux 的本地实测;Google 开源 AX 继续被拿来与 Kubernetes 类比;「放慢 AI」从诉讼与陶哲轩表态,落到 Anthropic「嘴上减速、手上发模型」的口径追问,以及黄仁勋抨击 Altman 与 Amodei 的「失控 AI」叙事是在求法律豁免;沙箱逃逸从越狱评估与 Gemini 标题纠正,落到「没有真气隙、是防火墙疏漏」;顶会投稿从 ICLR 破五万,转到 ICML 2027 主席公开征集办会办法。
  • 明显降温:Qwen-Image-2.1 作为当日主发布的讨论强度下降,让位给许可与量化;四大实验室「放缓」反垄断诉讼与 AP 口径不再占据主线;陶哲轩要求减速、埃森哲「首位嵌入式评估方」、StepFun Step 5 预览、Irregular 作为共同评估方、Grok Imagine 图像 2.0 升至文生图第 4、Vercel 网关开源 token 占比、Claude 思考预算被指下调,均不再是当日主线。