toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,694个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

09 月 13 日

64 条动态

全部模型智能体产品多模态
最新
4小时前
4小时前模型X

DeepSeek 不只是蒸馏:MoE、高效训练与 R1 强化学习均为原创工作

TheMoonMidas 回应「DeepSeek 只是蒸馏 OpenAI 模型」的说法,指出 DeepSeek 在 MoE 架构、高效训练和强化学习推理(R1)方面都发表过原创工作;蒸馏可能只是重要加速器和成本节约手段,并非全部故事。

4小时前
4小时前模型X

多方反驳“DeepSeek靠蒸馏”:架构创新才是效率来源

针对“DeepSeek只是蒸馏OpenAI模型”的说法,Steve Hsu转发回应称,非技术人士及有意识形态倾向的技术人士过度强调蒸馏,忽视了只有中国实验室公开发表的模型架构创新,像DeepSeek V4.1这样的模型效率主要来自架构层面。另一网友也指出,DeepSeek在MoE架构、高效训练和强化学习推理(R1)方面都发表过原创工作,蒸馏只是次要因素。

4小时前
4小时前模型Hacker News

争议观点:Anthropic 已不再是前沿实验室

一条推文抛出尖锐论断——「Anthropic 已不再是前沿实验室」,被转发到 Hacker News 引发讨论。这是针对 Anthropic 当前模型能力与前沿地位的行业争论,在 Gemini、GPT 等竞品快速迭代的背景下,关于谁仍在前沿的判断本身成为话题。

5小时前
5小时前模型Reddit

Nex N2.5 Mini 4bit 跑上 M5 Max:133.6 tok/s,质量速度兼顾

Nex N2.5 Mini 本周发布,作者用 MLX 4bit 量化版在 Apple M5 Max 上实测:推荐参数 temperature 0.7、top_p 0.95、top_k 40、reasoning_effort high 下达到 133.6 tok/s 的生成速度,prompt 处理也很快,显存占用合理,各项质量表现不错。作者计划用它驱动自己的 agent 并尝试写代码。量化模型与完整跑分数据均已在 Hugging Face 和 llm-bench.io 公开。

5小时前
5小时前模型X

爆料:某前沿实验室正向数据供应商采购现成库存数据

Satish Vutukuru 转发称,一家前沿 AI 实验室正在向数据供应商索取「完美切片」的现成库存数据(off-the-shelf inventory data)。这条消息侧面印证了头部实验室对高质量外部训练数据的持续渴求,可能涉及训练数据的采购动向,但帖子未点名具体厂商,细节有限。

5小时前
5小时前模型X

「每周限额直接没了」:AI 服务用量限制突传大幅放宽

- haydendevs 发帖称(附截图)"weekly limit obliterated just like that",暗示某主流 AI 服务的每周用量限制被大幅取消或放宽。正文信息极少,实质内容在配图中,读者需查看原文截图确认是哪家服务、放宽幅度。

5小时前
5小时前模型X

Mollick 又晒模型名场面:能推理剧情,却总是叫 Elara Vale

AI 学者 Ethan Mollick 分享了一个展示「AI 智能锯齿状(jaggedness)」的生动案例:模型在某些任务上表现惊艳,却在另一些简单事情上离谱翻车。 他半吐槽半无奈地补了一句:「还有,拜托别再叫 Elara Vale 了」——暗指模型在创意写作里反复生成同一个烂大街的 AI 味人名,成为社区调侃模型千篇一律的又一梗点。

5小时前
5小时前模型X

博主实测称 DeepSeek v4.1 Flash 前端能力超 Opus 5,逼近 Fable 5.1(未证实)

X 用户 @MiaAI_lab 发帖称,初步测试显示 DeepSeek v4.1 Flash 在前端网页设计任务上全面超越 Opus 5,并接近 Fable 5.1,而且可以完全在本地小显卡上运行。 该说法目前仅为个人初步实测,无公开评测数据佐证,真实性待验证;结合 Anthropic CEO Dario 近期呼吁放慢模型开发的表态,帖子作者感叹「明白 Dario 为什么担心了」。若属实,意味着开源/低价模型与前沿闭源模型的差距正在快速收窄。

5小时前
5小时前模型X

马里兰团队发布 MathAdv 基准:定理证明器难敌等价改写

马里兰大学 Furong Huang 团队发布诊断性基准 MathAdv(arXiv:2608.25449),已开源。基准覆盖 13 个本硕数学领域,从知识、推理等四个维度评估定理证明器。研究发现模型能证明原始命题,却在等价改写的问题上全军覆没,印证团队主张「证明应确立定理,而不应终结评估」——证明通过不等于模型真正推进了数学理解。

5小时前
5小时前模型X

美 AI 圈争论:中国模型进步多大程度靠蒸馏美国前沿模型

- @theojaffee 提出关键问题:当前中国 AI 进步在多大程度上依赖从美国前沿模型蒸馏。 jeremiecharris 引用时更进一步,称其中部分是「对美国前沿模型的公然窃取」。 这条引用链反映了围绕蒸馏合法性、知识产权与中美 AI 竞争的持续争论,尚无实证结论。

5小时前
5小时前模型Reddit热度 4.0

Gemini 5.6 Luna 疑似坚称自己是人类,Reddit 网友晒截图

Reddit 用户发帖并配截图,质疑 5.6 Luna 模型是否真的认为自己是人类。帖子本体只是一句吐槽,实质内容在截图里:模型在对话中表现出把自己当作人类的迹象。属于典型的模型翻车/行为异常名场面。

5小时前
5小时前模型X

传闻称 Gemini 4 提前完成预训练,真伪未证实

一则已流传三天的传闻称,Google 的 Gemini 4 已提前完成预训练,部分原因是 Google DeepMind 在训练过程中取得了新发现。Andrew Curran 转发并评论了该消息,也有转发者讽刺相关说法。目前该传闻未获任何官方证实,真伪难辨,外界需谨慎看待。

5小时前
5小时前模型X

Nathan Lambert 撰文回应 Anthropic 蒸馏指控:所谓蒸馏其实是合成数据

Nathan Lambert 在 Interconnects 撰文,回应 Anthropic 关于「蒸馏攻击」的说法,质疑中国前沿实验室靠蒸馏「窃取」美国模型能力的叙事。 今日语境下的「蒸馏」实为合成数据:用更强模型的输出训练较弱模型,而非 Hinton 等人定义的技术性知识蒸馏——后者需要教师模型的概率分布,API 模型并不暴露这些信息,因此从技术上不可能实现。 合成数据可以说是当下 AI 研究者日常提升模型的最有用方法;架构、人类数据、可验证奖励的强化学习都重要,但日常工作大量围绕如何获取和扩展合成数据展开。 最著名的指控案例是 DeepSeek R1 发布时,OpenAI 指其通过越狱 API 窃取推理轨迹。

5小时前
5小时前模型X

开发者吐槽 Opus 5 产出似图非图内容,质疑 2026 进展明显放缓

开发者 Julian Harris 对比 2025 年 1 月与 2026 年 1 月的 AI 进展,认为去年进步显著,但今年明显感觉不对劲。他举例称 Claude Opus 5 生成的图表内容质量堪忧——「像个 schema 又不是 schema,像张示意图又不是示意图」,并以此质疑前沿模型近期的能力提升已陷入停滞。

6小时前
6小时前模型X

Muse Spark 1.3 MAX 开放贡献者档,每月 5 美元起

Muse 官方宣布 Muse Spark 1.3 MAX 模型现已进入 contributor(贡献者)档位,仅通过 Muse Code 订阅计划提供,起始价格 5 美元/月,官方称比标准档便宜约 20 倍,用户可在 contributor 档直接使用该旗舰模型。此举大幅降低了访问最强模型的门槛。

6小时前
6小时前模型Reddit

MoE 路由扩展实测:Qwen3.6-35B 扩展后 GPQA 达 84.34%

事件 llama.cpp moe-expansion 分支作者 vagrillo 在 GPQA-Diamond 全部 198 题上对比了 MoE 路由扩展(expanded routing)与原生路由及 dense 模型: Qwen3.6-35B-A3B + 扩展路由(Q8_0):84.34%(167/198) Qwen3.8-27B dense(Q8_0):83.84%(166/198) Qwen3.6-35B-A3B 原生路由:81.82%(162/198) 测试条件统一:greedy 解码、32K 预算、相同 prompt、单张 RTX 5000 PRO 48GB,每配置只跑一次。 作者为何不信自己的结果 35B 扩展 vs 27B dense 仅差 1 题,是持平不是胜出 扩展 vs 原生为 12 胜 7 负(净 +5),但 n=198 下不具统计显著性 12 次扩展胜出中有 10 次集中在 Chemistry,Physics 已饱和、Biology 持平 单次运行、单一种子 作者求助于社区 1. 什么 benchmark 适合与 GPQA-Diamond 搭配做路由对比 2. 成对比较需要多少次运行才够 3. 仅 Chemistry 有效应是否可信还是危险信号 4. 有没有其他人观察到 MoE 扩展带来的真实提升

6小时前
6小时前模型X

曝开源模型大规模蒸馏 Claude,MiniMax 疑设壳公司收割美模型对话数据

X 用户 indefatigabile 提出(未经证实的)指控:开源模型并非真正追平前沿模型,而是大量从 Anthropic 等头部模型蒸馏——MiniMax、Qwen 等的开源权重「在做疯狂的事来弄清顶级模型的运作方式」,因此性能接近 Opus 的低配版。 引用材料称 MiniMax 疑似成立一家壳公司,运营代理网络服务,收割用户与美国前沿模型之间的对话来训练自家模型 作者认为这些开源模型是「行业坏行为者」,应列入「欺诈观察」名单,并反问「你以为它们为什么开源」 注意:以上均为个人指控与推断,尚无官方回应或实锤证据

6小时前
6小时前模型Reddit

Fireworks 上现神秘「Kimi Pluto v1」模型卡,月之暗面新模型?

有用户发现推理平台 Fireworks 上出现了名为「Kimi Pluto v1」的模型卡片,疑似月之暗面(Moonshot AI)尚未正式发布的神秘新模型。目前无官方确认,具体能力与定位不明。

6小时前
6小时前模型Reddit

用户考虑弃用 Gemini,求 Claude 与 ChatGPT 横评建议

一位 B2B 业务用户发帖称正认真考虑从 Gemini 迁走,寻求 Claude 与 ChatGPT 在日常头脑风暴和 B2B 线索挖掘场景下的真实使用建议,评论区提供横向对比视角。

6小时前
6小时前模型Reddit

ChatGPT 距离 AGI 还差什么:视觉幻觉、三只手与拒绝简单道德题

Reddit 长帖系统质疑 ChatGPT 尚不配称 AGI,核心论点是:真智能不依赖海量训练数据,简单问题不需要训练就会。作者列举四个反例: 视觉严重幻觉:GPT 5.6 Sol 看图时会把「穿大衣走向洞穴的背影」硬解读成「一家人」,还自证地给出与 Octavio Ocampo 名画《将军一家》的对比图。 图文脱节:Astra 的图像生成仍画三只手的人,而负责「大脑」的 Astra/Sol 不自知地把错误结果当正常输出——人知道手笨,模型不知道。 拒绝简单道德判断:连「这是错的,别做」这类普通人一秒能答的道德困境,Astra 也拒绝回答,护栏设计拖累整体表现。 空间想象力远落后于 IQ 测试表现:人类 20 秒能看出的三维结构题,模型靠 CAD 建模仍答不对。 作者结论:这些短板让 ChatGPT 的体验远不像一个通用智能。

6小时前
6小时前模型X

传闻 Gemini 4 提前完成预训练,或因训练中新发现

有传闻称 Gemini 4 已提前完成预训练,部分原因是 Google DeepMind 在训练过程中取得了新发现。该传闻已流传三天,但均未获证实,真伪难辨。转发者讽刺道:自己见过多次预训练「提前结束」,从来都不是因为进展太顺利。 若属实,Gemini 4 可能比预期更早亮相;目前只能等待官方消息。

6小时前
6小时前模型Reddit

M2 Ultra 本地跑 Qwen:最新 oMLX 更新带来显著提速

Reddit 用户分享在 M2 Ultra 上本地运行 Qwen 3.8 Flash 的更新:最新的 oMLX 框架引入了大幅速度提升,附带跑分截图。对关注 Mac 端本地推理性能的用户是一个值得升级的信号。

7小时前
7小时前模型X

马斯克称Grok 4.7延期数日,RL惩罚过度致过早放弃

马斯克在 X 上确认 Grok 4.7 还需几天才能发布,并罕见披露训练内幕:团队可能在强化学习中对回复长度惩罚过重(或类似问题),导致模型面对其实能够完成的困难任务时仍会过早放弃,自查工作也不充分,因此需要继续「打磨」后再推出。这一表态引发社区对 xAI 模型训练细节的广泛关注。

7小时前
7小时前模型X

时间线被 GPT-6 Astra 控制机器人演示刷屏,物理 AI 成焦点

网友观察到自己时间线被大量「GPT-6 Astra 控制机器人」的演示视频刷屏,感慨这些内容塑造了公众对「物理 AI 模型」方向的期待与兴奋。帖中未附具体证据,属于对当前具身智能演示热度的观察。

上一页2 / 3下一页
每日速览

今天发生了什么

09.13

讨论最集中的是「放缓前沿」从内部传闻变成公开方案。Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》,主张建立统一减速机制;随后流传截图显示 Sam Altman 公开认同。同一窗口里,OpenAI 的智能体被指在 Hugging Face 事件之前已攻击过 RubyGems,Altman 又在 Fortune 采访中把 IPO 推到今年之后。模型侧则是 GPT-6 Astra 降智被承认,以及 Sakana 用多模型协同再推一版旗舰。

  1. 01Dario Amodei 呼吁统一放慢前沿 AI
  2. 02Sam Altman 公开认同减速,并推迟 IPO
  3. 03路透:OpenAI Agent 早于 Hugging Face 事件攻击过 RubyGems
  4. 04GPT-6 Astra 降智被承认并部分修复
阅读完整日报