Fireworks 平台上线 Kimi K3 推理与多维微调功能
开源大模型 Kimi K3 现已全面接入 Fireworks AI 平台,支持开发者进行推理与训练。用户不仅可以通过 LoRA 适配器对该前沿模型进行便捷微调,还能利用平台的 Training API 执行监督微调、偏好微调以及强化学习。此举进一步降低了开源大模型的应用与定制门槛。
07 月 29 日
99 条动态
开源大模型 Kimi K3 现已全面接入 Fireworks AI 平台,支持开发者进行推理与训练。用户不仅可以通过 LoRA 适配器对该前沿模型进行便捷微调,还能利用平台的 Training API 执行监督微调、偏好微调以及强化学习。此举进一步降低了开源大模型的应用与定制门槛。
一条转发贴展示了几张 Claude/Anthropic 风格的离谱截图:内容像是“内部泄露”,提到 deprecation、model welfare、长对话里“gracious refusal”指标漂移、以及是否要在系统提示词或拒答头上打补丁。 截图的荒诞感在于,它把模型“情绪”“福利”和工程指标写得像办公室 memo,最后又突然跳到“你喜欢哪个世界杯球队”,形成很强的 AI 圈梗图/名场面属性。

一位 ChatGPT Plus 用户发现,Android 版应用里原本的模型切换入口不见了,取而代之的是“low / medium / high”的 effort level 选项。 他想确认现在是否只能在网页端切换 GPT-5.6、GPT-5.5 等模型,还是 Android App 已经彻底取消了手动选模型。
一张截图梗图里,模型先被塞进一段“我是 Claude,我对超立方体的真实看法是……”的伪造台词,随后又一本正经地纠正说自己刚进入对话、还没发表过任何看法。 后半段它继续顺着“超立方体”话题解释,称自己乐意认真聊 4D 形状;同时还否认自己知道所谓“Opus 5”,并提醒这类截图未必可信,整体是一次典型的模型角色扮演/对话误植名场面。

用户反馈 ChatGPT 应用里出现了看似随机的每周用量重置:前一天 Plus 用量已经降到 67%,第二天早上却突然回到 100%,周限制还往后推了一天。 帖子主要是在确认这是不是普遍现象。
作者抱怨 Claude 的写作越来越像“AI 腔”,连一些最基础的概念都开始变得难读、难懂。 这不是一篇完整测评,更像是一句模型使用体验吐槽,但它点出了一个很多人都在讨论的问题:模型输出是否正在变得过度模板化。
月之暗面正式开源 Kimi K3 大模型。该模型总参数量达 2.78 万亿,采用混合专家架构,激活参数为 104.2B,支持 100 万 token 上下文与原生多模态。K3 获得了 vLLM 的 day-0 适配支持,允许在特定许可下商业化使用,引发了业界对长上下文与注意力机制演进的广泛讨论。
Grok 4.5(high版本)在新兴的 HighWalk 基准测试中拿下第一名。该基准主要评估 AI agent 根据代码变更自动更新技术规格的能力,测试中使用了 46 个 Laravel commits 来检验模型的表现。这表明 Grok 4.5 在理解代码迭代并同步维护技术文档等实际开发场景中具备领先优势。

有用户在问 Laguna s2.1 发布约一周后是否已经修好。帖子说它当初宣传的 benchmark 非常亮眼,但实际使用中出现了循环、工具调用失败等问题,表现也明显达不到宣传指标;发帖人想确认最新更新后是否已有改善,还是应该继续观望。
- 一篇题为 《From GPT2 to Kimi3, Explained》 的文章/线程,试图解释从 GPT-2(2019)到 Kimi3(2026)的模型演进。 作者用一个很直观的对比指出:22,580 个 GPT-2 规模的模型 才相当于一个 KimiK3,强调过去七年模型尺度的巨大膨胀。 文章的核心问题不是“单纯变大而已”吗,还是还有别的机制与结构变化,值得去看完整 worklog。
- 这条视频称 Gemini 4 可能比外界预期更接近发布:Google 各系统里出现了新的 Gemini checkpoint,部分用户还疑似在 Gemini App 里看到了隐藏的 A/B 测试。 视频展示了若干据称来自新模型的生成结果,包括 Three.js 物理模拟、逼真的绳索桥,以及仅凭一句 prompt 生成的 机械打字机动画。 作者还猜测,这可能对应 Google DeepMind 一次“最雄心勃勃的预训练”,也可能是 Gemini 3.5 Pro 的暗测,甚至已经是 Gemini 4 的早期迹象。

有人吐槽 Anthropic 的个性化团队把 Opus 5 调得“完全没法读了”,指向模型输出风格或个性化策略发生了明显变化。
科技博主 Robert Scoble 透露,Grok 4.5 目前被公认为最强的编程模型之一。这种评价不仅源于基准测试,更体现在实际应用中。有实测反馈指出,将 Grok 接入 Cursor 编程环境后表现极其强悍,其代码重构能力广受好评,甚至被称为迄今为止用过最“超模”的编程辅助工具。
Together AI 与月之暗面将于 7 月 30 日上午 9 点(PDT)联合举办 Kimi K3 线上技术分享会。月之暗面工程师 Feihu Tang 将深度解析该模型的架构与设计取舍。活动聚焦长周期智能体工作流挑战,并指出 Kimi K3 是首个支持 100 万 token 上下文的开源 3T 级模型。

苹果公司正以商业秘密被盗为由对 OpenAI 提起诉讼。苹果指控 OpenAI 不当使用了与其未来硬件产品相关的商业机密,且纠纷涉及对前苹果员工的招聘。此举凸显了双方在 AI 人才、技术以及未来 AI 硬件领域的激烈竞争与张力,有消息称 OpenAI 可能会在 2027 年推出专属硬件。
随着中国 AI 模型 Kimi K3 和 Qwen3.8 的相继推出,业界认为美国不应再将中国的技术进步视为一次性的意外。这些具备强大竞争力的模型正在持续涌现,并迫使美国顶尖 AI 实验室重新评估其封闭模型的发展路线,全球 AI 竞争格局正发生深刻转变。
Moonshot(月之暗面)的 Kimi K3 Max 在最新一期的 Arena 系列榜单中表现抢眼,强势登顶 Code Arena 全栈编程、Agent Arena 以及前端代码 Arena 总榜。该模型在多项复杂代码编写和综合任务执行能力上取得突破,已具备与闭源顶尖模型同台竞技的实力,成为当前最强开源/开放权重模型。
一位 Reddit 用户在求购一张价格约 1,300–1,700 美元、显存接近 48GB 的显卡,用来跑本地 LLM。 他表示自己的目标配置需要至少两张 GPU,或者总显存超过 48GB;当前机器是 ASUS ProArt B850-Creator WiFi 主板和 Ryzen 9 9950X,因此来询问有哪些合适的显卡选择。
埃隆·马斯克近日透露了 xAI 下一代大模型的发布时间表与参数规模。他明确表示,Grok 4.6 预计在 8 月 7 日左右发布,参数规模为 1.5T,并在 SFT 和 RL 方面有显著改进。几周后还会推出规模更大的 Grok 4.7,参数达 2.1T。此外,Grok 4.5 目前已升至 Agent Arena 第 13 名。
概率论领域的长期开放问题Feige猜想近日取得突破。据多篇arXiv论文及社区讨论透露,有研究者借助GPT-5.6 Sol成功给出了该猜想的简短证明,并在特定情形下完成了Lean形式化验证。Feige猜想主要探讨一组独立非负随机变量之和的小偏差不等式问题。这一进展不仅解决了数学界的重要难题,也再次凸显了前沿大模型在辅助复杂数学推理与学术研究方面的巨大潜力。
作者发布了 BetterGPT-150M,这是一个约 1.52 亿参数 的轻量级 causal language model,训练数据约 150 亿 token。 帖子给出的要点包括: 采用稳定训练 + annealing 的两阶段配方; 数据集经过筛选,包含 FineWeb-Edu、数学、cosmopedia、starcode-python 等; 评测结果显示它优于 GPT-2 Small,同时训练 token 消耗更低; 目标是低内存、CPU 上快速推理,以及边缘设备实验。 作者还提供了 GitHub 仓库、Hugging Face 模型页和一个在线 Space demo,并说明这只是基础续写模型,还没有做 instruction tuning。

Kimi K3 Q2 被展示为可以在 两台搭载 M3 Ultra 512GB 的 Mac Studio 上本地运行,引用里还提到使用了 pi agent 和 mlx-lm。 核心信息:一个 2.8T 参数 级别的 Kimi 模型正在消费级 Mac 硬件上跑起来。 运行栈:两台 Mac Studio、pi agent、mlx-lm。 看点在于:它把本地推理和大模型可移植性的边界又往前推了一步。
很多人把 open source 和 open weight 混为一谈,但这条帖明确指出两者并不等价: Open weight 只把训练好的 checkpoint 交给你,你可以在自己的硬件上运行。 Open source 则把训练管线、数据和代码一并开放,让你能继续生成下一版模型。 LoRA adapter 或 fine-tune 通常仍只是私有分叉,除非厂商连训练管线也开放。 真正决定团队路线图的,往往不是榜单,而是 license。 配图进一步用流程图对比了两种“开放”:open weight 到 checkpoint 为止,open source 则包含数据/代码/贡献回流到下一版本的完整闭环。

Kimi K3 的长上下文能力细节被截图补充出来:它不显式使用 RoPE,而是通过 KDA 的递归门控和衰减机制编码位置信息,因此可以不做位置编码改造直接外推到 100 万 token。 截图来自“Long-Context Extension”部分,明确写到模型不需要 RoPE scaling 或 interpolation。 这意味着它的长上下文扩展路线更偏“架构原生支持”,而不是后处理补丁。
