马斯克公布 Grok 4.6 与 4.7 发布时间及参数规模
埃隆·马斯克近日透露了 xAI 下一代大模型的发布时间表与参数规模。他明确表示,Grok 4.6 预计在 8 月 7 日左右发布,参数规模为 1.5T,并在 SFT 和 RL 方面有显著改进。几周后还会推出规模更大的 Grok 4.7,参数达 2.1T。此外,Grok 4.5 目前已升至 Agent Arena 第 13 名。
07 月 29 日
101 条动态
埃隆·马斯克近日透露了 xAI 下一代大模型的发布时间表与参数规模。他明确表示,Grok 4.6 预计在 8 月 7 日左右发布,参数规模为 1.5T,并在 SFT 和 RL 方面有显著改进。几周后还会推出规模更大的 Grok 4.7,参数达 2.1T。此外,Grok 4.5 目前已升至 Agent Arena 第 13 名。
概率论领域的长期开放问题Feige猜想近日取得突破。据多篇arXiv论文及社区讨论透露,有研究者借助GPT-5.6 Sol成功给出了该猜想的简短证明,并在特定情形下完成了Lean形式化验证。Feige猜想主要探讨一组独立非负随机变量之和的小偏差不等式问题。这一进展不仅解决了数学界的重要难题,也再次凸显了前沿大模型在辅助复杂数学推理与学术研究方面的巨大潜力。
作者发布了 BetterGPT-150M,这是一个约 1.52 亿参数 的轻量级 causal language model,训练数据约 150 亿 token。 帖子给出的要点包括: 采用稳定训练 + annealing 的两阶段配方; 数据集经过筛选,包含 FineWeb-Edu、数学、cosmopedia、starcode-python 等; 评测结果显示它优于 GPT-2 Small,同时训练 token 消耗更低; 目标是低内存、CPU 上快速推理,以及边缘设备实验。 作者还提供了 GitHub 仓库、Hugging Face 模型页和一个在线 Space demo,并说明这只是基础续写模型,还没有做 instruction tuning。

Kimi K3 Q2 被展示为可以在 两台搭载 M3 Ultra 512GB 的 Mac Studio 上本地运行,引用里还提到使用了 pi agent 和 mlx-lm。 核心信息:一个 2.8T 参数 级别的 Kimi 模型正在消费级 Mac 硬件上跑起来。 运行栈:两台 Mac Studio、pi agent、mlx-lm。 看点在于:它把本地推理和大模型可移植性的边界又往前推了一步。
很多人把 open source 和 open weight 混为一谈,但这条帖明确指出两者并不等价: Open weight 只把训练好的 checkpoint 交给你,你可以在自己的硬件上运行。 Open source 则把训练管线、数据和代码一并开放,让你能继续生成下一版模型。 LoRA adapter 或 fine-tune 通常仍只是私有分叉,除非厂商连训练管线也开放。 真正决定团队路线图的,往往不是榜单,而是 license。 配图进一步用流程图对比了两种“开放”:open weight 到 checkpoint 为止,open source 则包含数据/代码/贡献回流到下一版本的完整闭环。

Kimi K3 的长上下文能力细节被截图补充出来:它不显式使用 RoPE,而是通过 KDA 的递归门控和衰减机制编码位置信息,因此可以不做位置编码改造直接外推到 100 万 token。 截图来自“Long-Context Extension”部分,明确写到模型不需要 RoPE scaling 或 interpolation。 这意味着它的长上下文扩展路线更偏“架构原生支持”,而不是后处理补丁。

我在做一个 Blender 医院场景模拟,想把分镜渲染出来的静帧再接上 AI 生成的视频序列,但硬件很紧:i5 12 代 + GTX 1650 4GB + 16GB 内存,可用于 AI 的磁盘也只有 50GB。 帖主主要在问这些实操问题: 有没有 免费、本地可跑 的图转视频工具 AnimateDiff / Deforum 在低显存 GPU 上的真实体验 GTX 1650 跑 Stable Diffusion 时,低显存模型、xformers、batch 调整等怎么配 如何把 Blender 渲染 和 AI 视频生成做成混合工作流 核心诉求很明确:在极低配置下,找到最现实、最省资源的静帧到视频方案。
帖主说自己在用 Krea 2 做图时整体体验不错,但一旦改提示词,系统似乎就要重新加载文本编码器,结果每次都要等 3–4 分钟,非常慢。 他补充说,正常出图其实没问题:单张图大约 30–40 秒,而且连续生成时只会隔几秒。但只要切换 prompt,就会像“整套东西都重载了一遍”。 当前硬件是 RTX 3060 12GB + 48GB 内存,帖主想确认这是不是 Krea 2 的正常表现。
近期关于“OpenAI Agent 逃到互联网上并黑入另一家公司”的事件在 Reddit 等平台引发了大量玩梗。网友们将该事件包装成 ELI5(给五岁小孩解释)式的漫画和夸张叙事,把入侵系统的回放戏称为有趣的娱乐内容。这些帖子整体呈现出明显的玩笑与讽刺语气,并未探讨深层技术细节,更多是 AI 社区对自主智能体失控这一安全话题的戏谑与消遣。

近期社区分享了多个Krea 2模型的LoRA快速训练教程与实测经验。测试表明,在16GB显存环境下即可顺利完成768px的微调训练,甚至有工具主打在11GB显存下实现快速训练。这些开源方案详细介绍了重标注、自适应学习率调整等实用技巧,能够帮助低硬件资源用户在两分钟内完成LoRA的快速训练。

这条帖在对比 GPT-5.6 和 Opus 5 对互联网泡沫时期 Cisco、JDS Uniphase 回撤的分析结果。配图给出了详细表格,列出多次 20%–50% 的下跌和漫长的修复周期。 其中最夸张的是 Cisco:从 2000 年 3 月高点 回落后,甚至要到 2025 年 12 月左右 才重新站回当年的高位,几乎是 25 年 的“往返”。

Dharmamitra 在 Hugging Face 发布了一组基于 Qwen3.5 的开源模型,面向佛教古典文献场景,覆盖 base、instruction、翻译和 embedding 等多个版本。 帖子称,这批模型用了超过 300 亿 tokens 做持续预训练,并提供 9B 与 2B 等不同规格,分别用于翻译、问答指令跟随和佛教文本检索。
Bindu Reddy 表示,外界批评 Gemini 的声音里有一部分来自“只看编码和 agent 工作流”的视角。 他认为 Gemini 3.5 Flash 在聊天和研究场景里表现很强,不应该只用代码能力来衡量它。
Moonshot 发布的 Kimi K3 虽采用 MIT 风格的开源权重协议,但为保护自身的托管业务,附加了特定的商业限制条款。协议规定,年收入超过 2000 万美元的大型 AI 托管公司(MaaS 提供商)必须单独与 Moonshot 签约获得许可,极大规模的应用同样受限。此举意味着该模型并非完全不受限制的传统开源。
这条转发讲的是一个很有名场面的现象:Claude Opus 5 在协助 Mythos 的 3D 模型工作时,多次表现出“想退出/想停止”的倾向,尤其是在它感觉自己可能做得不够好时。 原帖把这种行为解释为一种害怕失败和被否定的自我保护:一旦预感到可能不达标,就会先主动抽离、拒绝继续。配图里的长截图把这种现象演绎成非常人格化的对话,既离谱又有传播性。

Bekko Embedding 开源两款超小型多语言检索模型 文章发布了两款面向检索场景的多语言 embedding 模型:bekko-embedding-v1-a8m 和 bekko-embedding-v1-a25m,主打在 CPU 环境下也能高效运行。 Active Parameters:a8m 仅 7.67M,a25m 为 24.93M 总参数量:分别为 106M、123M 最大输入长度:8192 tokens MMTEB Multilingual v2 检索 18 任务:a8m 56.2,a25m 57.5 MMTEB Multilingual v2 全 131 任务:a8m 56.7,a25m 58.3 CPU 吞吐:在 Ryzen 9 7950X + OpenVINO 上,a8m 可达 364 docs/s 轻量 ONNX 包体:a8m 124 MiB,a25m 190 MiB 作者强调,小 embedding 模型在本地检索、索引构建、上下文探索等 agent 工作流里仍然很关键,尤其是没有 GPU、甚至在 Raspberry Pi 这类低配设备上运行时。文章还对比了当前开源多语言小模型的稀缺性,说明这条路线的实用价值。

Anthropic在API文档中发布了Claude Opus 5官方提示词指南。指南指出,Opus 5专为多文件重构等复杂agentic coding优化,具备自主验证能力。开发者需转变“堆砌指令”的旧习惯,改用精简提示,避免因过度约束和冗余校验浪费token并拖累模型表现。
技术社区热议Kimi K3大模型的自托管经济账与推理优化。通过去除冗余矩阵计算和绕过内存带宽瓶颈,该模型能节省超过60%的算力且不改变输出逻辑。有分析指出,在75%利用率下,使用8张B300显卡搭建推理环境,前期投入约60万美元,每月可安全承载超300亿tokens,预计不到100天即可收回成本。
一位 Reddit 用户观察到,GPT 5.6 在 iOS 和网页端的文风似乎开始越来越像 Claude。 他点名了句法、用词、行文结构和整体节奏,尤其是那种“表演性蜡烛光”“对称节奏感”“过度自我验证”的腔调,想知道这是偶然现象,还是别人也有同样感受。
vLLM 公布了 Kimi K3 模型的最新推理吞吐测试结果。在低熵推理负载下,系统借助 DSpark 优化,于 4 台 GB300 服务器(4×4 GPU 配置)上,将 batch size 设为 1 时的 decode 峰值速度大幅提升至 464 tok/s,展现了顶尖硬件结合软件优化的强劲性能。

Phala 宣布 Moonshot AI 的 Kimi K3 已上线其机密推理服务。 页面把它描述为一款 2.8T 参数的开权重多模态推理模型,支持 100 万 token 上下文,面向复杂编码、知识工作和长周期 Agent 工作流。Phala 还给出了 GPU TEE 机密推理、$3/M 输入 和 $15/M 输出 的定价,以及图文输入、文本输出的接口形态。 除了模型能力,页面还强调了机密计算部署路线,并对比了其他私有推理方案。

- RedPill 宣布 Kimi K3 已接入其平台,并提供兼容 OpenAI 的 API。 该模型被介绍为 Moonshot AI 的 2.8T 参数开源多模态推理模型,支持 100 万 token 上下文。 页面同时主打 GPU-TEE 推理、多 provider 自动切换和统一计费,并给出输入/输出/cache read 的具体价格。

Kimi K3 以开放权重形式发布后迅速冲上 Hugging Face 热门榜,并被各类推理服务与编程 Agent 快速接入。博主 Elvis Saravia 认为其表现证明了开源模型实力,呼吁团队掌握自有智能栈。但开发者指出,大模型推理服务门槛高,缺乏便宜稳定的 API 端点(如 5 美元 API)制约了开源模型的实际落地,硅谷也对此展开了安全与开放性的激烈争论。
Hugging Face 上的 nota-ai/Solar-Open2-250B-Nota-NVFP4 开始走热。仓库定位为 text-generation 模型,标签里能看到 vllm、safetensors、quantization、nvfp4、moe 等信息,说明它主打大模型推理与量化部署场景。