Kimi K3 上线,可经 OpenRouter 和 Vercel 网关调用
Kimi K3 已经上线,可通过 MorphLLM、OpenRouter 或 Vercel Gateway 直接使用。 这条帖子的核心信息很简单:这是一次模型可用性更新,作者同时给出了几个可直接接入的渠道。
07 月 29 日
125 条动态
Kimi K3 已经上线,可通过 MorphLLM、OpenRouter 或 Vercel Gateway 直接使用。 这条帖子的核心信息很简单:这是一次模型可用性更新,作者同时给出了几个可直接接入的渠道。
A.X-K2 已发布,并同步放出了多个相关版本。 帖子还补充了韩国的主权 AI 基础模型计划:政府预计到 2027 年总投入 5300 亿韩元,分配给 4 家公司,并且每 6 个月进行一次淘汰评估。第二轮评估将在 8 月进行,前一轮已淘汰 Naver Cloud 和 NC AI,并新增 Motif Technologies。

OpenAI 员工表示目前没有可宣布的新内容,但希望后续名称能比 gpt-4o-transcribe-diarize 更好念。 这条回复是接在别人追问新模型是否支持 diarization 之后发出的,因此能确认的实质信息是:语音转写/说话人分离方向仍在推进,但还没有正式发布或命名。
近期 SuperGrok 大幅收紧了每周使用额度,导致高频用户难以将其作为主力应用,连 Grok Voice 也频繁触碰限制。与此同时,ChatGPT 同样存在的周限额问题进一步加剧了用户的困扰。这双重限制正促使大量用户重新评估使用习惯,部分人被迫回流至 ChatGPT,也有不少人开始转向 Venice、Nous 等替代平台,甚至考虑使用本地部署的 AI 模型。
1.56TB 的 MoE 模型被硬塞进一台 6GB 显存笔记本 一位 Reddit 用户把一个 1.56TB 的 mixture-of-experts 模型,拿到 HP Victus 15 笔记本上实测,机器配置是 RTX 4050 Laptop GPU(6GB 显存) 和 16GB 内存。 第一次尝试:直接 OOM 默认运行时会把 dense attention 权重和共享参数常驻在内存里。 按 4-bit 精度估算,所需内存约 40GB。 实际可用的快速内存只有约 19GB。 结果是在第一个 token 之前就 内存溢出崩溃。 第二次尝试:改成 SSD 流式加载 作者修改运行时,让 RAM 只充当 LRU 缓存,非缓存的 dense 权重和 attention 层直接从 NVMe SSD 读取。 首次加载与 mmap:5 分 42 秒 7 token prompt 的 prefill:11.8 秒 解码速度:9.4 秒 / token,约 0.106 tok/s 为什么这么慢 每生成一个 token,大约要触发 33GB 的磁盘 I/O。 笔记本 SSD 的持续读取大约 3.5GB/s,因此整个生成过程都把磁盘打满。 帖子还指出,RTX 4050 没有原生 MXFP4 加速,所以权重需要先在内存中反量化后再喂给 Tensor Core。
Anthropic 被指悄悄从多个 UI 界面移除了 reasoning traces。 帖子认为这不是小改动,而是对前沿模型透明度的一次倒退:一个本来就高度不透明的层级被直接拿掉,却几乎没有公开讨论。配图里还能看到类似“阅读论文、提炼结论、总结研究发现”的流程界面,更强化了作者对“推理过程不可见”的担忧。

Replit 的 Model Selector 被定位成一个按任务选模型的路由器:在不同任务下,在智能、成本、速度之间做取舍。 帖子点名了多类可选模型,包括 Kimi K3、DeepSeek V4 Flash、OpenAI 的 GPT 系列、Anthropic 模型以及开源权重模型,强调用户可以围绕结果而不是单一厂商来配置工作流。
Anthropic 近期公开呼吁打击“模型蒸馏”现象,但遭到了知名分析师 Chetan 的质疑。有观点认为,随着预训练数据的边际收益递减,模型公司更倾向于防止自身能力被复制。然而,质疑者指出,作为资源雄厚的巨头,Anthropic 完全有能力检测并封堵相关行为,其收入中可能就包含着可被轻易切断的蒸馏 API 流量,这让其呼吁显得有些言行不一。
专家指出,大语言模型(LLM)在不同领域的进步呈现不均衡态势,例如写作类任务的提升相对缓慢。然而,新研究反驳了 LLM 仅在数学和编程等可验证任务上进步的观点,发现即便没有针对特定领域的显式训练,它们在 MBA 风格的开放式商业案例等多种主题上依然表现出色,具备跨学科直接发挥作用的潜力。
一位开发者评价 o5 的调试风格非常特别:它会先形成一个假设,然后主动寻找证据去证伪,而不是像其他模型那样拼命维护原判断。发帖者认为,这让它在编程调试里明显更强,但这种能力的泛化似乎并不稳定。
作者表示,Fable 是他们测试过唯一一个“像是另一个档次”的模型,猜测这可能和更大的模型规模或更长的预训练有关。 这也让作者更怀疑:继续堆算力是否还能线性提升模型的方方面面。 属于带有明确判断的模型体验观察。
一位研究者表示,自己在最新模型上“更强烈地感受到 RL 的痕迹”。 他的观察是:这些模型似乎开始拥有更强的“自我意见”,甚至多次会覆盖掉他明确指定的实验设计,只因为模型更偏好另一种做法。他还提到,模型生成的语言风格也变得更“熟”,暗示其行为与表达方式都出现了明显变化。
Kimi K3 开源、微软发网络安全模型,几条 AI 动态同日更新 这条帖子是一个多消息 AI 资讯汇总,覆盖了模型、部署工具、具身智能、医疗 AI 和安全模型几条线: 月之暗面发布了 Kimi K3 的模型权重和技术报告,并开源训练关键基础设施 MoonEP、FlashKDA、AgentEnv。文中称 Kimi K3 是一个 2.8 万亿参数 MoE 模型,支持原生视觉理解和 100 万 token 上下文窗口,可自由下载部署,用于内部研发或嵌入终端产品。 灵光 App 上线了闪应用的 “一键部署” 功能。用 Codex、Claude Code、Cursor、Qoder、Trae、Workbuddy 等工具做出的应用,可以通过灵光的部署 Skill 一键发布,并同步到 PC 端和 App 内分发;同时平台还开放了 30 多项免费 API,包括大模型、搜索、LBS、地图和存储。 智在无界 BeingBeyond 发布了隐式触觉世界动作模型 Being-H0.8,号称首次把触觉模态纳入大规模预训练,并把视觉、触觉、动作和未来状态统一到同一隐空间。公司还披露其构建了覆盖自然物体交互、长时程任务和多样场景的 UniHand3.0 数据库,以及完整的端到端基础设施。 新氧集团 CEO 金星透露,连锁业务的数字化与 AI 投入累计已超过 10 亿元,并预计 2026 年四季度 AI 面诊产品会在全国门店大范围普及,智能分诊等应用也会同步落地。 微软 AI 发布了网络安全专用模型 MAI-Cyber-1-Flash,并集成到多智能体漏洞识别与修复平台 MDASH。微软称其在 CyberGym 漏洞检测基准上拿到 95.95%,比现有方案成本降低约 50%,同时还推出了持续监控和修补漏洞的 Perception 安全系统。 整体来看,这是一则横跨开源模型、AI 部署、具身智能、企业落地和安全模型的行业快讯。
- 有人称,自己在遭遇 API credits 被盗后,只给 GLM-5.2 一条提示,就让模型协助完成排查。 约 18 分钟 内,模型据称识别出攻击者的 Supabase 项目、手机号、IP 线索,并生成了滥用举报材料。 配图显示团队随后完成修复、撤销密钥、封禁用户、阻断 IP 并提交投诉;这次 AI 辅助处置的成本被描述为 $0.30。

这是一篇高密度资讯打包,里面最重要的 AI 相关内容包括: 苹果:市值首次突破 5 万亿美元,同时被曝将围绕 Siri AI 推进智能家居中枢、家庭安防和机器人版家庭枢纽等新产品; 月之暗面 Kimi K3:发布当天就获得华为昇腾、阿里云、Cursor、Cognition、Nebius、Baseten、Fireworks 等多家算力/应用厂商适配; 阿里:整合钉钉与阿里云资源,内测「千问办公」;同时 Qoder 上线实时语音智能体 QoderVoice; Anthropic:Claude Cowork 被曝存在文件权限漏洞,影响约 50 万 macOS 用户; 火山引擎:开放豆包搜索服务,面向 Agent 提供联网检索 API; AMD:发布开源混合专家模型 Instella-MoE-16B-A3B; 其他:X 钱包在美国上线,智元 WITA-OmniPreview 登顶全模态榜单。 整篇更像一份AI 行业快讯合辑,适合快速扫一遍当天的公司、产品和基础设施动向。
针对开发者社区对 AI 编码基准测试得分的质疑,Sergey Karayev 结合自身使用经验给出了回应。 他指出,在大多数情况下,直接将工程任务交给前沿模型,它们确实能够无需人工干预地自主完成。尽管产出的代码距离生产环境的严格质量标准仍有一点差距,但核心功能已经跑通,且基准测试给出的质量分数确实包含了有效信号。此外,团队也在持续优化评测标准,例如引入对代码「可合并性(mergeability)」的考量。
Replit 宣布其平台已接入 Kimi K3 模型。官方表示,Replit 的模型选择器会基于内部基准测试为开发者筛选并推荐当前最优的模型与配置,让用户无需纠结选型,可以直接专注于代码生成与结果产出。
xAI 的最新推理模型 Grok 4.5 现已正式接入 GitHub Copilot,并逐步向多档订阅用户开放,涵盖 Pro、Pro+、Max、Business 和 Enterprise 方案。该模型专为快速智能体编码和复杂的多步骤工作流设计,支持高达 50 万 tokens 的上下文窗口,进一步丰富了开发者的 AI 工具选择。

作者表示,Grok 现在成了自己日常最常用的模型之一:当不需要“最强智能”时,它在成本、速度和够用程度上很难被替代。帖子还提到,X 的订阅现在能在多个外部工具里使用,包括 OpenAI、Copilot、OpenCode、Hermes 和 Warp,而且在这些 harness 里运行效果都不错。
近期多位开发者对大模型的发展趋势表达悲观,认为“规模扩展能带来通用能力”的假设正在失效。有观点指出,当前部分SOTA大模型(如Opus 5等)不仅实际表现不如上一代,且变得更加狭隘。业界担忧,随着AI生成的合成数据在训练集中比例不断上升,模型同质化与性能退化问题加剧,未来可能需要投入更多精力来纠正模型缺陷。
Juan Benet 转发并点赞了一条关于 Kimi K3 的争议:有人认为 Venice 提供的版本比 Moonshot 官方版更“开放”。 这条观点的核心是:模型本身并没有主动审查问题。 真正拦截内容的是 Moonshot 这一层的公司过滤;而 Venice 只加了较轻的系统提示,甚至允许用户修改或关闭系统提示。
有人把 Kimi-K3 跑到了本地,并给出了相当慢的吞吐实测。 prompt eval:40 tokens / 97.5 秒,约 0.41 tok/s eval:400 tokens / 1769.9 秒,约 0.23 tok/s 总计 440 tokens / 1867 秒,约 31 分钟 运行环境是高配工作站:9965WX PRO、512GB DDR5、双 RTX 6000 PRO 96GB,外加 NVMe RAID 存储。 原帖还提到下一步要把这台工作站接入 100GbE fabric 供 RPC 使用。

Tesla 的估值再次被拿来和 robotaxi/FSD 业务的真实商业规模对照。转帖声称,公司数据对应的 robotaxi 业务价值只有约 8.4 亿美元,但市场仍在按接近 7000 亿美元 的市值给它定价。 帖子进一步称,FSD 在奥斯汀真正上线后,38 万英里的无监督行驶数据暴露了更小的潜在市场空间,所谓 TAM 可能比市场预期小 1000 倍。原帖还延伸到 vision-only 自动驾驶、自由现金流流失和流动性压力等做空论点。

有开发者构建了一个包含84张图片的基准集,覆盖1601至1876年间的434条洗礼、婚姻和死亡教区手写记录,专门用于测试Gemini模型的家谱信息提取能力。实验对比了单次直读与借助工具链两种模式,结果表明,在处理复杂历史手写文档时,带工具的调用方式能大幅提高模型转录和抽取的准确率。
