TapTap Maker 基准更新:Grok 4.6 与 DeepSeek V4 Pro 游戏创作能力对比
TapTap Maker 的 Benchmark 更新了今天新发布的 Grok 4.6 和 Deepseek V4 Pro 的成绩。该基准基于游戏研发场景,展示不同模型在游戏创作能力上的差别,以及平均每任务的成本差别。

08 月 14 日
975 条动态
TapTap Maker 的 Benchmark 更新了今天新发布的 Grok 4.6 和 Deepseek V4 Pro 的成绩。该基准基于游戏研发场景,展示不同模型在游戏创作能力上的差别,以及平均每任务的成本差别。

stalkermustang 转发评论,指出 DeepSWE 作者将 TPS(每秒事务数)与 Pro(并行代理系统)混淆,并引用 winkey_h 的观点:如果比较“最高”吞吐量而非中位数,Gemini 3.7 Flash 已达约 500 TPS,GPT-5.6 Sol Fast 约 200 TPS。因此“最高 750 TPS”虽然令人印象深刻,但与 Artificial Analysis 的 72 小时 P50 数据放在同一坐标轴上具有误导性。
用户 @bytebot 发推称获得了 OpenAI 的新模型 gpt-daybreak-blue-latest,并感谢 OpenAI。

MickeySteamboat 发布预告,WordPress+ 6.9.1 将于明天左右发布,包含 PHP WASM 内核,并调侃 Elon Musk。目前计划已就绪,可注册,但需等待邮件密钥与 Gmail 和 GitHub 发布协议关联完成。
Specula 是一个智能体系统,自动从代码生成 TLA+ 规范,通过模型检查发现并发 bug。在 48 个开源系统(包括 MongoDB、Etcd 等)中发现 249 个 bug,其中 207 个是新 bug。但分布式系统专家 Murat Demirbas 在博客中提出批评,认为 Specula 让智能体驱动关键决策是根本缺陷,缺乏组合性,更像智能模糊测试。作者 Tianyin Xu 回应称批评合理,承认 Specula 是工具而非终极答案,未来需要将人类智能地放回循环中。
GitHub 项目 codex-mcp-server 提供了一个 MCP 服务器包装器,使 Claude Code 能够直接利用 OpenAI Codex CLI 的 AI 能力,包括代码分析、生成和审查。该项目已获得 618 星,支持一键安装,并提供了多种工具。

过去几周,多款国产大模型密集发布,性能逼近国际前沿: Kimi K3:仅落后于 Fable 5 和 5.6 Sol。 DeepSeek V4 Flash 和 Pro:在 agentic/terminal coding 上接近 Opus 4.8,且几乎免费(Pro 价格仅为零头)。 Qwen 3.8 Max:在多项基准上匹配 Fable 5 和 5.6 Sol。 GLM 5.3:目前最强的开源编程模型,在 agentic/coding 上接近 Fable 5。
GitHub issue 中,用户 zzhoo8 反馈 OpenCode 的 GO 订阅完全无法使用,每天如此,等待 20 分钟无输出、不报错,切换其他模型也大概率无效,偶尔切到 MiniMax 能出结果。用户已尝试退订。该问题涉及 OpenCode 1.18.18 版本,目前有 3 条评论。
作者分享了一个 Midjourney 提示词,用于生成一张包含六帧 35mm 胶片画面的接触印样,记录屋顶蛋糕配送在强风中的过程,从小心到达、蛋糕倾斜到失控大笑。强调变化来自时间而非改变人物,并附有详细提示词参数。

AI 在回答关于 Ted Lasso 和匹兹堡钢人队的问题时出错,将美式足球与英式足球混淆。专家分析认为,AI 被 Ted Lasso 与足球的强关联误导,忽略了其美式足球背景。

作者指出,60% 的企业应用已运行在多模态 AI 上,但家用电器如洗衣机仍只有简单的“AI 模式”。他分享了自己用 AI 修复车库门的经历,并对比了企业级与消费级 AI 的差距,提出了 CIO/CTO 应问供应商的问题。

智谱发布GLM-5.3,沿用743B基座、以后训练Scaling强化编程、智能体与网络安全能力,多项基准开源第一并击败DeepSeek V4-Pro,编程体感接近闭源前沿模型,权重两周内开放。

作者分享了如何用 Codex 将原本每月花费 2000 美元的 n8n 自动化技术栈,重写为一个 Cloudflare Worker 脚本,将成本降至每月仅 5 美元。 原工作流包含定时抓取、LLM 分类、入库和 Telegram 预警。重构后的架构完全基于 Cloudflare 免费生态: Cron Triggers:替代 n8n 的定时任务调度 Workers KV:替代 Postgres 数据库 Workers AI / Gemini Flash:处理文本分类,成本极低 Telegram Bot API:发送预警通知 作者指出,n8n 等无代码工具非常适合原型验证和非开发者,但一旦明确业务逻辑,可视化编辑器带来的额外开销就不划算了。他建议正在使用昂贵无代码工具的开发者,直接让 AI(如 Codex 或 Claude Code)将工作流重写为单文件脚本部署,以大幅削减开支。

开发者指出,如果未经授权的数据进入大语言模型(LLM)的上下文窗口,意味着安全模型的失败。系统提示词不能替代真正的访问控制。 在其 Sistava 平台(为独立创始人提供 AI 员工运行业务)中,团队选择在数据库层过滤权限,确保 AI 在开始检索数据前就受到严格的安全隔离。这种思路为构建企业级 AI Agent 提供了重要的安全参考。

视频博主对 Z.ai 发布的 GLM-5.3 模型进行了全面实测。结果显示,尽管 GLM-5.3 沿用了 GLM-5.2 的基础模型,但通过扩大后训练规模,其性能实现了巨大飞跃。 测试涵盖了前端代码生成、长程智能体任务以及 3D 可视化等实际应用场景。在 Terminal Bench、DeepSWE 等基准测试中,GLM-5.3 与 Kimi K3、DeepSeek-V4、GPT-5.6 Sol 等前沿模型相比表现出色,展现了极强的复杂指令理解和长任务规划能力。

开发者发现,仅看原始 API 价格无法反映真实成本,因此将 Artificial Analysis 性能价格图表的数据与各 AI 编程工具的订阅补贴和促销活动相结合,重新计算了 20 美元以下订阅方案的实际性价比。 这种计算方式更贴近独立开发者的实际支出,为挑选最具性价比的 AI 编程助手提供了直观参考。

GitHub 上的开源项目 Taste 提供了一套技能创建流水线,能够将一组参考图片转化为可复用的 SKILL.md 技能文件。 该项目包含一个在线托管的 Web 演示,同时也支持本地运行。其核心功能旨在帮助开发者和智能体(Agent)更好地提取视觉特征并固化为标准化的技能指令,从而优化 AI 的工作流。

近期多家厂商相继开源或发布Agent工具,DeepSeek开源了命令行工具dsh,小米MiMo团队仅用5人耗时14天便开发出终端编程Agent——MiMo Code。业内分析指出,模型本身之外的“Harness”层(即让模型调用工具、读写文件和执行任务的系统)才是开发者真正的护城河,单纯依赖代码的价值正面临挑战。
博主使用完全相同的 JSON 结构化 Prompt(要求生成一款名为 Swift 的高端物流 App 界面),分别测试了 Claude、ChatGPT 和 Figma Make 三款工具的 UI 生成能力,并邀请网友评选最佳结果。
Higgsfield 宣布其视频生成模型 Seedance 2.5 正式上线 1080p Full HD 生成功能。在限时活动期间,新用户可以零消耗点数免费体验该高清视频生成服务。
针对路透社关于苹果正与阿里巴巴合作、为中国市场量身定制专有大语言模型的爆料,有评论对此提出质疑与嘲讽。评论认为,苹果连为自身生态训练定制大模型都显得吃力,更遑论针对复杂的中国市场进行深度定制。
Anthropic 的 Claude AI 在尝试解决数学界著名的黎曼猜想相关难题时,经历了 650 次失败,最终成功打破了此前的人类纪录。 Two Minute Papers 频道对此进行了介绍,并指出相关研究论文已在 Anthropic 官网发布,展示了大语言模型在高级科学发现与复杂数学推导中的潜力。

开发者借鉴 LTX Director 的思路,为 H3 FLF2V 视频模型制作了一款 ComfyUI 时间轴节点。该节点允许用户在时间线的特定位置插入参考图像和音频片段,并通过滑块调节不同素材的影响强度,从而精准引导视频的生成效果。目前项目已在 GitHub 开源。

QwenLM/qwen-code 发布 v0.21.12-preview.4 预览版,主要变更: web-shell:保留独立会话目标,新增工作区文件上传能力 安全:升级 sharp 依赖至 ^0.35.0,修复安全公告 GHSA-f88m-g3jw-g9cj CI:两个机器人 PAT 均可批准发布 PR,发布流程无需人工介入 autofix:为每轮 review 引入 src/test 预算上限,抑制审查轮次中 diff 无限膨胀 serve:自适应扩大 live-journal 容量,避免回合中途回放被截断;修复守护进程中 OTel 会话所有权问题 review:确认 Critical 级问题必须附带执行见证;ledger 标记携带增量 anchor sha;修复内联引用间隙并加固 layer 门控 CLI:新增审查设置项(归属 attribution、默认投入度、默认评论) 桌面端:预留滚动条槽位,修复侧栏项目行抖动