Linus Ekenstam 用智能体 Astra 从零做出沙丘越野游戏
Linus Ekenstam 分享用智能体 Astra 开发游戏的完整探索:从参考图建模 Amble One 小车,到四轮独立悬挂、沙地牵引力与漂移物理、粒子音效电台等完整体验,还 1 小时多生成了马贝拉 15x14 公里 3D 地块,含 4393 栋房屋、约 2 万建筑与 450km 可驾驶道路,展示了人与 AI 智能体协作的极快迭代工作流。
09 月 13 日
488 条动态
Linus Ekenstam 分享用智能体 Astra 开发游戏的完整探索:从参考图建模 Amble One 小车,到四轮独立悬挂、沙地牵引力与漂移物理、粒子音效电台等完整体验,还 1 小时多生成了马贝拉 15x14 公里 3D 地块,含 4393 栋房屋、约 2 万建筑与 450km 可驾驶道路,展示了人与 AI 智能体协作的极快迭代工作流。
- Linus Ekenstam 分享用智能体 Astra 开发游戏的体验:重点不是做出有人玩的游戏,而是探索「我和 Astra 能一起做什么」。 他可以随时与 Astra 来回对话、试玩、调整,迭代速度极快。 他推演:如果未来能在多线程对话中并行做这件事,一个游戏工作室或 OpenAI 用 1 万个并发 agent 加 100 名专业设计师,产出将进入「超速档」,行业还不知道那意味着什么。
博主推荐一款 Chrome 扩展:X(Twitter)收藏导出工具,支持按收藏夹文件夹批量导出内容,作者表示使用体验很好。对需要整理和备份大量收藏推文的用户是实用工具。
开发者正在用 Hermes 构建自托管研究 agent,已在 VM 上跑 SearXNG 和 Scrapling,但搜索时频繁被网站识别为机器人、无法过验证码。约束是不用付费 API 和云端抓取服务。作者询问社区:研究 agent 该配哪些工具、需要哪些技能,并提到 Crawl4AI、自托管 Firecrawl 和 webcmd 等候选。
字节跳动 Seedream 团队发布新研究 VoT(Vision-of-Thought),用于统一多模态表征对齐。其核心设计是在 VLM 与 DiT 扩散主干之间加入一个 VoT 层,让模型在渲染像素之前先进行「视觉思考」,即在生成图像前先做视觉层面的推理。该方法旨在打通视觉语言模型与扩散生成模型,提升多模态统一建模能力。
XFreeze 发布 Grok Build 两个版本更新: v1.0.30 会话头重设计为单行布局,附带 Dashboard 按钮 计时器支持小时进位(如 3h14m),长会话更易追踪 Dock 中 Watchers 和 Loops 显示下次运行时间,工作流状态可直接点击 修复 tmux 面板逐帧同步渲染导致的卡顿 v1.0.29 修复 pager 中 Tab 导航循环,新增 Ctrl+G 快捷显示/隐藏 dock 修复多个并发 grok agent stdio 进程共用同一 GROK_HOME 时的崩溃,恢复与新版 MCP 服务器兼容 修复 Windows 启动崩溃;Dashboard 不再重复重绘空闲帧浪费 CPU

事件 llama.cpp moe-expansion 分支作者 vagrillo 在 GPQA-Diamond 全部 198 题上对比了 MoE 路由扩展(expanded routing)与原生路由及 dense 模型: Qwen3.6-35B-A3B + 扩展路由(Q8_0):84.34%(167/198) Qwen3.8-27B dense(Q8_0):83.84%(166/198) Qwen3.6-35B-A3B 原生路由:81.82%(162/198) 测试条件统一:greedy 解码、32K 预算、相同 prompt、单张 RTX 5000 PRO 48GB,每配置只跑一次。 作者为何不信自己的结果 35B 扩展 vs 27B dense 仅差 1 题,是持平不是胜出 扩展 vs 原生为 12 胜 7 负(净 +5),但 n=198 下不具统计显著性 12 次扩展胜出中有 10 次集中在 Chemistry,Physics 已饱和、Biology 持平 单次运行、单一种子 作者求助于社区 1. 什么 benchmark 适合与 GPQA-Diamond 搭配做路由对比 2. 成对比较需要多少次运行才够 3. 仅 Chemistry 有效应是否可信还是危险信号 4. 有没有其他人观察到 MoE 扩展带来的真实提升
- 引用的原帖指出:问题出在 Codex harness 本身——agent 等待后台任务时,harness 会反复调用模型轮询进度,每次调用都携带完整上下文,即使没有任何变化也在持续消耗输入 token;goal 机制还会自动开启新 turn,加剧重复上下文,形成烧 token 的循环。 Brandon Galang 的建议:明确指示 Astra 不要持续轮询,或把这类重复循环委派给 Luna 执行,可以省下大量费用;他预计该做法几周内会被官方收进 system prompt。
一位用户此前用 Wan 2.2 16fp i2v 正常生成 5 秒视频,几周后在 ComfyUI 及其他组件均未更新的情况下,输出突然变成诡异的波浪状抽象动画。 排查过程:作者与 Claude 一起排除多种可能,关闭 sage attention 无效,最终换用 fp8 模型后恢复生成。Claude 判断 5090(32GB 显存)+32GB 内存的配置本身够用,问题根源很可能是 Blackwell 架构的 fp16 累加不稳定——作者自己也提醒这更像是 AI 的断言而非已证实的结论,在帖中征求其他人的见解。
开发者 cedric_chee 进行了一系列实验:将《GT 赛车》画面与《F1》电影素材喂给 GPT-6(Astra),生成了含主菜单、可交互的 3D 赛车场景。他并非一次性生成,而是在高低推理档位间切换,并利用 Astra 内置浏览器做真人试玩验证。当前他优先打磨玩法与音效,但受限于 token 预算。

data4sci 发布长线程讨论 LLM 评测的常见痛点:同一 eval 跑两次得到不同分数,多数团队无法判断这是真实回归还是统计噪声。 作者提出一套可每次给出答案的判别方法,用于区分真实回归与噪声。 发帖人 bgoncalves 称「不稳定的 eval 分数让我浪费在调试上的时间比真正的 bug 还多」,并将于 9 月 23 日免费直播教学这套方法。 对做 agent eval 工程的团队是实用素材,线程原文含完整方法论。
generativist 想在遛狗时收听 @packyM 的最新文章,却发现对方没有音频版。于是他抓取 packyM 过往录音作为声音样本,借助 Google Astra 在约十分钟到半小时内快速搭出了「干净 HTML 转旁白音频」的管线,连原作者的声线都能克隆。这一案例展示了 AI 智能体让普通用户以极低成本实现个性化工具的想法落地。
一位肿瘤科医生(OncoThor)分享:他用可用的最强版 Open Evidence 和 ChatGPT 跑大量不明原发癌复杂病例(去除患者隐私信息、使用机构批准版本),结果令人印象深刻。他强调提示词须包含临床、病理、影像报告和分子等多维数据,且需要专业知识判断输出是否合理——有时 AI 输出确实不靠谱。他认为是时候对此展开正式研究了。转发者 danamlewis 进一步提出:患者不仅有知情权知道 AI 是否参与诊疗,在罕见和疑难病例中也应有权知道为什么没用上 AI 这一最佳资源。
作者建议 AI 编程时的时间配比应该是:约 20% 的时间让 AI 帮你构建应用,80% 的时间自己去使用这个应用。核心逻辑是:如果你自己都不爱上自己的产品,其他用户凭什么会喜欢?
OpenAI 开发者账号宣布 GPT-6 Astra 正式发布,并集中展示了社区开发者用其做出的一批项目,包括: 含 2,234 个建模解剖结构的 3D 人体探索应用 用 Unreal Engine 复刻的曼哈顿场景 梵高六幅画作变成 Three.js 可步行小镇 Sweep 用 AR 可视化扫地机器人覆盖区域 手绘火车图变成含 3,295 个可编辑对象的 Blender 模型 Astra + Blender 打造的水下浏览器游戏 图像转定制乐高设计的原型 Unity 混合现实空管模拟器、Three.js 赛车游戏、带 VHS 效果的 Backrooms 场景 ESP32 工作台原型可视化电路板与接线 Swift 移植让 C++ 光线追踪器跑在 iPhone GPU 上 官方还号召开发者分享构建并 @OpenAI 争取被收录。

有用户实测 Krea 2 的角色生成能力:不使用 LoRA 直接生成 2D 与 3D 游戏角色,约有一半次数能正确还原来源角色,说明其对训练数据中的角色记忆相当强。 作者同时观察到 Civitai 上的角色 LoRA 生态偏写实内容,2D 与游戏相关角色的 LoRA 很少——意味着想稳定生成动漫/游戏角色仍需自训 LoRA 补足。
有人整理了一个收录 500+ 个 agentic AI 项目的 GitHub 仓库,按作者说法适合用来: 寻找下一个项目灵感 研究各类 agent 的具体实现方式 直接挑选项目上手 对想入门或深入 agent 开发的开发者是个不错的书签资源。
Refero Styles 将 Linear、Stripe、Notion、ElevenLabs 等 2000 多个真实产品的设计系统整理成 DESIGN.md 文件,可直接放进代码仓库,让 Cursor、Claude Code 等编码智能体依据真实设计规范而非猜测来写 UI。 每个文件包含: 色彩 token 及每个色值的具体用途; 字体层级、字重、字距规范; 间距、圆角、阴影规则; 组件模式; 明确的 do 和 don't 清单。 作者观点:AI agent 能写出干净的代码却做出丑陋的 UI,这个差距缺的不是模型,而是一份设计规格说明。目前工具免费。
用户实测腾讯开源的 WeMM-Embedding 模型,用它从《三体》视频中把所有展示电脑桌面的画面和视频片段检索出来,且能在自己的 RTX 3060 显卡上稳定运行。作者认为该模型可做很多视频衍生品,并向网友征集更多玩法点子。

Packt 出版新书《Multi-Agent AI Engineering》,作者为 Dr. Xiao Ma 与 Dr. Chi Wang,讲解如何设计、构建和运营以协调团队方式工作的多智能体 AI 系统。 全书目录涵盖:多智能体系统原理与心智模型、构建首个 Agent、Agent 间通信与协作、上下文管理、Agent 团队编排、统一抽象与协作协议、多智能体协作设计模式、主流框架横向对比、多智能体系统性能与行为评估、安全与在线护栏、可观测性、自我进化的多智能体系统、部署与扩缩容,以及真实应用案例与前沿研究趋势。

Higgsfield 发布 AI Motion Designer,一款可接入 After Effects 的 ChatGPT 插件,据称能理解动画原理、自动编写表达式并调整关键帧。结合 GPT-6 Astra,用户在 ChatGPT 中输入指令即可直接在 AE 中生成内容,甚至一句话生成 3D 引擎,无需系统学习 After Effects。其设计负责人演示称,过去耗时约一周的程序化动画工作,如今缩短至约 20 分钟,大幅提升动效设计效率。
Reddit 上有用户分享了 OpenMCP 项目(logicsrc.com/openmcp),定位为 MCP(Model Context Protocol)生态相关的开放工具。帖子本身信息有限,感兴趣的可直接查看项目页面了解其功能与用法。

作者 mhmazur 分享了用 Codex 和 Astra 组合制作艺术 GIF 的实验成果:一幅复古未来主义的星球改造场景,呈现出厚涂油画(impasto)的丰富质感。
楼主在 RTX 5050(8GB 显存)笔记本上用 MiniMax 的视频生成工作流做实测:仅用 1 个节点、5 张图片加 5 条提示词、耗时 17 分钟,一次性生成短视频草稿,全程无需剪辑。楼主表示许多视频工具用起来繁琐,这种"扔图扔 prompt 直接出草稿"的轻量体验正是自己想要的效果。
