Maven 热门课程开讲 AI Agent 第一性原理搭建
Maven 平台上的热门工作坊“Build AI Agents from First Principles”引发关注。该课程由 Hugo Bowne-Anderson 主讲,通过约 4 小时的直播,指导开发者从第一性原理出发从零搭建 AI Agent。课程旨在帮助学员深入理解底层逻辑,从而具备独立排障、修改和信任 AI 智能体的能力。

07 月 29 日
436 条动态
Maven 平台上的热门工作坊“Build AI Agents from First Principles”引发关注。该课程由 Hugo Bowne-Anderson 主讲,通过约 4 小时的直播,指导开发者从第一性原理出发从零搭建 AI Agent。课程旨在帮助学员深入理解底层逻辑,从而具备独立排障、修改和信任 AI 智能体的能力。

OpenWorker 是吴恩达相关团队推出的开源桌面 AI 协作助手,仓库在大约一周内就冲到 1 万星。 它主打把日常办公任务真正做完,而不是只聊天:可以连接 Slack、Gmail、Outlook、Google Calendar、Notion、HubSpot、GitHub 等应用。项目本身不绑定模型提供商,可接入 OpenAI、Anthropic、Gemini、DeepSeek、Qwen,甚至本地 Ollama 模型;还支持 触发器,让任务能在后台自动启动。目前只有 Mac 版,Windows 版也在路上。

xAI 官方推出 Grok Build(Build Mode),支持用户通过自然语言提示在网页、iOS 和 Android 端直接生成可运行的应用、网站、游戏或仪表盘,并一键发布至独立域名。该功能目前处于早期 Beta 阶段,仅向 SuperGrok Heavy 订阅用户开放,后续计划下放至 SuperGrok 用户。
xAI 官方推出 Grok Build(Build Mode),支持用户在网页、iOS 和 Android 端用自然语言提示词直接生成网站、游戏、应用或交互式仪表盘,并一键发布至独立域名。该功能主打无代码与全平台覆盖,几分钟即可完成开发上线。目前处于早期 Beta 阶段,仅向 SuperGrok Heavy 订阅用户开放,后续计划下放至 SuperGrok 用户。
一张截图梗图里,模型先被塞进一段“我是 Claude,我对超立方体的真实看法是……”的伪造台词,随后又一本正经地纠正说自己刚进入对话、还没发表过任何看法。 后半段它继续顺着“超立方体”话题解释,称自己乐意认真聊 4D 形状;同时还否认自己知道所谓“Opus 5”,并提醒这类截图未必可信,整体是一次典型的模型角色扮演/对话误植名场面。

ComfyUI 0.29 是一次信息量很高的更新,重点集中在 视频处理、模型生态扩展和性能优化。 视频能力:新增流式视频转码,改为边处理边传输,不再把长视频完整缓存在内存里,显著降低内存占用;训练器、图像处理节点也补上了视频支持。 模型与集成:新增或更新了 GPT 5.6、Gemini 3.5 Flash、Gemini-Omni 修复、Claude Opus 5、字节的 audio-1.0-multilingual、HeyGen、Recraft V4.1 等节点,并将 Runway Gen3a 标记为弃用。 本地模型支持:扩展了 JoyImageEdit、Gemma4 12B、MageFlow、Uni3C ControlNet、Anima、FreSca、Krea 2、LTX 等支持。 性能:RMS RoPE、INT8、Latent Upsampler 等路径都做了优化。 系统/API:后台内存默认上调到 128 GB,Job ID 和 credit 头也开始向 partner nodes 透传。

近日一位开发者表示,AI模型首次在定位Bug根因上比人类更快,且模型获取的信息甚至比开发者更少。该开发者常进行一种“调试赛跑”:先给Agent一个模糊提示让其排查,自己同时并行检查。他坦言,模型在编写修复方案上早已超越人类,而如今在寻找根因这一环节也实现了反超,标志着AI编程能力的又一重要突破。
作者展示了如何利用 ChatGPT Work 提取 Slack 中的笔记,自动在 Google Slides 中生成演示文稿并起草后续跟进内容,实现无需打开电脑即可完成会议准备。
近期用户发现ChatGPT Work的定时任务功能在手机端具有广泛的个人自动化潜力。除了在工作场景中每天早晨自动汇总Gmail和Slack的紧急待办、主动提供会议与邮件建议外,用户还将该功能拓展至日常生活,例如监控演出票务网站、追踪Craigslist房源和价格变动,大幅提升了个人效率。

作者分享了 ChatGPT Work 在手机上的实际用法:每天早上自动查看 Gmail 和 Slack,先把需要处理的事情标出来,让自己在第一杯咖啡前就知道哪些事最紧急。后续线程还会继续展开更多用法。
NewMax 已经把 Grok 接入工作流,形成了 Sol 负责主控、Fable 负责执行、Grok 负责查资料 的分工。作者表示,这套“出海基建”已经基本备齐。
为解决多智能体工作流中的“静默失败”与“自信胡说”问题,名为 ISNAD 的开源框架正式推出。该框架借鉴了古典伊斯兰学术中的传述链验证体系,不再局限于验证代理的身份与权限,而是深入到 claim 级别,直接验证多智能体间传递的信息是否可信。这一创新机制为 AI 知识系统提供了细粒度的溯源与信任保障。
这条帖子的核心信息是:整张专辑从头到尾都是用 AI 做的,作者点名用了 Suno,并半开玩笑地说现在配上一点混乱就能完成这样的创作。 上下文里还有一条引用回复,表示听众已经把专辑循环听了三次并很喜欢。整体更像是一个真实的 AI 音乐创作案例,带点圈内玩笑感。
在多智能体流水线中,单个环节出错往往不会报错,而是导致最终输出「自信地胡说」。作者开源了名为 ISNAD 的信任验证框架,借鉴古典伊斯兰圣训(Hadith)的传述链验证方法,为 AI 流水线中的每个声明附加带分级评分的传输链,并通过独立交叉链验证来提升整体可信度。

这条帖配图在讲图像生成/排版的构图规范: 画面被拆成标题区、留白区、光影引导线和空间截景区几块,用来约束元素分布。 作者的核心意思是:即使透视和光线不完全正确,也能先把布局规则立住,让模型别再“瞎摆放元素”,从而提升整体可控性。

用户反馈 ChatGPT 应用里出现了看似随机的每周用量重置:前一天 Plus 用量已经降到 67%,第二天早上却突然回到 100%,周限制还往后推了一天。 帖子主要是在确认这是不是普遍现象。
- 作者抱怨 Claude Code 的系统提示词已经膨胀到 32k tokens,直接拉高成本、延迟,并拖累性能。 他更认同 Pi 这类极简 coding agent harness:只保留 read / write / edit / bash 四个工具,再加上基础 agent loop。 他的观点是,权限、MCP 客户端、subagents 等功能不该不断塞进核心提示词里,而应该通过 插件化 扩展,避免每次版本更新都把现有环境越弄越重。 帖子还提到 Claude Code 和 Codex 最近都把系统提示词缩短了约 60%,但作者认为“靠单一接口解决一切”的架构问题依然存在。 这是一条很典型的编码 agent 工程实践讨论,重点在于如何在功能和可控性之间做取舍。
作者在搭建一个多租户应用,要做 Email、SMS 和外呼语音 的自动 AI 回复。当前试出来的组合是: Mailgun 负责邮件 Twilio 负责短信 Vapi.ai 负责电话外呼 OpenAI 作为模型层 他的原型已经能跑通邮件和短信的自动回复,但 Twilio 的短信号段订阅费大约要 120 美元/月,在低频场景下很不划算。相较之下,Vapi 的接入体验不错,也能直接用 Twilio 的号码发起电话。 帖子核心问题是:有没有更好的、provider-agnostic 的架构,既能保持可替换性,又能避开固定短信订阅成本。
近日,Hugging Face 开源了一套名为 Speech to Speech 的模块化实时语音对话管线。该方案支持在本地 GPU 上运行,其整体处理流程涵盖语音活动检测、语音识别等模块。此举旨在为开发者提供一个可替代 OpenAI Realtime voice API 的本地化语音交互解决方案,进一步降低了实时语音技术的部署门槛。

作者想了解现实里大家是怎么搭建个人 AI operating system 的,尤其是面向个人执行助理场景:日程、任务、目标追踪、日记和报告生成。 他现在已经有一个能用的系统,但几乎完全依赖前沿大模型,带来成本、token 限制和隐私问题。帖子里提到几种思路: 用 本地 LLM 作为路由器,把信息分到不同隐私层级 先生成“净化过”的文档,再把非敏感上下文送到云端推理 给不同 agent 做严格的访问控制和沙盒隔离 尽量减少敏感信息经过 Slack、Telegram 之类云应用 这不是泛泛而谈的 LLM 使用帖,而是在问:真实可落地的个人 agent 架构应该怎么分层、怎么授权、怎么做硬约束。
Mirage 是一款主打“个性化互联网”的早期访问产品。它本质上是一个 AI Agent,能够根据用户的自然语言指令,实时重塑任意网站的视觉外观、布局和交互流程。 产品展示了丰富的应用场景,例如: YouTube:永久隐藏 Shorts,关闭推荐流,仅显示订阅和稍后观看,或隐藏侧边栏和评论。 社交媒体:将 Twitter 强制设为时间线排序并放大字体,精简 LinkedIn 动态以防止沉迷,自动折叠 Reddit 评论区。 生产力工具:让 Gmail 支持键盘优先操作(如 j/k 移动、e 归档),隐藏 Notion 侧边栏,或将 GitHub PR 列表转换为看板视图。 这款工具旨在打破平台默认的注意力劫持设计,将网页的控制权交还给用户。
近期,Claude Opus 5 的写作风格在 AI 社区引发广泛吐槽,并演变成一种新的网络梗。多位用户反馈该模型在生成文本时存在“想太多”的怪癖,常常过度编辑或将句意翻来覆去地修改,导致输出内容显得空洞且带有强烈的“AI 味”。尽管其编程能力受到认可,但文本生成的怪诞风格引发了关于模型过度优化的担忧。

作者抱怨 Claude 的写作越来越像“AI 腔”,连一些最基础的概念都开始变得难读、难懂。 这不是一篇完整测评,更像是一句模型使用体验吐槽,但它点出了一个很多人都在讨论的问题:模型输出是否正在变得过度模板化。
本周三(7 月 29 日)下午 5–7 点,将在旧金山 Corgi cafe 举办一场 Codex 社区 meetup,由 @iamlulu_zh 和 @VivianCaiIAm 共同参与组织。 活动面向 founder、builder 和 operator,前 50 名报名者可获得抹茶、100 美元 Codex credits,以及巴黎贝甜的点心。
