单人用 Claude Code 开发时怎么收尾最后 20%
发帖人是在问:单人用 Claude Code 开发时,怎么把项目从 70% 推到真正完成。 他描述的典型卡点是:做到后面会同时冒出很多问题——bug、缺失功能、接线错误、UI/UX 问题和新的改进想法,导致优先级越来越混乱。帖子想请已经做完项目的人分享:如何决定先修什么、如何判断“够用了可以测试”、以及怎样避免陷进最后那 20% 的无尽返工。
07 月 29 日
532 条动态
发帖人是在问:单人用 Claude Code 开发时,怎么把项目从 70% 推到真正完成。 他描述的典型卡点是:做到后面会同时冒出很多问题——bug、缺失功能、接线错误、UI/UX 问题和新的改进想法,导致优先级越来越混乱。帖子想请已经做完项目的人分享:如何决定先修什么、如何判断“够用了可以测试”、以及怎样避免陷进最后那 20% 的无尽返工。
这条转发称 Google Photos 的能力远超多数人的想象,很多用户其实只用到了它的一小部分功能。 原帖主打“8 个隐藏技巧”,强调 Google 已经把 Photos 做成了一个默默增强的 AI 消费级产品,只是大多数人还没注意到。

Agnes AI 宣布启用全新国内官网域名与 API 访问入口,原国际站用户只需修改 Endpoint 域名即可无缝迁移,同时 Agnes 2.5 Flash 继续免费开放。 与此同时,Agnes 2.5 Pro Alpha 在 Artificial Analysis 榜单的首轮评测中位列第 9(综合智能指数 39)。该模型在贴近实际开发的 Terminal-Bench v2.1(真实终端环境任务)中得分达 67.0%,支持 1M 超长上下文窗口,主要瞄准复杂 Agent 与高难度工程任务。 平台调用数据显示,其全模态模型单周 Token 处理量已达 8.16 万亿,其中图像、视频等多模态任务占比超三分之一,印证了应用场景正向多模态快速延伸。
一个新的 Finance MCP Server 通过 Yahoo Finance 提供股票报价、财务报表、市场数据和公司分析。 它面向使用 MCP 的 Agent,帮助开发者不用自己搭金融数据接口,就能直接接入金融信息。

一个名为 DOI Citation Verifier 的 MCP 服务,会在学术引用被模型使用前,先到 CrossRef 的 1.5 亿+出版物数据库里核验。 它的目标是防止“引用幻觉”,确保 AI 生成或提到的每条参考文献都有有效 DOI,适合写论文、审稿或做学术检索的 Agent 工作流。

a16z 认为,AI 原生内容的关键不一定是取代好莱坞,而是让更多人能创作 在 New Economies 这期播客里,a16z 合伙人 Justine Moore 讨论了生成式媒体的快速演进,以及为什么 AI 原生内容可能正接近一个拐点。 讨论重点 AI 微短剧 的兴起,以及创作者正在打造的新型娱乐形式。 最大机会未必在于替代传统好莱坞,而在于扩大创作人群。 创作者工具 和面向个人的 AI agents 未来会怎么发展。 AI 原生工作室 的经济模型,以及创业者接下来该往哪里做。 生成式视频的机会与 AI slop 的问题。 帖子还附了播客链接、Justine Moore 的 X 账号和 a16z 的分发渠道。
开发者在构建面向深度学习系统的 MCP 工作流时发现,虽然流程能实现目标拆解、研究检索、规格说明到代码实现,但模型在实现阶段会把所有找到的论文方法都拼凑进代码里。为解决这一问题,作者在“研究”与“实现”之间引入了审阅门控机制,从而有效避免 LLM 盲目实现所有检索到的方法,提升了生成代码的质量与可控性。
一个帖子分享了一个用于 Flux 3 的生成提示词:把画面设定成「小场馆里金属乐队返场、手机偷拍视频、唱到副歌、还有一段超强 solo」的现场感场景。 这条内容的看点不在参数,而在它试图让模型生成出那种粗粝、临场、像盗摄现场录像一样的真实感,很适合作为多模态生成 demo 来看。
这条帖子展示了一个名为 WeCommerce 的时尚电商 demo,核心卖点是:用户不必输入精确商品名,也能按“氛围感”去找商品。 它的实现方式是把商品 catalog 存进 Weaviate,每个商品都有 embedding;检索时把 BM25 关键词匹配和向量搜索做混合,既能命中精确词,也能理解语义。用户可以搜诸如 “garden tea party” 或 “berlin techno rave” 这样的描述,再用分类、价格、系列等筛选条件收窄结果。推荐系统同样基于向量相似度,而不是传统的“customers also bought”。
AI模型竞争焦点正从单纯的性能比拼转向性价比。评测基准WeirdML更新至V2版,将任务数从6个扩展至19个,并引入API成本和token数等元数据,方便横向评估准确率与价格。最新榜单显示,OpenAI、Google和Kimi等模型均在性价比排名中脱颖而出,其中Kimi K3 Max以82.6%的成绩紧追Claude Opus 4.8,凸显了行业对“每美元能买到多少智能”的关注。

近日,贾扬清、吴恩达及Meta前研究员Sonia Joseph同日官宣创业,分别瞄准软件工程、教育和物理世界模型。 IntentLab(贾扬清):致力于打造全生命周期软件工程AI团队。其Fleet系统展示了自主优化TensorRT-LLM(提速6.3倍)、逆向重建兼容SQLite数据库,以及从零创造面向Agent的分布式文件系统等能力。 LearnVector(吴恩达):瞄准AI个性化教育,获Coursera一亿美元战略投资。旨在打破传统“一对多”教学,打造可信赖的专属学习向导,首批产品预计2027年面世。 WorldMechanics(Sonia Joseph):注册为公益公司,致力于为物理世界和科学模拟打造可解释的基础模型,应用于气候、电网等复杂系统。
原帖调侃:才跟 GPT 打了个招呼 一个小时,它就已经开始认真“修代码”了。配图则把这种 AI 编程助手的经典翻车感直接拉满。 截图里,GPT 试图修复 sol-ingest/oh/ingest.ts 的一个 bug,但补丁看起来把错误的分支改掉了;同时它还配了一段一本正经、信心十足的解释,形成强烈反差。 截图显示它在 line 158 附近改错了位置。 整体氛围是典型的“模型过于自信地修代码”名场面。 好笑点在于:讲解越认真,补丁越离谱。

软件工程里有两种都很蠢的极端:一种是完全不碰 AI 辅助工作流,拒绝迭代,放弃复利;另一种是相信所谓“软件工厂”真的存在,认为智能体能自主搞定 99% 的工作。 作者的结论很朴素:别迷信口号,自己搭工作流,并且每周持续迭代。
有人实测用 Codex 调用 tldraw CLI,一句话就能生成一个 3D 地球,拿来做地理知识教学演示。 帖子里还提到,别人已经开始用它做项目看板、Todo 和更复杂的交互演示,说明这种“画布即应用”的工作流对在线教育和演示工具很有实用价值。
一位有 15 年经验的 Web 开发者发长帖吐槽:Claude Opus 4.8 和 5 在聊天场景里已经变得很难用。 他区分了两种体验: Claude Code:在配好 CLAUDE.md、约束明确的情况下,编程工作流依然可用。 Claude.ai 聊天:对话体验明显变差,主要问题包括: 明明要求简短,还是会输出很长的“墙状文本” 句法和结构混乱,阅读成本高 经常自信地答错,再来回改口 结尾还爱用 “one thing to flag / one caveat” 这种让人抓狂的收束语 楼主说自己现在做规划和研究时,反而更多回退到 4.6,并且不是提示词、上下文或项目设置的问题,而是模型本身的可用性下降。

AI Agent 手机的竞争,正在从 App 转向权限 这篇文章把当前的 AI 手机热潮拆成了更清晰的产业逻辑:真正的竞争,不是再做一个更聪明的 App,而是争夺谁能成为用户的统一入口和合法代理人。作者将行业路线分成三类: 传统厂商的垂直整合路线:苹果、华为、小米这类公司掌握硬件、系统、账号和生态,Agent 只是既有体系的延伸。 模型公司联合 ODM 从零做手机:例如 STEPX Neo,优点是迭代快,但要重建品牌与渠道。 模型公司和手机品牌合作:把 Agent 深度嵌入系统,其中多数还停留在基础 AI 功能,只有少数产品开始真正进入系统权限和任务执行层。 文章的核心判断是,AI 手机最关键的资产不是模型参数,而是权限与记忆。手机天然集成了账号、手机号、联系人、位置、支付、生物识别和登录状态,能够让 Agent 识别“我是谁”“发生过什么”“如何替我做事”。因此,未来衡量 AI 手机能力的指标,可能不再是用户看手机多久,而是手机替用户完成了多少任务。 文中还指出,最先普及的场景大概率很琐碎:查快递、叫车、点外卖、找照片、设日程、整理录音、填写重复信息。但系统级 Agent 一旦出错,影响范围会比普通 App 大得多,所以它也带来了新的安全问题:屏幕欺骗、提示注入、低权限恶意 App 劫持行为、权限滥用等。文章引用了近期移动 Agent 研究,强调端侧运行并不能自动解决这些风险。 最后作者认为,AI 手机最先真正改变的,可能不是重度科技用户,而是老年人、视障人士和不熟悉智能手机的人——对他们来说,Agent 更像是复杂 App 之间的一层“翻译”和“代办”服务。
近日,一位 Reddit 用户使用 Claude Code(Claude Opus 5 模型)在约 9 小时内、消耗近 400 万 token,成功开发出一款名为 SNOWFLOW 的浏览器端高保真雪地物理 demo。该项目基于 Babylon.js 与 WGSL 实现,在单标签页内呈现出接近 AAA 级别的视觉效果。demo 集成了数百万雪粒子,并具备真实流体物理、布料模拟、动态光照与程序化地形,且雪地痕迹能被脚步和法术永久保留,展现了 AI 辅助复杂图形学编程的惊人潜力。

作者把自己的“第二大脑”改造成了一个几乎全靠 语音捕捉 驱动的系统:先说出想法,再让 agent 负责整理归类。 他的做法分三步: 先准备一个可接收内容的捕捉文件夹,支持语音或文字输入; 再写一份 schema 文档,定义第二大脑里有哪些笔记类型、属性和关联方式; 最后用一个 skill 把 AI 指向“捕捉文件夹 + schema 文档”,让它自动整理。 作者还强调,自己先手动跑了大约一周、不断给 AI 反馈,这一步对效果提升最大。之后流程才进入自动化:每次捕捉后立刻整理,或者夜间批量处理当天积累的内容。配图里的界面也显示了一个类似 Voice OS 的工作流,把洞察、任务和内容创意自动归档。

这条回复指向 Spawn:一个主打“用文字做游戏”的产品。其页面展示了大量用户生成的游戏,覆盖 cozy、RPG、射击、解谜、策略、survivors 等类型。 截图里还能看到产品内的 推荐机制:用户可以通过邮件或链接邀请好友,邀请成功后页面明确写着“每个推荐可赚 $10”,被邀请者注册并完成首次购买后即可触发奖励。
这条在问:给会产出报告的 agent 加什么护栏,才能防住“排版漂亮但数字错了”。 作者的实战结论是,最有效的做法不是再加一个更强的模型,而是: 在模型输出后加一层确定性校验,对关键数字从源数据里重新计算; 要求 agent 对每个数值都附上精确来源行,方便人类快速核对; 对高风险场景再加人工门禁,避免“看起来很专业”的错误报告直接交付。 他还举了一个例子:agent 通过 Gamma API 自动生成回顾 deck,视觉上很完整,但其中一个数字错了;问题不在 Gamma,而在你没有让系统自己发现错误。
Melius 发布桌面端,当前已可在 macOS 使用;Windows 和 Linux 用户则可以先加入等候名单。 这条帖子的核心是产品可用性更新,没有更多技术细节,但足以说明它正在从网页/测试形态走向桌面分发。

AI 进入课堂后,教育要培养的不是“会用工具”,而是“学习主体性” 这期播客引用 OpenAI 的研究称,20% 的 ChatGPT 对话与教育相关,而 40% 用户年龄在 24 岁以下,说明 AI 教育议题已经非常现实,不是未来问题。 节目核心观点是:教育者面临的挑战不是单纯禁止 AI,而是培养学生的 learning agency——让学生先识别问题,再用 AI 扩展思考,而不是把 AI 当成直接交作业的捷径。 节目还提到 OpenAI 的 Study Mode:通过连续追问和引导,刻意避免学生得到过于表层的答案,帮助他们经历“有生产力的困难”。整期内容最终落到一个判断:学校要教的是 AI citizenship,也就是判断、目的与伦理意识,而不只是任务完成能力。
这篇是一个很实用的本地 agent 工程方案:用 grammar 约束让小模型别再把 JSON 输出搞坏。 作者指出,本地跑模型时,结构化输出最常见的问题是: 少一个右括号; 编造一个不存在的 tool 名; JSON 后面又多吐一段废话。 他的做法是利用 llama.cpp 的 GBNF grammar 能力,把每个工具的 schema 编译成语法规则,让模型在 token 级别就被约束住,从而理论上不可能生成非法 JSON。另外,他还会按轮次缩小 grammar,只让模型看到当前真正相关的 3–5 个工具,而不是全部 50 个。 文章背景是他自己的本地 Rust agent Eris: 用 Markdown 笔记做记忆; 单个 Rust binary 运行; 完全本地化; 附带了代码仓库和完整实现细节。

Wired 这篇文章写的是:一些祖辈开始频繁送给孙辈 AI 生成的绘本礼物,而家长们已经越来越受不了。 问题不只是故事质量差、睡前读物内容语焉不详,更麻烦的是,这类书里往往会把孩子的真实照片做成角色,生成出来的内容既混乱又有点吓人。文章把它当作一个更广泛的信号:AI 生成的消费级“垃圾内容”正在以非常尴尬的方式进入家庭生活。