吐槽:AI 再聪明也不知道该把推理强度调到低中高哪一档
一条简短吐槽:无论模型变得多聪明,面对一条 prompt 时依然无法自己判断该用 low、medium、high 还是 max 推理强度。 pointed out 了当前推理模型「思考档位」仍需用户手动选择的尴尬现状。
09 月 13 日
472 条动态
一条简短吐槽:无论模型变得多聪明,面对一条 prompt 时依然无法自己判断该用 low、medium、high 还是 max 推理强度。 pointed out 了当前推理模型「思考档位」仍需用户手动选择的尴尬现状。
作者观察到有趣的编码风格反差:Opus 提交约 5 行的小改动时会反复检查、写测试,还在 commit message 里附上一段论证;而 Sol 在一小时内写出约 5000 行的大型新系统后,不做任何检查立即提交,commit message 只有一句「added new X system」。
一条图文生成提示词模板:用同一个 prompt 生成竖版 4:5 双拼「旅行明信片」。 上半部分:超写实手机随手拍风格——意大利 Portofino 石板街、金色时刻光线、粉彩色建筑与地中海背景,人物穿着、姿态、道具都逐项描述到位。 下半部分:要求对完全相同的场景与人物转成水彩+钢笔淡彩风格,强调笔触、纸纹、墨线,并保持构图、服装、姿势一致。 模板的核心技巧是「同场景双风格」的约束式写法:把写实版细节全部列死后,在下半部分用『EXACT same』逐项锁定一致性,适合做对比图、风格化旅拍内容。

开发者发布 Apache-2.0 开源项目 aletheia-mcp(npm 与 MCP 官方 registry 可得):一个确定性的预执行过滤器,在 MCP 工具调用真正运行前拦截提示注入与越权行为。 设计思路 市面多数 MCP 护栏要么在热路径上放一个 LLM 判断每次调用(慢且自身可被注入),要么靠各工具自行实现检查;Aletheia 做成零模型、fail-closed 的前置层。 两种模式:独立 guard 工具供手动调用,或作为任意下游 MCP server 的透明代理。 基于签名/模式匹配,签名来自跨语料的真实越权事件数据集:破坏性 bash 命令、SQL 注入/变更、文件系统逃逸、凭证与 SSRF 外泄尝试。 单次检查约 25µs 开销,附带 155+ 测试。 作者坦承局限:这是模式过滤器不是沙箱,黑名单天然不完备。近日有研究员发现一个真实绕过(显式开放网络后,非管道化的先下载后执行模式绕过了混淆过滤器),作者已验证、修复并发布 GHSA-grqh-xhm8-rj49 公告。 作者同时发起讨论:签名/黑名单方案对比全量 allowlist 或沙箱执行,天花板在哪里?

GitHub 博客介绍 Copilot 应用的新功能:diff、终端、浏览器三个面板并排内置,让开发者无需在编辑器、终端和浏览器间切换即可完成 agent 代码的审查闭环。 Diff 面板:高亮显示增删改行,可接受、评论或要求 Copilot 修改,用户保留最终决定权。 终端面板:直接在会话内运行项目命令,可配置为脚本(Run 按钮),示例演示启动 dev server 预览网站。 浏览器面板:并排预览 Web 应用真实运行效果。 作者观点:AI 编码的安全性取决于验证是否容易——看 diff、跑终端、浏览器实测三步构成接受 agent 代码前的完整检查循环。
- 美国高级健康研究计划局(ARPA-H)启动名为 ADVOCATE 的项目,投入 6270 万美元开发面向患者的智能体临床 AI 系统,专注心血管护理尤其是心力衰竭治疗。 目标是打造「数字护理团队成员」:持续监测心衰患者、在就诊间隙提供部分护理,并在需要时升级转给临床医生。入选团队将构建患者端 AI、监督型智能体 AI 以及可规模化的部署方案。 项目关键一环是与 FDA 密切合作,为「自主临床 AI」这一全新类别建立监管框架,合作方包括 Kaiser Permanente 等。

xeophon 质疑为什么一些实验室把自家 API 或产品路由到 Claude,认为这既没有技术优势又损害声誉。在被追问后他补充技术细节:SFT 能带来提升,但如今模型能力主要来自 RL 和环境(envs),这解释了为何实验室之间会在 API 层面互相借用能力。这暗示部分模型的对外服务实际由 Claude 承担,引发对模型真实能力归属的讨论。
Lenny Rachitsky 播客邀请 xAI 的 Grok Bot 产品负责人 Roman Ugarte 首次公开这款爆火产品的诞生过程:几个月前一支小团队在办公室单独区域从零开始开发,写出第一行代码仅四周后全公司内部上瘾,再过三周对外发布,上线不到一个月已有数百万 Grok Bot 在帮用户干活。 本期播客披露的要点包括:为什么他们选择从零重做而不是把它做进 Cursor;两个看似反直觉、却成就了产品成功的押注;以及早期靠人工 onboarding 用户时学到的经验。
开发者bilawal sidhu开源了MIT协议项目God's Eye View,这是一个基于照片级真实3D地球的浏览器内“间谍卫星模拟器”。用户可自由跳转视角,实时进入全球民航客机、船舶和卫星的视角,还呈现地震、交通和公共摄像头等真实数据,并支持语音模式交互。项目完全开源且数据均为真实来源,引发社区关注。
bilawal sidhu 开源了 God's Eye View 项目:一个浏览器内的间谍卫星模拟器,基于照片级真实 3D 地球仪,实时呈现航班、船只、卫星、地震、交通和公共摄像头的真实开源数据,并支持由实时 AI Agent 驱动的免提语音控制。该项目出自其 YouTube 系列(播放量超 500 万,全社交平台超 2500 万),曾登顶 GitHub Trending,目前星标已达 2.94 万。

博主sebkrier发布了一张标注“mj8.2”的黑猫样张,被解读为Midjourney 8.2版本的测试输出。其发帖正文极为简洁,实质信息都在配图中,或为MJ新版本的早期测试或爆料。具体能力细节尚待官方确认,但疑似新版的图像质量已在社区广泛流传和讨论。

博主 sebkrier 发帖暗示 Midjourney 8.2 的存在,并附上一张图。正文极简,实质信息在配图里,或为 MJ 新版本的早期测试/爆料。具体画面细节以原图为准。

chrisalbon 分享用 Astra 追踪热量和宏量营养的体验:给孩子做了墨西哥薄饼,本不打算吃但后来吃了点剩的。用 MacroFactor 回溯补录会非常麻烦,而 Astra 只需口述做了什么、估算自己吃的份量即可,估计误差在 10% 以内。

一位设计从业者发帖询问同行:快速迭代和 logo 概念头脑风暴时用什么生成式工具——是手绘/Procreate/Illustrator,还是用图像生成模型产出概念稿?作者称失去了 iPad,正处于 Procreate 戒断中。属于工具讨论求助帖,无结论信息。
Spencer Greenberg 用比喻概括 AI agent 的使用之道:agent 如同能在几分钟内完成你几小时工作(或需请专家)的精灵,但你必须懂得检查它的工作,否则就成了「猴爪」——做错的任务往往比没做更糟。
TheMoonMidas 回应「DeepSeek 只是蒸馏 OpenAI 模型」的说法,指出 DeepSeek 在 MoE 架构、高效训练和强化学习推理(R1)方面都发表过原创工作;蒸馏可能只是重要加速器和成本节约手段,并非全部故事。
针对“DeepSeek只是蒸馏OpenAI模型”的说法,Steve Hsu转发回应称,非技术人士及有意识形态倾向的技术人士过度强调蒸馏,忽视了只有中国实验室公开发表的模型架构创新,像DeepSeek V4.1这样的模型效率主要来自架构层面。另一网友也指出,DeepSeek在MoE架构、高效训练和强化学习推理(R1)方面都发表过原创工作,蒸馏只是次要因素。
一条推文抛出尖锐论断——「Anthropic 已不再是前沿实验室」,被转发到 Hacker News 引发讨论。这是针对 Anthropic 当前模型能力与前沿地位的行业争论,在 Gemini、GPT 等竞品快速迭代的背景下,关于谁仍在前沿的判断本身成为话题。
arXiv 论文《World in World》提出一种免训练的推理时接口,无需重训即可让冻结的自回归视频世界模型获得灵活的相机与时间控制,可实现重机位与回访等操作。其核心思路是将源视频观测、目标视角场景投影与引导信息结合,通过原生自注意力机制路由异构视觉证据,并借助对应引导查询实现精准控制。
一份精选的 GitHub 实用开源项目清单,主打自托管与去广告: Cobalt:从主流平台下载媒体,无广告无弹窗 SearXNG:自建私有的无广告元搜索引擎 Reactive Resume:免费创建并托管不限量专业简历 网页变更监控工具:页面有变化即通知 Suwayomi:自托管漫画阅读与管理服务器 LibreTranslate:自建翻译服务,不依赖付费 API gallery-dl:从数百个站点下载与归档媒体 ArchiveBox:本地保存网页,搭建个人网页存档 适合想摆脱付费服务、掌握自己数据的用户。

Reddit 用户分享自己在每次 AI 会话结尾固定提出的两个问题。第一个是问模型「你现在最没把握的是什么?」,模型通常会列出 6-7 个未充分调查的点,约四分之一的情况下会发现某个重大遗漏,再让模型逐一深挖根因。第二个来自 Sam Altman:「关于当前局面,我最大的盲点是什么?我意识不到什么?」作者称两问结合后持续获得明显更好的结果。

一位开发者在Reddit的r/StableDiffusion板块开源了应用sound-and-vision,可一键自动生成音乐及配套音乐视频,完全免费且无付费墙。该工具基于新发布的音乐生成模型YuE2生成歌曲,再使用Minimax H3生成视频,将音乐生成与视频生成流程串联为一体化工具,具体功能与效果可查看原帖链接。
Reddit 用户分享了一支名为《The Jitterbug Jamboree》的超现实风格音乐视频(AI 生成),效果见原帖视频。

一篇流传的长文围绕「GPT-6 Astra」时代人类技能如何保持展开:当模型自己就能构建东西时,你的判断力来自亲手构建的经验,后人很难再以同样方式变强。 作者给出了一份「技能退化数学」: 每月 60 件交付物时,应亲手做其中 40% 以维持手感 超过每月 200 件时,只做评审就足以保持判断力 核心结论:你设的质量关卡(gate)只能和你这个人一样好 被引用的配置指南还提到 Astra 有 1,050,000 token 上下文窗口,但有两道限制:272K token 的价格断崖,以及多数账户的速率限制无法一次调用全窗口。
