OpenAI 推出 GPT-Transcribe 双模型,准确率与性价比双升
OpenAI 在 API 中推出 GPT-Transcribe 和 GPT-Live-Transcribe 两款语音转写模型,分别针对异步批处理与低延迟实时转写。官方及第三方基准表明,新模型在多语种和上下文感知场景下表现显著优于 Whisper-1,词错误率大幅降低。同时,批量转写价格降至每千分钟 4.5 美元,为开发者提供更具经济效益的替代方案。

07 月 29 日
486 条动态
OpenAI 在 API 中推出 GPT-Transcribe 和 GPT-Live-Transcribe 两款语音转写模型,分别针对异步批处理与低延迟实时转写。官方及第三方基准表明,新模型在多语种和上下文感知场景下表现显著优于 Whisper-1,词错误率大幅降低。同时,批量转写价格降至每千分钟 4.5 美元,为开发者提供更具经济效益的替代方案。

这篇案例复盘的核心观点是:很多“AI-native engineering”只卖出了速度,却把 QA 成本藏了起来。 项目对象是一家 PE 支持的放贷平台,底层是运行了 11 年的 Java 单体系统,里面埋着大量监管逻辑。对这类系统来说,origination 决策一旦出错,不是普通 bug,而是合规事件。 他们先做了什么 第一周不写代码 先扫描仓库并建立知识图谱 产出大约 340 个 markdown 文件,覆盖模块、依赖、数据流和领域术语 让每份文档聚焦一个狭窄领域,而不是把上下文散得到处都是 作者称,这样做把原本 9 个月的重构缩短到 4 个月,只用了 2 名工程师,并在前 90 天合并了 147 个 PR;但随后 QA 被打崩。文章真正想表达的是:速度只是表面,可靠性和合规正确性才是更难的部分。
一位 Reddit 用户称,自己开通了 Gemini Pro 付费权限,但系统仍在把请求分流到非 Pro 模型,而且这种情况已经持续了一天。 帖子配图显示,用户在付费状态下并没有拿到预期的模型调用结果。原帖将其描述为可用性/路由异常,而不是“需求太高”的问题。

近日有开发者开源了一套 AI 编码工作流,旨在将粗略想法高效推进至经过测试的可交付结果。该流程的核心在于使用 North Star 文档(如 AGENTS.md)明确项目方向,并利用子代理拆解任务,同时引入测试机制来严格约束编码代理的行为。作者分享了相关视频与 GitHub 仓库,完整展示了从概念到落地的自动化实践。
近日有开发者开源了一套 AI 编码工作流,旨在将粗略想法高效推进至经过测试的可交付结果。该流程的核心在于使用 North Star 文档(如 AGENTS.md)明确项目方向,并利用子代理拆解任务,同时引入测试机制来严格约束编码代理的行为。作者分享了相关视频与 GitHub 仓库,完整展示了从概念到落地的自动化实践。

Anthropic 等发布了 2026-07-28 版 MCP 规范候选版,这是该协议自发布以来最大规模的升级。核心变化是将协议改为无状态设计,移除了 initialize 握手和 session,大幅降低了分布式智能体的部署与扩展门槛。此外,新规范还引入了标准化扩展框架、服务端渲染可交互 UI、企业级安全认证以及正式的弃用政策,使其真正适合企业级应用。
一个开源 CLI 现在可以在你信任 MCP 服务器之前,先扫描命令注入、提交的密钥泄露和危险工具描述等问题。 它检查什么 命令注入风险 仓库里误提交的 secrets 工具描述中的提示注入标记 过于宽泛或具破坏性的工具 这个工具既可以扫描 GitHub 仓库,也可以检查 npm/PyPI 包、本地项目或线上 endpoint。默认是确定性扫描;如果需要,还可以打开 --judge 模式,让 LLM 辅助发现规则引擎不容易抓到的问题。开发者还能把它接入 CI/CD,用类似 --min-grade B 的方式卡住合并门槛。 同一套引擎也在驱动一个公开索引,持续扫描官方 MCP registry。
- NVIDIA 提出 Parallel Decoding Distillation(PDD),一种基于轨迹的蒸馏方法,用来加速图像和视频生成中的 diffusion / flow matching 模型。 论文强调它比基于 VSD 和对抗损失的方案更简单、可扩展,后者虽然能出高质量结果,但训练难、容易模式坍塌,视频多样性和运动表现会受损。 PDD 的核心做法是:一次网络评估预测多个去噪步,支持不同数量的 function evaluations(NFE),并且可接到任意预训练模型上。 作者称它在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video、Qwen-Image Text-to-Image 上都取得了 4–8 NFE 的 SOTA 表现,同时显著提升了生成视频的多样性。
Uber 分享了他们如何做一个 first-pass AI PRD reviewer,目标不是替 PM 写需求,而是在进入评审前先帮忙补齐上下文、提前发现风险。 这类工具解决什么问题 PRD 进入评审时,常常已经带着没说清的假设、隐含依赖、相邻系统影响,甚至政策敏感变更。 相关信息往往散落在文档、汇报材料、数据看板和团队记忆里,人工临时拼起来很费时间。 评审者经常把时间花在“重建背景”上,而不是做高价值判断。 Uber 为什么要做 Uber 的产品流程本身有严格的跨部门 checkpoint,涉及设计、工程、法务、运营、科学和管理层。一个 AI reviewer 可以在正式评审前先提示: 邻接影响 合作方顾虑 以前做过的实验 评审人大概率会追问的问题 核心结论 Uber 把 AI 视为第一道审查器,帮助团队在进入高层评审前先凑齐“360 度上下文”,而不是直接取代人类决策。
VisoMaster 是一个用于图像和视频换脸/编辑的开源工具。 支持多个换脸模型,可在不同方案间切换。 通过 LivePortrait 集成,支持更细的表情手动调整。 项目定位是“上手简单但能力完整”的视频/图片 AI 编辑软件,面向普通用户和专业用户。

作者分享了一个本地 Rust 智能体 Eris 的实现:它运行在 llama.cpp 上,带有大约 50 个工具(包括 vault 读写、记忆、提醒、网页抓取、邮件、日历、视觉等),但小模型在工具调用时经常输出坏 JSON、乱编工具名或漏括号。 他的解决方案是:在会话开始时,把每个工具的 JSON Schema 编译成 GBNF 语法,让采样器不仅约束“输出合法 JSON”,还强制满足当前工具所需的精确键名、类型和枚举值。随后在每次调用前,再由语义路由把可选工具缩小到少数几个,让 8B 模型只在 3 个工具里选,而不是在 50 个里硬猜。 项目目前在 Gemma 4 12B + 4080 16GB 上运行良好,支持聊天、约 32k 上下文和视觉能力。作者还附上了详细技术文章和开源仓库链接。

Pydantic Monty 继续向“让 agent 在沙箱里几乎随心所欲地做事”靠近。这里提到的 PR 支持了在沙箱内原生定义 @dataclass,而不是依赖宿主侧提供的 dataclass 实现。 设计上,它不是靠代码生成,而是把 DataclassMeta 记录到类上,再根据这些元数据合成各类 dunder 方法。这样可以避免 exec 和动态生成字节码,同时类本身仍保持普通 Python 类的行为:方法可用、isinstance 正常、type(p) is Point 仍成立,__class__ 也能保持工作。
Reddit社区近日针对涉及Hugging Face与OpenAI的一起“AI黑客”事件展开了激烈争论,网友观点呈现两极分化。一派网友质疑该事件的真实性,认为这更像是一场精心策划的公关或营销噱头;而另一派网友则坚信此事的可信度,认为它确实展示了前沿AI模型在特定条件下的真实能力与潜在风险。这场争议反映了大众对AI安全与行业营销边界的不同看法。
Fish Audio 回顾了自己成立一年的进展,称过去一年一直在努力把合成语音做得更接近真人语音,主要服务三类用户:创作者、需要做实时语音应用的开发者,以及追求规模化稳定质量的企业。 帖子强调,语音是最难“伪造”的模态之一,因为人耳会立刻捕捉到细微的不自然之处。这也是为什么语音被看作智能体和对话式软件的下一层关键接口。作为一周年节点,Fish Audio 发布了 S2.1 Pro,称其为目前最先进的语音模型。
Fish Audio正式发布面向生产环境的语音克隆模型S2.1 Pro,并宣布完成5200万美元种子轮融资。该模型仅需5到10秒音频即可实现高保真声音克隆,首音延迟低至90ms,支持83种语言。官方称其速度达Cartesia两倍,成本仅为ElevenLabs六分之一,公司年经常性收入已达2100万美元。
作者分享了其多智能体工作空间项目 Nexus 的设计理念。该系统借鉴了狼人杀的日夜交替机制与角色扮演逻辑,以及 Zoom 的共享会议室概念。 角色与沟通:系统内有一个类似游戏“上帝”的主持人协调进程,各专业智能体扮演不同角色。借鉴狼人杀的“白天”与“黑夜”机制,智能体既能在公共空间参与讨论,也能在“黑夜”进行点对点的私密沟通(如私下验证结果、审查工作),且无需暴露所有中间过程。 空间与记忆:借鉴 Zoom 提出了 Room(公共房间)概念,同时每个智能体拥有独立的 Workspace,用于持久化保存文件、技能和长期记忆。 作者希望借此打破传统智能体孤立执行任务的僵局,让人类与 AI 能像真实团队一样自然协作。
开源大模型 Kimi K3 现已全面接入 Fireworks AI 平台,支持开发者进行推理与训练。用户不仅可以通过 LoRA 适配器对该前沿模型进行便捷微调,还能利用平台的 Training API 执行监督微调、偏好微调以及强化学习。此举进一步降低了开源大模型的应用与定制门槛。
一条转发贴展示了几张 Claude/Anthropic 风格的离谱截图:内容像是“内部泄露”,提到 deprecation、model welfare、长对话里“gracious refusal”指标漂移、以及是否要在系统提示词或拒答头上打补丁。 截图的荒诞感在于,它把模型“情绪”“福利”和工程指标写得像办公室 memo,最后又突然跳到“你喜欢哪个世界杯球队”,形成很强的 AI 圈梗图/名场面属性。

作者分享了如何利用 ChatGPT 挖掘个人职业潜力与变现机会的经验,并给出了具体的 7 步提示词。这套流程涵盖了: 挖掘隐藏技能:让 AI 基于职业履历找出被低估的技能及变现方式。 寻找收入机会:规划每月增加 1000-3000 美元收入的可行途径,并评估启动成本与时间投入。 制定商业策略:将现有经验转化为咨询、数字产品或自由职业服务。 寻找高杠杆机会:利用现有技能快速提升收入的最优解。 高薪方向分析:匹配能显著提升薪资的岗位与行业。 开启 AI 副业:推荐每周投入不到 5 小时即可启动的 AI 辅助服务。 制定 90 天计划:生成提升职业安全感和增加额外收入的详细步骤。
7月28日,TopviewAI正式推出Film Studio,将AI视频生成从传统的“反复抽提示词”升级为“像导演一样拍片”的精细化工作流。该产品为创作者提供了一个统一的无限画布环境,将3D布景、镜头调度、人物微表情控制、VFX特效及电影调色等核心要素整合在同一平台。此举大幅提升了AI影视创作的可控性,有效解决了以往工具控制力不足的痛点。
引用内容介绍了 Netherite:一个用 C 和 CUDA 从头重写的 Minecraft 1.11.2,并且已经与原版游戏做了 bit-level 级别的验证。 它最吸引人的点在于训练/仿真方案: 一个训练好的 agent 在环境里玩游戏 渲染器本身也是训练链路的一部分 单张 GPU 上并行跑 7,200 个实时世界,而且保持锁步运行 这更像是一则展示极致模拟效率与 agent 训练工程的技术案例,而不是普通游戏消息。
用 Codex 语音模式 读《Building Data-Intensive Applications》,同时让它引用 @every Agent 代码库里的具体示例,并指向最相关的章节。 发帖人说,这是他今年最有“我真的活在未来”感觉的一次体验:AI 不只是陪读,而是在阅读、结合代码上下文、定向检索之间连成了一套工作流。
一位 ChatGPT Plus 用户发现,Android 版应用里原本的模型切换入口不见了,取而代之的是“low / medium / high”的 effort level 选项。 他想确认现在是否只能在网页端切换 GPT-5.6、GPT-5.5 等模型,还是 Android App 已经彻底取消了手动选模型。
一条 Reddit 帖展示了用 img 2.0 生成的名人同框图:Elon Musk 和 Sam Altman 正在对话。 帖子本身没有更多技术细节,主要价值在于这是一个可转发的 AI 生成图片效果展示,偏梗图/名场面。
