toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 29 日

401 条动态

全部模型智能体产品多模态
最新
1小时前
1小时前智能体Reddit

Claude Code 32k 提示词让人更偏爱 1k 的 agent harness

- 作者抱怨 Claude Code 的系统提示词已经膨胀到 32k tokens,直接拉高成本、延迟,并拖累性能。 他更认同 Pi 这类极简 coding agent harness:只保留 read / write / edit / bash 四个工具,再加上基础 agent loop。 他的观点是,权限、MCP 客户端、subagents 等功能不该不断塞进核心提示词里,而应该通过 插件化 扩展,避免每次版本更新都把现有环境越弄越重。 帖子还提到 Claude Code 和 Codex 最近都把系统提示词缩短了约 60%,但作者认为“靠单一接口解决一切”的架构问题依然存在。 这是一条很典型的编码 agent 工程实践讨论,重点在于如何在功能和可控性之间做取舍。

1小时前
1小时前智能体Reddit

多渠道 AI 回复栈被 Twilio 每月 120 美元短信费卡住

作者在搭建一个多租户应用,要做 Email、SMS 和外呼语音 的自动 AI 回复。当前试出来的组合是: Mailgun 负责邮件 Twilio 负责短信 Vapi.ai 负责电话外呼 OpenAI 作为模型层 他的原型已经能跑通邮件和短信的自动回复,但 Twilio 的短信号段订阅费大约要 120 美元/月,在低频场景下很不划算。相较之下,Vapi 的接入体验不错,也能直接用 Twilio 的号码发起电话。 帖子核心问题是:有没有更好的、provider-agnostic 的架构,既能保持可替换性,又能避开固定短信订阅成本。

1小时前
1小时前智能体X

Hugging Face 开源实时语音对话管线

近日,Hugging Face 开源了一套名为 Speech to Speech 的模块化实时语音对话管线。该方案支持在本地 GPU 上运行,其整体处理流程涵盖语音活动检测、语音识别等模块。此举旨在为开发者提供一个可替代 OpenAI Realtime voice API 的本地化语音交互解决方案,进一步降低了实时语音技术的部署门槛。

1小时前
1小时前智能体Reddit

AI 爱好者在讨论怎么搭一个私有个人 AI 操作系统

作者想了解现实里大家是怎么搭建个人 AI operating system 的,尤其是面向个人执行助理场景:日程、任务、目标追踪、日记和报告生成。 他现在已经有一个能用的系统,但几乎完全依赖前沿大模型,带来成本、token 限制和隐私问题。帖子里提到几种思路: 用 本地 LLM 作为路由器,把信息分到不同隐私层级 先生成“净化过”的文档,再把非敏感上下文送到云端推理 给不同 agent 做严格的访问控制和沙盒隔离 尽量减少敏感信息经过 Slack、Telegram 之类云应用 这不是泛泛而谈的 LLM 使用帖,而是在问:真实可落地的个人 agent 架构应该怎么分层、怎么授权、怎么做硬约束。

1小时前
1小时前产品X

用自然语言重塑网页:AI Agent 应用 Mirage 实测

Mirage 是一款主打“个性化互联网”的早期访问产品。它本质上是一个 AI Agent,能够根据用户的自然语言指令,实时重塑任意网站的视觉外观、布局和交互流程。 产品展示了丰富的应用场景,例如: YouTube:永久隐藏 Shorts,关闭推荐流,仅显示订阅和稍后观看,或隐藏侧边栏和评论。 社交媒体:将 Twitter 强制设为时间线排序并放大字体,精简 LinkedIn 动态以防止沉迷,自动折叠 Reddit 评论区。 生产力工具:让 Gmail 支持键盘优先操作(如 j/k 移动、e 归档),隐藏 Notion 侧边栏,或将 GitHub PR 列表转换为看板视图。 这款工具旨在打破平台默认的注意力劫持设计,将网页的控制权交还给用户。

1小时前
1小时前模型X

用户吐槽 Claude 写作越来越像 AI 腔,基础概念都难读了

作者抱怨 Claude 的写作越来越像“AI 腔”,连一些最基础的概念都开始变得难读、难懂。 这不是一篇完整测评,更像是一句模型使用体验吐槽,但它点出了一个很多人都在讨论的问题:模型输出是否正在变得过度模板化。

1小时前
1小时前智能体X

Codex 旧金山社区 meetup 本周三举行,前 50 名送 100 美元 credits

本周三(7 月 29 日)下午 5–7 点,将在旧金山 Corgi cafe 举办一场 Codex 社区 meetup,由 @iamlulu_zh 和 @VivianCaiIAm 共同参与组织。 活动面向 founder、builder 和 operator,前 50 名报名者可获得抹茶、100 美元 Codex credits,以及巴黎贝甜的点心。

1小时前
1小时前多模态Hugging Face

MODUS 用单个解码器模型统一任意模态互预测

MODUS 提出了一种统一的 decoder-only any-to-any 多模态建模框架:同一个模型可以在任意模态组合之间做预测,把“任意模态作为输入、任意模态作为输出”这件事统一起来。 现有不少 any-to-any 方法依赖从头训练的 encoder-decoder 或 diffusion 架构;MODUS 试图直接复用强大的预训练 decoder-only 模型作为先验。 它把不同模态放在对称位置,不需要模态专属的 head、loss 或任务管线。 作者举了几个用途:例如通过中间模态做链式生成,或者用另一种模态来对生成结果做跨模态自验证。 论文称该方法在多个基准上表现出较强的即插即用能力,并且能和专用/多任务基线竞争。 项目材料已经开源。

1小时前
1小时前多模态Reddit

ComfyUI 教程演示 KREA 2 身份编辑低显存工作流

这条 Reddit 分享了一个基于 ComfyUI + KREA 2 Identity Edit v1.2 的实战教程,重点是低显存下的身份保持式图像编辑。 这个工作流强调在修改 姿势、表情、风格 时,尽量保持人物面部身份一致。 还覆盖了 换脸、虚拟试穿、局部重绘(inpainting) 和 扩图(outpainting)。 作者表示流程比较简单:载入参考图、输入编辑提示词,然后直接运行工作流。 原帖同时附了工作流文章链接和 YouTube 教程视频。

2小时前
2小时前产品X

纳米 Work 实测串联三家模型,剪出 32 秒宣传片

- 这篇长文主要在实测 纳米 Work,并顺带讨论作者自己的开源产品 FanBox。 作者认为,面向白领/企业的 AI 工作产品之所以最近开始成立,是因为两件事同时发生:coding 与 agent 能力快速进化,以及围绕知识工作流程的 skill 生态 变得成熟。 实测里,纳米 Work 被用来完成一个真实任务:它串联了 三家大模型/服务,最终剪出一条 32 秒宣传片。 文章还指出一个很现实的问题:很多 AI 产品对外物料仍是 开发者语言,而大多数目标用户并不写代码,所以产品定位与表达方式和技术本身同样重要。

2小时前
2小时前智能体X

OpenCode 梗图把 1,485 行功能改动吐槽成“slop cop”

一张 OpenCode Agent 的梗图在拿代码改动开玩笑:它给某个“adaptive session tabs”提交发出“slop cop citation”,指控这一个功能改动就带来了 19 个文件、1,485 行新增,还包括一套 235 行动画框架 和 207 行自定义 pulse renderer。 梗图后半段又用“必须整改”的口吻吐槽:要把底层抽象、标签页行为和视觉润色拆成可评审单元,暂停所谓的 megadiff privileges,未来做标签页大改必须加边界、检查点和文档。

2小时前
2小时前多模态Reddit

GPT Image 2 九宫格分镜把喝茶到机甲大战压成一张图

- 这条 Reddit 展示了一个用 GPT Image 2 做出的 3×3 单图分镜:同一位飞行员从早晨喝茶,逐步走向机甲大战。 作者强调关键不是“多张图拼接”,而是先设定 严格的九宫格结构,让开头、中段、结尾按顺序推进,九格读起来像一个完整动作弧线。 通过统一的 3D CG anime 风格、角色外观、服装和光照,整张图保持了一致性,变化只体现在剧情推进上。 这被作者视为一种可复用模板:用一张图压缩完整的动作叙事。

2小时前
2小时前多模态X

改一段提示词,图像就变成了更浓的沙特文化风

这条帖子在分享一个强化沙特本土文化感的图像提示词,并给出了生成结果。 被引用的原始 prompt 先是“埃及女人坐在尼罗河岸边”的构图,但作者说明他们修改了提示词,以更好呈现“authentic Saudi heritage”与传统细节。 配图展示的是一组带有传统阿拉伯服饰、庭院建筑、咖啡器具和夕阳色调的风格化生成图,重点在于通过 prompt 微调,明显改变图像的文化指向与视觉效果。

2小时前
2小时前智能体X热度 4.8

OpenAI重置Codex额度并调查GPT-5.6 Sol异常

OpenAI 近期为 ChatGPT Work 和 Codex 付费用户重置了使用限额,并着手调查 GPT-5.6 Sol 模型消耗过快的问题。官方澄清并非下调订阅额度,称修复后模型 token 效率可提升约 18%。排查期间,5 小时限额机制暂时处于暂停状态。

2小时前
2小时前智能体X

Opus 5 把《蜘蛛侠》重做成了“spooderman”梗版

有人让 Opus 5 用编码能力重做《Spider-Man PS4》,结果做出来的是一个叫 “spooderman” 的搞笑版本。 这条帖子的重点不是严肃技术结论,而是模型把游戏改造成梗图式作品的整活效果,属于很适合转发的 AI 圈趣事。

2小时前
2小时前智能体X

图工程为何突然流行:节点、边、状态与循环

这条帖子用 6 个术语解释了为什么 graph engineering 在 Agent 工作流里突然变热:不是循环没用了,而是循环被放进了图结构里。 Node(节点):图中的一个步骤,可以是一次工具调用、一个 agent,甚至一个循环。 Edge / Route(边/路由):节点之间的路径;一个节点可以分叉到多个路径。 Conditional Edge(条件边):读取当前 state 后决定下一步,质量门控和安全检查通常放在这里。 State Machine(状态机):整个流程的形状,每个节点都代表一种状态。 Shared State(共享状态):在整张图里流转的同一个对象,所有节点都读写它。 Agent Loops(Agent 循环):agent 自主执行、评估、再重复的闭环。 作者的结论是:循环没有死,只是搬进了图里。适合自治的部分用 loop,需要可控和可审计的部分用 graph 包起来。

2小时前
2小时前产品X

RCS流量暴增1298%,Infobip靠1.4万AI代理注册筑起壁垒

独立分析指出,Infobip 在 2026 年上半年实现了美国 RCS(富通信服务)流量 1298% 的暴增。其真正的商业护城河并非 API 本身,而是同期完成的 1.4 万次 RCS AI 代理运营商注册审批。 文章认为,这种大规模的运营商审批工作量,比任何路线图上的功能都更能拉开消息服务商的差距。随着苹果在 iOS 18.1 中支持 RCS,美国市场正从试点阶段迅速迈向规模化生产应用。

2小时前
2小时前多模态X

Twelve Labs 发布面向视频检索、记忆和智能体的技术栈

Twelve Labs 认为,视频不能简单当成“逐帧图片”或“带时间戳的转录文本”,因为运动、因果和时间推进本身就是信息。James Le 在 Vector Space Day SF 上指出,视频系统常见三类失败:上下文错误、记忆错误、推理错误;并介绍了对应的技术栈:Marengo 负责视频检索,Pegasus 负责把检索到的片段转成结构化答案,Jockey 作为面向视频语料工作流的 agentic framework 和记忆层,底层由 Qdrant 提供存储与检索。

2小时前
2小时前产品Reddit

GPT 玩 DnD 很强,但还是会忘记数值和道具

楼主分享了自己用 GPT 玩 DnD 的体验:它在角色扮演、人物性格、剧情反转、笑点和即兴发挥上表现很好,但仍会忘记角色数值、道具和较早前谈过的内容。 他在问有没有办法让模型“记住一切”,并提出一个思路:自己维护一份项目笔记,把所有旁注和状态上传、持续更新,以此补足记忆缺口。

2小时前
2小时前产品X

NewMax v1.1.9 增加结构化更新页和无头浏览器运行

NewMax 发布 v1.1.9,重点是把更新内容做成了更清晰的结构化展示,同时补了一批实际可感知的产品细节。 新功能包括:豆包搜索(缩短搜索摘要、避免占用过多上下文)、版本更新入口(用弹窗展示更新说明)、浏览器无头运行(后端可直接跑,无需验证码或登录等人工操作)、工作区创建(可直接选标签图标)、以及新的 Claude 配色主题。 Bug 修复覆盖:NewMax Gateway 模型请求稳定性、原生搜索进度提示、对话保留 Skill、设置弹窗关闭问题、网络代理直连、以及公众号图片复制失败等。

2小时前
2小时前多模态X

同事做了个把歌曲自动变沙雕 MV 的 AI skill

- 同事做了一个“空耳沙雕 skill”:输入一段音乐,系统会自动生成并剪辑成一支搞笑 MV。 这更像是一个轻量的 AI 创意 demo,重点在于好玩、离谱和可转发,而不是严肃产品发布。

2小时前
2小时前多模态X

Fish Audio发布S2.1 Pro语音模型并获5200万美元融资

Fish Audio正式发布面向生产环境的语音克隆模型S2.1 Pro,并宣布完成5200万美元种子轮融资。该模型仅需5至10秒音频即可高保真克隆声音,首音延迟低至90ms,支持83种语言。官方数据显示其速度达Cartesia两倍,成本仅为ElevenLabs六分之一,公司年经常性收入已达2100万美元。

2小时前
2小时前多模态Reddit

开发者用 Claude Opus 5 耗时9小时做出WebGPU雪地demo

近日一位 Reddit 用户使用 Claude Opus 5(即 Claude Code)耗时约 9 小时,消耗近 400 万 token,成功开发出一款名为 SNOWFLOW 的浏览器端 WebGPU 雪地仿真 demo。该项目从架构规划到 Babylon.js 与 WGSL 实现均由 AI 完成。该 demo 在单标签页内实现了接近 AAA 级别的画面效果,包含数百万雪粒子、布料物理及可交互的魔法特效,充分展现了 AI 在复杂图形学编程上的巨大潜力。

2小时前
2小时前多模态X

Magnific 把 AI 套件原生接进 Photoshop 和 Premiere

Magnific 宣布把完整套件原生接入多个主流创意编辑器,让用户可以直接在熟悉的软件里跑它的 AI 工作流。 视频侧覆盖 After Effects、Premiere Pro、DaVinci Resolve、Final Cut Pro。 设计侧覆盖 Photoshop、Illustrator、InDesign、Figma。 官方强调同一个账号和 credits 可以跨编辑器复用,用户只需一次登录。 文案里还提到支持 Microsoft Office,整体定位更像是一层横跨创意软件与办公软件的 AI 工作流层。

上一页2 / 17下一页
每日速览

今天发生了什么

07.29

今日 AI 圈的主线是治理议题全面升温:OpenAI 千余名前沿员工联署公开信要求政府介入控制 AI 发展节奏,Anthropic CEO Dario Amodei 同步澄清开源立场以回应市场误读,两家头部公司还联手游说华盛顿将前沿模型规则覆盖至竞争对手。技术层面,Kimi K3 架构细节公开——扩至 2.8T 参数并彻底放弃 RoPE——并在 Code Arena 全栈榜登顶;Anthropic 公布 Claude 协助发现 HAWK 和降轮 AES 密码算法新弱点,也引发密码学界广泛讨论。

  1. 01OpenAI 千名员工呼吁政府介入 AI 步伐
  2. 02Anthropic CEO 澄清从未主张封禁开源权重
  3. 03研究称 Amazon 书库逾半含 AI 垃圾文本
  4. 04Anthropic:Claude 发现 HAWK 和降轮 AES 新弱点
阅读完整日报