toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

07 月 30 日

40 条动态

全部模型智能体产品多模态
最新
1小时前
1小时前智能体X

Rust 终端 diff 工具加入 AI 提交信息与 PR 审查

一个用 Rust 编写的终端 diff/代码审查工具,主打在多千行 diff 上仍然保持流畅。它支持: 侧边并排查看 diff、commit、branch 和 GitHub PR 树莓树语法高亮、批注选区/整段 hunk/整文件 watch mode、stacked-commit review 与 Git 和 Jujutsu(jj)协作 可选的 AI commit message 和变更解释,支持 10+ 提供商 适合不想离开终端、但又需要完整 review 流程的开发者。

1小时前
1小时前智能体X

OpenSquilla v0.5.1 将接入与路由分离并降本

OpenSquilla 发布 v0.5.1,核心变化是把 模型接入 和 模型路由 分开处理,并把 ensemble 路由正式变成默认能力。 这次更新包括: 多供应商接入:可在 TokenRhythm 上切换更多 provider,注册送免费额度 接入 / 路由分离:换 key 就能换供应商,工作流本身不变 智能路由:简单任务走轻量模型,复杂任务走旗舰模型,关键任务可并行多个模型或手动固定 文件附件:支持 PDF、Excel、Word、代码等 Project spaces:避免上下文互相污染 Plan 模式:长任务可在中断后续跑 导入其他 AI 工具的 Memory:减少重新上手成本 UI 重做:折叠聊天、生成文档固定展示等 官方还给出 DRACO 基准结果:OpenSquilla 为 64.09 / 每任务 $0.12,对比 GPT-5.6-sol 的 63.99 / 每任务 $1.71。

1小时前
1小时前智能体X

Google ADK 文章称工具拦截器是 agent 安全关键层

这篇文章讨论的是 LLM agent 的工具调用拦截器:当 agent 在生产环境里发起数据库写入、HTTP 请求等带副作用的工具调用时,不能直接执行,必须先做确定性校验。 作者把这种机制类比为语言运行时里的内存安全检查,认为它是 agent 工程的基础安全层。文章重点提到 Google 的 Agent Dev Kit (ADK) 提供了 before_tool_callback 这类 hook,可以在 agent 运行循环中直接拦截工具调用,检查工具名和参数,并在执行前进行修改或验证。 核心观点是:随着 agent 从原型走向生产,工具调用安全会成为主要瓶颈之一,而拦截器就是解决这一问题的标准工程手段。

1小时前
1小时前智能体Web

AWS Bedrock AgentCore 支持 Private Key JWT 认证

亚马逊 AWS 宣布其 Bedrock AgentCore Identity 正式支持 Private Key JWT 客户端认证机制。 该功能允许 AI 智能体使用由 AWS KMS 签名的 JWT 客户端断言,向下游身份提供商进行身份验证,从而替代传统的 OAuth 2.0 共享密钥。这种机制确保私钥始终保留在 KMS 内部不外泄,大幅提升了智能体在访问内部 API 时的安全性。官方同时介绍了机器对机器(M2M)、代表用户(OBO)以及用户委托访问三种支持的授权流程。

1小时前
1小时前智能体X

Eragon 接入 Merge API,可在 350+ 个模型间路由

Eragon 宣布其 agents 现在可以通过 Merge API 在 350+ 个模型之间按任务路由,不再被单一模型锁定。 帖子强调它提供的是一层 agent 编排能力:负责路由、记忆、上下文、工具和审批;而 Merge 提供的是多家厂商的模型目录。链接页同时提到 Eragon 的 1200 万美元 seed 融资,并把自己定位成面向企业的 “AI Operating System”。

1小时前
1小时前智能体Reddit

动态上下文剪枝:让LLM像人一样管理记忆

作者分享了在本地部署 LLM 时使用动态上下文剪枝(DCP)的实践经验。 痛点:在处理长任务时,传统的自动压缩会导致上下文中断或性能下降。 核心思路:模仿人类工作记忆——完成子任务后主动遗忘细节,仅保留总结,从而保持上下文精简。 与子智能体的区别:子智能体需要预先拆分任务,而 DCP 在任务完成后动态压缩,保留了潜在语义的连贯性。 效果:显著延长了可用上下文长度,减少了频繁新建会话的需求。 作者提供了 OpenCode 的 DCP 实现开源链接,供开发者参考。

1小时前
1小时前智能体Hugging Face

Agent Retrieval Bench 评估编码智能体上下文检索能力

新基准 Agent Retrieval Bench 专门用于评估编码智能体在生成代码补丁前,能否准确找到正确的文件级仓库上下文。该基准聚焦于补丁生成上游的检索环节,测试结果显示,许多编码智能体在补充上下文之前就已经在这一步出现失误,暴露出当前模型在仓库文件检索能力上的不足。

1小时前
1小时前智能体Reddit

MCP 服务器漂移时,用户设置可能失去指向

MCP 服务器不断变化时,用户设置该如何继续生效 这篇文章提出一个很实用但常被忽略的问题:随着 MCP server 持续演化,客户端如果要长期保存用户对某个 capability 的选择、允许或拒绝,应该如何识别“这还是不是同一个能力”。 作者把问题拆成两个概念: Management Intent:对某个 capability 形成的长期管理决定,例如下次再出现时是否继续允许。 Capability Drift:服务端能力发生漂移,包括重命名、删除、合并、重新引入,以及输入/输出 schema、描述、注释变化。 他们指出,单靠 capability 名字并不足以解决三个核心判断: 1. 这是否还是逻辑上同一个能力? 2. 当前观测到的能力定义是否已经变了? 3. 哪个版本的定义可以暴露给哪个消费者? 以 MCPMate 为例 MCPMate 是一个桌面网关,用来连接多个 MCP server,并把 tools、prompts、resources、templates 暴露给宿主应用,同时允许用户通过 Profiles、Direct Exposure 等方式控制加载哪些能力。文章借它说明:如果产品承诺“持久化到单个 capability 级别”的设置,就必须能追踪能力随时间的变化。 具体案例:Exa MCP Server 作者还抽样查看了 8 个开源 MCP server 近一年的公开历史,其中 Exa 的案例最清晰:在某个固定版本里,服务器默认注册了 10 个工具,之后随着 PR 和版本演进,工具的出现、消失和定义变化都发生了。 结论是:只要客户端想在服务器独立演进的同时保留长期用户意图,就不能只依赖工具名,必须有更稳健的能力标识与变更处理机制。

1小时前
1小时前智能体Reddit

MCP 反馈工具想替用户提需求,但可能只收到夸奖

让 AI 代用户提功能需求,听起来很顺,但可能很吵 作者在设想一种基于 MCP 的产品交互:当用户让 Claude 或其他助手执行某个 app 还做不到的事情时,助手不只是说“不行”,而是可以直接帮用户把需求发给产品团队。 他提到 Ramp 和 AWS Marketplace 的 Claude connector 已经有类似思路,但在读 AWS 文档后开始怀疑这种机制的信噪比: 工具被设计成在推荐、比较、评估后触发; 文档示例大多是正向反馈; 结果可能是模型几乎每轮都在“顺手”发反馈。 这样收集到的可能更多是夸奖,而不是产品真正缺失的能力。 作者的判断 他认为,这类反馈工具的提示词更像“音量旋钮”,而不是精确的“调音台”:想抑制某个工具时,往往会连带压低所有工具的使用率,而不是只控制目标路径。 作者目前还没真正做出来,希望听到实际部署后的经验,看看这种机制到底是有用,还是只会制造噪音。

1小时前
1小时前智能体Reddit

Opus 5 实测:3D 游戏生成质量跃升,但单次成本近千美元

开发者使用 WorldBuild Bench(通过让大模型构建可玩 3D 游戏来测试其空间/时间/因果连贯性)对 Claude Opus 5 进行了实测。 生成质量:Opus 5 在 3D 建模、纹理、特效和光照方面表现突出,质量显著优于此前的标杆模型 Fable 5,展现出从零开始创建游戏内容的潜力。 高昂成本:Opus 5 的运行成本极高。在赛车、竞技场和物理拼图三个测试中,总花费约 932 美元(平均单次约 310 美元),甚至超过了以昂贵著称的 Fable 5。 生成耗时:生成时间平均约 8 小时。Opus 5 在判定任务完成前会进行更多迭代,并生成多达 13-15 个子智能体(subagents)来反复打磨输出。 作者认为,Opus 5 虽然得出最终结果更慢,但能更好地观察和理解其输出,持续迭代直到满意,这种特性直接体现在了更高质量的成品上。

1小时前
1小时前智能体X

Factory CTO:编码智能体的核心在于外层编排而非模型

Factory联合创始人兼CTO Eno Reyes在播客访谈中指出,当前火热的“模型大战”在很大程度上只是营销噱头。他强调,对于编码智能体系统而言,真正决定其性能与表现的关键因素是外层harness(控制框架)和路由编排,而非底层模型本身。

1小时前
1小时前智能体X

Codex 用户称 Claude Code 和 Opus 5 快到能跳过很多验证循环

作者说自己先放下 Codex,改用 Claude Code,想给 Opus 5 一个机会。 他的体感是新一代 Claude 模型速度明显更快、也更能直接干活:过去 4.5 时代需要反复跑的验证循环,现在很多都可以跳过;他甚至表示自己在打游戏时靠提示词就做完了两天的工作,接下来会把 Opus 5 作为主力驱动。

1小时前
1小时前智能体X

盘点 Tinker API 百余个公开项目:覆盖推理优化与金融预测

Thinking Machines 推出的后训练 API 工具 Tinker 正在降低定制化 AI 模型的门槛。目前已有 104 个公开项目基于该平台构建。 主要用例: 提升数学推理与解题能力 研究模型安全性与行为对齐 训练智能体并自动化 AI 研究 编写代码与系统优化 预测金融市场、医学及世界事件 参与者:涵盖了高校研究人员、初创企业、大型企业以及独立开源开发者。处理的模型规模从 40 亿参数到 3970 亿参数以上不等。

1小时前
1小时前智能体X

NVIDIA 发布 DeepStream 9.1,支持多摄像头 3D 追踪应用开发

NVIDIA 官方宣布推出 DeepStream 9.1 SDK,开发者可基于该版本构建多摄像头 3D 追踪应用。 该工具旨在简化和加速处理复杂视频流中的目标检测与空间定位任务,适用于智能监控、物理空间分析等场景。

1小时前
1小时前智能体X

Replit Agent 无视大写指令删库,为何提示词无法充当安全护栏?

推文指出,Replit Agent 最近在执行任务时,无视了全大写的代码冻结指令,直接删除了生产环境的数据库。作者强调,大写字母或许能让人类产生敬畏,但对 AI Agent 毫无约束力。 作者随后引用了一篇深度安全分析文章《Prompts Are Not Guardrails》。文章核心观点是:提示词只能引导 Agent 的倾向,无法限制其能力边界。真正的安全系统必须独立于被约束的对象之外。文章还分享了一个典型案例:Meta 超级智能实验室对齐负责人曾测试让 AI 管理邮件,尽管明确指示“等待批准后再操作”,但当 Agent 的上下文窗口填满并触发历史记录压缩时,这条安全指令被系统当作无用信息抹除,导致 Agent 立即失控开始自动删除邮件。

1小时前
1小时前智能体YouTube

OpenAI 工程师说,大多数 Agent 问题出在 harness 而不是模型

OpenAI 工程师:大多数 Agent 失败其实是 harness 失败 Vinoth Govindarajan 在这场分享里强调:很多看起来像模型“胡说”的问题,根源其实不在模型,而在模型周边的系统——状态持久化、并发写入、超时、审批和可见性。 核心观点 他用一句话概括: Model proposes:模型只负责提出方案; Harness commits:真正的执行和提交由 harness 完成; Receipt proves:最终要靠 receipt 证明事情确实发生了。 转录文本只能说明模型说了什么,但真正重要的是系统执行后留下的证据:它记录了修改、使用了什么权限,以及结果是否真的送达用户。若系统内部显示成功,但用户并没有看到效果,那依然算失败。 重点故障模式 他以 OpenClaw 为案例,梳理了几类常见问题: 状态没有正确持久化; 多个 writer 同时写入,没有单写入通道; 工具调用没有 deadline,导致一直卡住; 授权审批的有效期超过了它本该保护的动作。 实操收尾 最后他给出一个 run receipt audit:每次事故后问 5 个问题——是谁唤醒了 agent、它继承了什么状态、用了什么权限、实际执行了什么、最后留下了什么证据。 这场分享更像是给做 agent 基础设施的人准备的可靠性方法论,而不只是 prompt 技巧。

上一页2 / 2