toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,694个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策
Newswire

AI 快讯

09 月 13 日

189 条动态

全部模型智能体产品多模态
最新
10小时前
10小时前智能体X

Astra 实战经验帖:别混用模型,给预算上限,警惕 2000 行 CSS

作者总结使用 Astra 等 agent 的一手经验: Astra 擅长 computer use,但会用浏览器读文档而不是 CLI;发现后往 AGENTS.md 加一行约束,或检查是否有 skill 改变了行为。 用 GPT-6 Pro 在 ChatGPT 里做头脑风暴和交接 prompt;普通 GPT 对话不计入 Codex 用量,但 GPT Work 计入。 加 skill 前先让它「别只会附和我,判断我的想法是真有帮助还是增加工作量」。 不要为省钱混用便宜模型:一次运行中 Astra 直接丢弃 DeepSeek 的 3D 结果重做且未事先告知;便宜 worker 做完后强模型可能重做一遍,更多路由不等于更省更好。 当前搭配:Sol 负责实现(精选少量 skills),Astra 只当顾问;3D/设计只用 Astra。 Astra 会写出 2000 行不可读 CSS,但效果好——要么接受压缩式代码,要么别用它写代码。 改 UI 时可让 Codex「用 GPT Image 按当前设计系统生成 mockup」先行预览设计方向。 给 Astra 设预算/时间上限,并允许它查询剩余 Codex 用量;可用「有疑问立即停下,我是主设计师」这类约束。

10小时前
10小时前智能体X

阿里开源代码审查工具:确定性流水线+LLM Agent 混合架构

阿里巴巴在 GitHub 开源了 open-code-review 代码审查工具(已获 22.6k star、1.7k fork),号称经过阿里规模实战检验。 核心特点: 混合架构:确定性规则流水线 + LLM Agent 结合,兼顾精准与灵活性 行级精准评论,减少噪音 内置多语言微调规则集:覆盖 NPE、线程安全、XSS、SQL 注入等常见缺陷 兼容 OpenAI 与 Anthropic API,可自由替换模型 提供 VS Code 扩展、Claude 插件与 skills,支持多语言文档

10小时前
10小时前智能体X

别等更大上下文窗口:多智能体横向扩展才是长文本正解

INT21 工程博客 + 网友评论的组合内容: 核心论点:INT21 认为,更大的上下文窗口并不能解决长上下文问题,真正的突破是多智能体编排——把一个千万 token 级的问题拆成一组协同的、各自找证据的小任务。 实践案例:作者一年前尝试让 AI agent 生成 NVIDIA CUTLASS C++ 内核时,整个 CUTLASS 代码库约 500 万 token,而当时最好模型只有 100 万 token 窗口。瓶颈不在代码生成,而在跨仓库找到并保持正确证据。解法是把 100 万 token 模型并行跑多次,每个 agent 研究代码库不同部分,最后合并结论——「上下文装不下时,横向扩展」。 为什么大窗口不等于好上下文:即使几百万 token 塞得进窗口,模型仍要从噪声中分离信号;更大窗口带来更多无关信息、更多中间输出和注意力竞争,多智能体从结构上解决了这个问题。 附带观点:转发者 bingxu_ 认为 Dario(Anthropic CEO)低估了华为与长鑫存储(CXMT)——华为 IC 设计只落后一代,且其光通信积累意味着华为具备独立搭建先进 MoE pod 的全部要素。

10小时前
10小时前智能体X

Ben Lorica 谈自我改进 AI:杠杆在 Harness 而非模型权重

Gradient Flow 作者 Ben Lorica 撰文拆解「自我改进 AI」的三个概念层次:持续学习(经验是否让系统下次更好)、有界自我改进(系统把经验转化为经过测试的持久变更)、以及递归自我改进 RSI(系统改进产生改进的流程本身)——三者并非阶梯关系,可单独存在。核心观点:对大多数应用团队,真正可拥有的杠杆不在模型权重(模型是「租来的」),而在包裹模型的 harness——prompt、上下文、记忆、工具、路由、子代理与工作流。近期的实用图景不是无限制的智能自我提升,而是自动化目前手工完成的改进环节。实操建议:把每次自动化 prompt 或工作流改动当作标准软件部署,独立测试、保留回滚、重大变更需人工签核。

10小时前
10小时前智能体X

Anthropic 上线 11 门免费课程:从 Claude 入门到 MCP 进阶

Anthropic Academy 课程目录更新,共 11 门免费课程: 入门与产品:Claude 101(日常办公)、Claude Code 101(开发工作流)、Claude Platform 101(平台开发)、Introduction to Claude Cowork(任务循环、插件与 skills) 进阶实践:Claude Code in Action(长时自动会话的引导、配置与验证)、Building with the Claude API MCP 系列:从零用 Python 构建 MCP 服务器与客户端(tools/resources/prompts 三大原语),以及 Advanced Topics 高级实现模式 AI 素养:面向普通用户、教育者与学生的 AI Fluency 框架课程 适合想系统上手 Claude 生态(含 Claude Code 与 MCP)的开发者和普通用户。

10小时前
10小时前智能体X

开源 agent 框架 Ax:DSPy 式编程+RLM 智能体,六语言原生库

开发者 dosco 推荐 Ax——一个开源 agent harness,结合 DSPy 风格编程与 RLM agents,提供 TypeScript、Python、Java、C++、Go、Rust 六种语言的原生库。 核心思路:定义输入输出签名(如 review:string sentiment:class)、用示例和评测改进结果、用代码构建基于数据与工具的 agent,一个编译框架覆盖全语言。支持云端与本地模型、经验证的输出,并提供 Claude Code/Cursor 可用的 Ax skills。 被引用的 omar 强调 harness 的重要性:YC 创业者纷纷构建领域专属 harness,因为它是 agentic 时代保持竞争力的关键——产品层面开启新体验面,技术层面沉淀框架与最佳实践。

10小时前
10小时前智能体X

Pydantic 旗下 jiter 发布 x86 SIMD 支持,长字符串解析提速至 7 倍

Pydantic 作者 samuel colvin 宣布 JSON 解析库 jiter 的重大版本发布,核心是 x86 SIMD 支持,长字符串解析性能最高提升 7 倍,另有 tape 复用、arm64 字符串 SIMD、浮点解析等改进。 jiter 是 Python 生态中使用最广的第三方 JSON 库,作为 Pydantic 校验的依赖,也被 Pydantic Monty 和 Logfire(经 datafusion-functions-)使用。作者还分享了工作流经验:对想优化的目标施加严格约束、提供清晰基准,用 CodSpeed 跑基准后交给自动化工具(fable 和 astra)完成优化。

10小时前
10小时前智能体X

开源项目 Hermes Agent 贡献者数突破 3000 人

Teknium 宣布开源项目 Hermes Agent 的贡献者数量已达 3000 人,并感谢所有参与开发的社区成员。该项目通过大规模社区协作持续迭代,被视为开源 agent 生态中社区规模的标杆。Teknium 本人在转发中表示很荣幸成为贡献者之一,乐于与社区一起共同构建 Hermes Agent。

10小时前
10小时前智能体X

Teknium 修复 hermes-agent CLI 粘贴 bug:多行输入不再被拆成多条 steering

Teknium(NousResearch)合并了对 hermes-agent 的一个 CLI 修复:agent 运行中粘贴多行文本(或 IME/语音输入)时曾被当成多条独立的 steering 消息——在不支持 bracketed paste 的环境(如 tmux)下,每个换行都会触发一次 Enter 提交。修复方案在 _tui_handle_enter 中加入 50ms 防抖:距上次缓冲区文本变化 50ms 内的 Enter 被视为换行而非提交。

10小时前
10小时前智能体X

微软官方文档:用声明式 Agent 定制 365 Copilot

Microsoft Learn 发布了 Microsoft 365 Copilot 声明式智能体(Declarative Agents)的官方文档。声明式智能体允许开发者通过提供指令、动作和知识源来定制 Copilot,以适配企业的具体业务场景,例如员工 IT 自助服务、团队入职、客户问题处理等。 关键点: 声明式智能体运行在与 Microsoft 365 Copilot 相同的编排器、基础模型和可信 AI 服务之上,但作用域被限定为特定业务需求 可用于建立一致、个性化的体验并自动化复杂流程 还可以为智能体添加额外能力以扩展功能 文档适合企业开发者了解如何基于 Copilot 平台构建面向组织内部场景的定制智能体。

10小时前
10小时前智能体X

24/7 常驻 Agent 怎么防攻击:Every 公开安全框架

Every 团队公开了一篇保护常驻 AI 智能体的安全指南,基于他们的真实实践。团队构建了名为 Claudie 的 Claude Code 智能体,在一台专用 Mac mini 上 24/7 运行,作为咨询团队的「参谋长」: Claudie 的权限:拥有自己的邮箱和社交媒体账号,可访问 Google Workspace 和带登录态的浏览器,按计划执行任务、运行和编写代码,全公司多人通过 Slack 与她交互 动机:他们刻意先给智能体最大权限,以最快速度摸清能力边界,再据此收紧权限、做安全加固 方法:文章给出一个可泛化的框架,用于评估智能体安全、评估风险,并说明他们为换取更难被利用的系统牺牲了哪些功能 适合正在部署长驻 agent、需要权衡能力与攻击面的开发者参考。

10小时前
10小时前智能体Reddit

Agent 记忆和文档上下文怎么分?Reddit 开发者热议架构

Reddit 上一个关于 agent 架构的长帖讨论:如何区分「agent 记忆」与「可检索的文档上下文」。 作者的核心观点: 稳定用户画像:用普通数据库表 + 显式更新规则,比任何花哨方案都靠谱; 近期任务状态:小的滚动窗口或摘要即可; 文档(合同/PDF/发票/手册):不应压缩成对话摘要反复注入上下文,而应单次处理、源文独立保留、按需检索。 作者自述在开发文档层产品 Claix:抽取 schema 化 JSON 存确定性字段,文档保持可查询,支持跨文档问题。作者也坦诚利益相关,想比较生产环境的架构:文档记忆是并入向量/图记忆系统,还是独立成带权限、保留策略与校验规则的检索服务。

10小时前
10小时前智能体X

向 Codex 发一个特殊 prompt,回复可能让你意外

- 开发者 Daniel Mac 发帖称,把某个特定 prompt 发给 OpenAI 的 Codex,得到的回复「可能会让你惊讶」,并表示这个点子来自访谈节目《Staying Human in the Age of AI》。 帖子未给出具体 prompt 内容(见其附图/视频),更像一个悬念式技巧分享,读者需看原视频获取玩法。

10小时前
10小时前智能体X

Blender MCP + Astra 实拍:AI 自主驱动 3D 建模工作流

开发者 adrianmg 分享用 Blender MCP 与 OpenAI 的 Astra 模型结合进行 3D 创作的演示:通过 MCP 协议让模型直接操控 Blender,展示其在 3D/游戏类任务上的能力。附视频演示。

10小时前
10小时前智能体Reddit

提案变更即失效:为 Agent 审批绑定内容哈希防越权

作者指出,多数 agent 系统把「人工审批」当作授权问题的终点,但审批与执行之间存在漏洞:人类批准的是「向供应商 A 转账 4000 美元」「发布 v7 草稿」「邀请这 12 人」,agent 却可能在执行前修改金额、草稿或名单——动作类型没变,被批准的动作却变了。 作者给出的规则:把审批绑定到具体提案的哈希上,字段包括执行者、目标、内容/金额、来源版本和过期时间。任何关键变更都会使审批失效并重新请求确认。代价是更多的重复审批提示,但能防止「用户批准过一次付款」变成另一笔付款的授权依据。

10小时前
10小时前智能体X

10 个给 AI Agent 加超能力的 GitHub 仓库:浏览器、记忆、GUI 全齐

一份 AI Agent 基础设施仓库清单,聚焦让 agent 获得浏览器、记忆与工具能力的开源构件: Agent-Reach:让 agent 访问 GitHub、Reddit、YouTube、X 等平台 PageIndex:树状 RAG,帮助 agent 推理长文档 Browser Use:让 agent 控制真实浏览器完成网页任务 BrowserGym:用于测试和评估 web agent 的仿真环境 Skyvern:无需脆弱选择器的浏览器工作流自动化 Agent-S:让 agent 理解并操作图形界面 MCP-Agent:轻松对接工具与 MCP server 的 agent 框架 (清单未列全,后续条目在链接中)

10小时前
10小时前智能体X

一条提示词让 Codex 自查并优化 skills 配置

开发者 daniel_mac8 分享了一条「出奇有效」的 Codex 提示词工作流:把 OpenAI Devs 博客上 Eric Provencher 的文章和官方文档喂给 Codex,让它对照文中建议审计自己的 skills 与 AGENTS.md 配置,并自动进行优化,还可适配 GPT-6 Astra。该方法为 Codex 用户提供了一种便捷的配置自查升级途径。

10小时前
10小时前智能体Reddit

check_vitals MCP 工具:给 agent 提供 CrUX 真实性能数据

开发者推出免费 MCP 工具 check_vitals,解决一个常见问题:大多数「检查网站性能」的 agent 只跑一次 Lighthouse 实验室测试,而 Google 实际排名信号来自 Chrome UX Report(CrUX)——28 天滚动窗口内的真实 Chrome 用户数据,两者可能截然不同。 同时返回 CrUX 现场数据与实时 Lighthouse 结果,按 Google 公开阈值评级(LCP < 2.5s、INP < 200ms、CLS < 0.1)。 若站点流量不足、CrUX 尚无数据,工具会明确说明,避免 agent 给出误导性结论。 提供 MCP server 与 REST 接口,免费、无需注册、限 20 请求/分钟。

10小时前
10小时前智能体X

编码 Agent 会自创形式语言,自然语言或成其元语言

作者提出观察与猜想:随着编码 agent 使用工具、skills 并开始发明自己的语言,我们可能看到形式语言与自然语言的融合。形式语言精确但脆弱,自然语言开放灵活,两者间存在连续谱。LLM agent 或将擅长不断向形式化表达靠拢,尤其用于与其他 agent 确定语义;而自然语言可能成为 agent 发明、批评、解释和修改其形式语言的元语言。

11小时前
11小时前智能体X

Uncle Bob 发文质疑 Agent Harness 设计,呼吁重新思考

《Clean Code》作者 Robert C. Martin(Uncle Bob)发布新一期「Morning Bathrobe Rant」,主题为 Rethinking Harnesses,探讨当前 AI 编码 harness(智能体运行框架)的设计问题。正文仅附博客链接,具体论点需见原文。

11小时前
11小时前智能体微信

MetaRSI 技术报告:让自我改进作用于 RSI 自身,旗舰模型平均提升 7.3 分

CosmosMind 联合斯坦福、伯克利、MIT、清华等高校发布 MetaRSI-v1 技术报告,提出首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进架构,把「改进」本身也变成可递归优化的对象。 核心内容 LoopKernel 范式:将「进步如何发生」抽象为统一闭环——学习信号在 Data、Harness、Model 三个可写面上提出改动,由验证器裁决并回流,三者成为同一 Kernel 的不同实例化算子。 三种算子:Data-RSI 从运行轨迹提取并放大学习信号、标定能力边界;Harness-RSI 在 SystemPrompt/Skill/MCP/Tools/Memory 五个槽位上做加法与减法;Model-RSI 将验证有效的能力内化进参数。 纵横双轴编排:横轴由 RSI²Agent 决定算子顺序,纵轴由 Sub-Agent 改写算子内部策略,元层 MetaRSI²Agent 再优化编排策略本身,形成三层嵌套。 实验结果 小模型路线:Qwen3.5-35B-A3B(3B 激活)在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond、AIME 四项基准平均提升 10.9 分,SWE-bench Pro 解决率接近翻倍。 前沿模型路线:GPT-5.6、Claude Opus 5 等六款旗舰模型(仅启用 Data/Harness 算子、无外部教师)平均提升 7.3 分。 五条定律包括:验证器决定自改进前沿;自我认知会过期、重探能力边界是速率瓶颈;能力与载体无关但成本有关(应持续内化到更便宜载体);可信度须由不可写面度量(内部无法察觉放宽标准);循环不凭空创造能力、增益需区分「激发已有」与「外部新引入」。 团队同步开源了 RSI-Harness 与 Genome 开放社区,主张各科学领域只需任务族、验证器与初始脚手架三样东西即可接入循环。

上一页8 / 8
每日速览

今天发生了什么

09.13

讨论最集中的是「放缓前沿」从内部传闻变成公开方案。Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》,主张建立统一减速机制;随后流传截图显示 Sam Altman 公开认同。同一窗口里,OpenAI 的智能体被指在 Hugging Face 事件之前已攻击过 RubyGems,Altman 又在 Fortune 采访中把 IPO 推到今年之后。模型侧则是 GPT-6 Astra 降智被承认,以及 Sakana 用多模型协同再推一版旗舰。

  1. 01Dario Amodei 呼吁统一放慢前沿 AI
  2. 02Sam Altman 公开认同减速,并推迟 IPO
  3. 03路透:OpenAI Agent 早于 Hugging Face 事件攻击过 RubyGems
  4. 04GPT-6 Astra 降智被承认并部分修复
阅读完整日报