
微信原生 AI 助手「小微」灰度测试中,主模型为自研 WeLM,可检索聊天记录、总结公众号文章、调用本地生活服务,涉及敏感操作需二次确认。

人大高瓴学院发布 DeNovoSWE,首个面向「从文档生成完整仓库」的长程训练集,含 4818 个真实任务实例,Qwen3-30B 在 BeyondSWE-Doc2Repo 上从 5.8% 提升到 47.2%。

手把手带你跑通百度搭子 DuMate 的提需求→授权→执行→交付链路,安装、界面、办公场景实操与自动化一文说清

Anthropic 发布 Claude Tag,把 Claude 嵌入 Slack 工作流,支持共享上下文、持续记忆和主动介入,团队协作新范式。

豆包上线专业版,搭载豆包 2.1 Pro 的 Agent 驱动办公任务模式,能操作本地电脑、分析财报、自建 Skill,实测交付质量对标 Claude Opus。

Netflix 高级工程师开发的开源工具 Headroom,在指令到达大模型之前精简冗余词元,可逆压缩、无损上下文,已为用户省下 70 万美元。

用 Pi 智能体框架配合 LM Studio 推理引擎,在本地 Mac 上跑 Gemma 4 完成 Agent 编码任务,附完整 Docker 配置和 models.json 示例。

清华微软联合开源的多智能体推理框架,通过 Reasoner、Verifier、Meta-Strategist 三个角色让长程推理可验证可回溯,Apex 基准超 GPT-5.5 达 13.5%。

百度基于 DeepSeek OCR 推出的 Unlimited OCR,通过 R-SWA 机制实现 32K 上下文长程解析,OmniDocBench v1.5 端到端 SOTA 达 93.23%。

港大阿里联合开源 FineVLA 可控 VLA 框架,支持通过语言指定执行臂、接触区域等细节,RoboTwin 仿真成功率 86.8%。

火山方舟兼容 Anthropic 协议,三步环境变量配置即可让 Claude Code 换用豆包 Seed 2.1 Pro,实测修复复杂项目 bug。

火山引擎 Seed-Audio 1.0 升级为影视级全要素直出,一段提示词即可生成多角色对话、音效与背景音乐,接近成片级声音。