
用 Pi 智能体框架配合 LM Studio 推理服务,在本地 Mac 上运行 Gemma 4 系列模型完成编码、校对和智能体任务,性能可达前沿模型的 75%

微信原生 AI 助手「小微」开启灰度测试,基于自研 WeLM 模型,在聊天记录、公众号、视频号、文档等 12 个入口提供智能检索与处理能力

人大高瓴 × 微软研究院开源 Arbor 自主科研框架,用 Hypothesis-Tree 把多次实验组织成可积累的研究状态,登顶 HuggingFace 日榜,长程任务 held-out 增益超 Codex、Claude Code 平均 2.5 倍。

Anthropic 发布 Claude Tag,把 Claude 变成 Slack 群聊里随 @ 随到的「AI 同事」,自动拆任务、调工具、提 PR,已扛起 Anthropic 内部 65% 的代码。

Netflix 高级工程师开源的 Headroom(v0.22)作为本地代理拦截大模型输入,对日志、JSON、代码做无损可逆压缩,已为用户节省约 70 万美元、2000 亿词元。

阿里千问开源首个原生语言世界模型 Qwen-AgentWorld,单一模型覆盖 MCP / Search / Terminal / SWE / Web / OS / Android 七类智能体环境,配套发布 AgentWorldBench 评测基准。

用 Pi 智能体框架 + LM Studio 推理服务器 + Docker 沙箱,在本地 M2 Mac 上跑 Gemma 4 系列模型完成智能体编码、代码检查、单元测试,准确率达到前沿模型约 75%。

微信原生 AI 助手「小微」灰度测试体验,主模型 WeLM,12 个入口覆盖聊天记录检索、文档总结、公众号摘要、本地生活等高频场景。

国产通用办公智能体 DuMate 全流程教程,覆盖安装、技能、连接应用与自动化,3 分钟上手把日常办公活交给 AI。

人大高瓴学院发布 DeNovoSWE 数据集,4818 个真实任务实例训练 Code Agent 从文档生成完整仓库,Qwen3-30B 在 BeyondSWE-Doc2Repo 上从 5.8% 提升到 47.2%。

字节豆包 Seed 2.1 Pro 实测,Agent Coding 与多模态能力迈过生产级可用线,支持截图还原前端交互,价格较 Claude Opus 4.6 降低近 80%。

影眸科技发布 Hyper3D Rodin Gen-2.5,首次在 3D 生成中引入类 LLM Thinking 机制,4 秒生成百万面模型,突破千万面精度与 12K 原生贴图。