阿里千问发布全模态模型Qwen3.5-Omni,支持文本、图片、音视频输入,可实时视频通话生成代码、解读论文,拿下215项SOTA,性能比肩Gemini 3.1 Pro


阿里千问发布全模态模型Qwen3.5-Omni,支持文本、图片、音视频输入,可实时视频通话生成代码、解读论文,拿下215项SOTA,性能比肩Gemini 3.1 Pro
Qwen3.5-Omni 是阿里千问推出的全模态AI模型,最大的亮点是可以像真人一样进行视频通话。你可以打开摄像头,让它看着你的屏幕实时生成代码、解读论文、分析视频内容。不需要复制粘贴文字,不需要截图上传,直接"看着说"就能完成工作。
适合谁用:开发者、研究人员、内容创作者,以及任何需要AI辅助处理多模态信息的人。
打开摄像头,在纸上画个前端草图,Qwen3.5-Omni 就能边看边生成完整的 HTML+CSS 代码。整个过程就像和真人程序员视频会议一样自然。

实测体验:
上传一段视频(比如电影预告片),Qwen3.5-Omni 能生成带时间戳的详细脚本,包括:
测试中,它成功拆解了《疯狂动物城2》预告片的所有分镜,甚至能准确识别37秒处的角色并分析氛围。
不用再对着满屏英文术语头疼。打开摄像头对准论文,Qwen3.5-Omni 会:

Qwen3.5-Omni 在多个基准测试中拿下 215项SOTA,整体成绩与 Gemini 3.1 Pro 打得有来有回:
自适应速率交错对齐技术,解决了AI说话不稳定的老问题(漏读、读错、数字发音奇怪)。
边输入、边处理、边生成,实现真正的实时交互,而不是"说一句等三秒"。
目前 Qwen3.5-Omni 已在 Qwen Chat 上线,支持三种尺寸:
体验方式:
API 调用:
体验地址:

商汤开源SenseNova U1,采用NEO-Unify原生统一架构,完全去掉视觉编码器和解码器,8B参数挑战更大商业模型的图文生成能力。

Anthropic开源自然语言自编码器NLA,能把Claude脑子里的激活向量翻译成人类可读懂的文字,已用于Opus 4.6安全审计,浏览器可体验。

深度实测百度秒哒3.0和搭子DuMate两款AI工具,从零代码搭建宠物投喂平台到自动化处理客服、营销、数据分析,跑通一人公司全业务流。