多模态
16 条- 01斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”
斑马智能在云栖大会发布全模态端侧大模型AutoOmni 2.0-23B-A3B,强化本地化多模态理解能力
- 02实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
PixVerse发布R2模型,实现世界模型在实时性与通用性上的协同突破。
- 03陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产
阿里宣布三年内将推出原生全模态统一生成模型,打破文本、图像、视频等模态边界。
- 04讲真,我没看出这图是AI做的,更没想到是国产AI做的
商汤科技发布全新文生图大模型U1 Pro,强调高保真与国产自主生成能力
- 05Qwen-Image-2.1:紧凑、高效且统一的图像生成模型
通义千问发布轻量级多模态图像生成模型Qwen-Image-2.1,强调体积小、推理快、端到端统一架构。
- 06如果你听到它,请帮找到它:面向开放词汇音视频事件定位的正交知识蒸馏
提出正交知识蒸馏方法,在OV-AVEL任务中融合视觉与音频教师模型的互补边界与语义信息,提升定位鲁棒性
- 07阿里巴巴发布 Qwen 3.8 Omni Flash
阿里正式发布通义千问最新版本Qwen 3.8 Omni Flash,聚焦多模态与推理性能升级。
- 08Paint-Anything:面向图像生成与编辑的统一任意色控制
提出支持任意24位十六进制色值输入的通用图像生成/编辑框架,基于LLM对颜色语义的紧凑建模。
- 09从语音代理到AI虚拟形象:与亚历山大·斯莫拉对话(第777期)
探讨语音AI向音视频融合的AI虚拟形象演进中的实时音频处理、交互自然性等关键技术挑战
- 10PANORAMA:通过掩码提议选择实现全景式空间定位图文描述
提出全景定位图文生成任务,联合密集描述与像素级掩码,提升视觉-语言模型的空间接地能力。
- 11通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
ZDTaichu5.0-9B开源多模态模型在九大空间测试中8项登顶,刷新国产模型性能纪录。
- 12Vidu S2发布实时互动、实时视频编辑与空间视频功能
国产视频生成模型Vidu S2推出三大新能力,强化实时性与三维表达能力。
- 13Gemini Live 音频功能
Google发布Gemini 3.8 Live及Extended Thinking语音对话模型,支持浏览器内实时语音交互与中断响应。
- 14Gemini 3.8 Live 和 3.8 Live Extended Thinking
谷歌发布 Gemini 3.8 系列新模型,支持实时交互与扩展推理能力。
- 15发布Gemini 3.8 Live与3.8 Live Extended Thinking
Google DeepMind推出支持实时交互与扩展推理链的Gemini 3.8 Live系列模型,显著提升复杂任务响应能力。
- 16全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象发布首个多模态视频生成模型HiDream-O1-Video-1.0,强调物理规律建模能力。