AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 多模态

多模态

16
  1. 01
    斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”

    斑马智能在云栖大会发布全模态端侧大模型AutoOmni 2.0-23B-A3B,强化本地化多模态理解能力

    qbitai.com·量子位·20小时前端侧大模型多模态AI应用
  2. 02
    实时世界模型进入“全科生”阶段,PixVerse R2先交卷!

    PixVerse发布R2模型,实现世界模型在实时性与通用性上的协同突破。

    qbitai.com·量子位·23小时前世界模型实时生成多模态
  3. 03
    陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

    阿里宣布三年内将推出原生全模态统一生成模型,打破文本、图像、视频等模态边界。

    qbitai.com·量子位·2天前多模态大模型研发产业动态
  4. 04
    讲真,我没看出这图是AI做的,更没想到是国产AI做的

    商汤科技发布全新文生图大模型U1 Pro,强调高保真与国产自主生成能力

    qbitai.com·量子位·2天前多模态国产模型产品发布
  5. 05
    Qwen-Image-2.1:紧凑、高效且统一的图像生成模型

    通义千问发布轻量级多模态图像生成模型Qwen-Image-2.1,强调体积小、推理快、端到端统一架构。

    qwen.ai·Hacker News·4天前·45多模态图像生成轻量化模型
  6. 06
    如果你听到它,请帮找到它:面向开放词汇音视频事件定位的正交知识蒸馏

    提出正交知识蒸馏方法,在OV-AVEL任务中融合视觉与音频教师模型的互补边界与语义信息,提升定位鲁棒性

    arxiv.org·arXiv·4天前多模态知识蒸馏音视频理解
  7. 07
    阿里巴巴发布 Qwen 3.8 Omni Flash

    阿里正式发布通义千问最新版本Qwen 3.8 Omni Flash,聚焦多模态与推理性能升级。

    qwen.ai·Hacker News·6天前·25大模型产品发布多模态
  8. 08
    Paint-Anything:面向图像生成与编辑的统一任意色控制

    提出支持任意24位十六进制色值输入的通用图像生成/编辑框架,基于LLM对颜色语义的紧凑建模。

    arxiv.org·arXiv·6天前图像生成可控编辑多模态
  9. 09
    从语音代理到AI虚拟形象:与亚历山大·斯莫拉对话(第777期)

    探讨语音AI向音视频融合的AI虚拟形象演进中的实时音频处理、交互自然性等关键技术挑战

    twimlai.com·TWIML AI·09/17语音AI多模态AI代理
  10. 10
    PANORAMA:通过掩码提议选择实现全景式空间定位图文描述

    提出全景定位图文生成任务,联合密集描述与像素级掩码,提升视觉-语言模型的空间接地能力。

    arxiv.org·arXiv·09/17多模态视觉定位图文生成
  11. 11
    通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队

    ZDTaichu5.0-9B开源多模态模型在九大空间测试中8项登顶,刷新国产模型性能纪录。

    qbitai.com·量子位·09/16多模态开源模型具身智能
  12. 12
    Vidu S2发布实时互动、实时视频编辑与空间视频功能

    国产视频生成模型Vidu S2推出三大新能力,强化实时性与三维表达能力。

    qbitai.com·量子位·09/16视频生成多模态国产模型
  13. 13
    Gemini Live 音频功能

    Google发布Gemini 3.8 Live及Extended Thinking语音对话模型,支持浏览器内实时语音交互与中断响应。

    simonwillison.net·Simon Willison·09/16语音模型多模态产品发布
  14. 14
    Gemini 3.8 Live 和 3.8 Live Extended Thinking

    谷歌发布 Gemini 3.8 系列新模型,支持实时交互与扩展推理能力。

    blog.google·Hacker News·09/16·49大模型多模态产品发布
  15. 15
    发布Gemini 3.8 Live与3.8 Live Extended Thinking

    Google DeepMind推出支持实时交互与扩展推理链的Gemini 3.8 Live系列模型,显著提升复杂任务响应能力。

    deepmind.google·Google DeepMind·09/16大模型发布多模态推理能力
  16. 16
    全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型

    智象发布首个多模态视频生成模型HiDream-O1-Video-1.0,强调物理规律建模能力。

    qbitai.com·量子位·09/15视频生成多模态物理建模