网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

智源发布Emu3:原生多模态世界模型,能否一统图像文本视频?

2024-10-22来源:ITBEAR编辑:瑞雪

智源研究院近期推出了全新的原生多模态世界模型——Emu3,该模型在文本、图像和视频三种模态数据的理解和生成上展现出卓越能力。其独特之处在于,仅需基于下一个token预测,无需依赖扩散模型或组合方法,便能实现多模态数据的统一处理。

在图像生成任务中,Emu3的表现优于SD-1.5与SDXL模型,获得了人类偏好评测的高度认可。同时,在视觉语言理解任务中,Emu3也展现出了强大的实力,其对于12项基准测试的平均得分超越了LlaVA-1.6。在视频生成任务中,Emu3同样表现出色,VBench基准测试得分高于OpenSora 1.2。

Emu3配备了一个强大的视觉tokenizer,能够将视频和图像转换为离散token,这些token可以与文本tokenizer输出的离散token一同送入模型中。这一特性为Any-to-Any任务提供了更加统一的研究范式。

Emu3的研究结果充分证明了下一个token预测作为多模态模型范式的强大潜力,它不仅能实现超越语言本身的大规模多模态学习,还能在多模态任务中取得先进性能。目前,Emu3已开源关键技术和模型,为相关研究提供了有力支持。

阿里巴巴“通义”App升级更名“千问”,AI战略转向消费级市场新布局
根据官方消息,“千问”定位为阿里旗下最重要的大模型应用入口,其核心能力基于阿里自研的大模型体系Qwen(千问)。 分析人士指出,阿里此前在To B市场和模型研发侧拥有技术基础,但在消费端应用分发层面还未形成…

2025-11-15

Dexmal原力灵机获近10亿融资 阿里蔚来资本助力具身智能研发落地
IT之家 11 月 14 日消息,具身智能公司 Dexmal 原力灵机今日宣布完成数亿元 A+ 轮融资,阿里巴巴为独家投资方。IT之家注意到,该公司 A 轮融资由蔚来资本领投,洪泰基金、联想创投、锡创投和正…

2025-11-14

百度世界大会发布文心大模型5.0 参数量2.4万亿能力达全球领先
文心5.0基础能力全面升级,在多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等方面表现突出,拥有强大的理解、逻辑、记忆和说服力。不同于业界多数的多模态模型采用后期融合的方式,文心5.0的技术路…

2025-11-13