网界
网络资讯 产业经济 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

智源发布Emu3:原生多模态世界模型,能否一统图像文本视频?

2024-10-22来源:ITBEAR编辑:瑞雪

智源研究院近期推出了全新的原生多模态世界模型——Emu3,该模型在文本、图像和视频三种模态数据的理解和生成上展现出卓越能力。其独特之处在于,仅需基于下一个token预测,无需依赖扩散模型或组合方法,便能实现多模态数据的统一处理。

在图像生成任务中,Emu3的表现优于SD-1.5与SDXL模型,获得了人类偏好评测的高度认可。同时,在视觉语言理解任务中,Emu3也展现出了强大的实力,其对于12项基准测试的平均得分超越了LlaVA-1.6。在视频生成任务中,Emu3同样表现出色,VBench基准测试得分高于OpenSora 1.2。

Emu3配备了一个强大的视觉tokenizer,能够将视频和图像转换为离散token,这些token可以与文本tokenizer输出的离散token一同送入模型中。这一特性为Any-to-Any任务提供了更加统一的研究范式。

Emu3的研究结果充分证明了下一个token预测作为多模态模型范式的强大潜力,它不仅能实现超越语言本身的大规模多模态学习,还能在多模态任务中取得先进性能。目前,Emu3已开源关键技术和模型,为相关研究提供了有力支持。

2025CSDI:大模型引领智能研发与IT组织变革
今年大家会听到越来越多的AI化、智能化,商业化,这些会成为主流旋律。未来,AI技术的发展从可靠、能干、聪明的阶段,将被部署到更广泛的场景中。得益于算法和算力的技术突破,带来了AI的更新变革,也为行业带来更多的能力和动力去获取更多的数据。AI的发展与AI的应用紧

2025-08-13

周鸿祎称智能体是“赛博牛马” 上班可以摸鱼自由了
文 / 玄玄也美编 / 顾青青出品 / 网界8月6日,第十三届互联网安全大会(ISC.AI 2025)在北京国家会议中心盛大开幕。这场以 “All In Agent” 为主题的盛会,因 360 集团创始人周鸿祎的一番惊人言论瞬间引爆舆论。周鸿祎表示,“智能体将变成我们的赛博牛马,做繁琐的工作

2025-08-07

快手可灵 AI 太能打,商业化跑得比谁都快
文 / 玄玄也美编 / 顾青青出品 / 网界最近,花旗和长江证券的研报都表示,快手可灵 AI 的商业化进程超出了预期。这个判断主要来自实实在在的成果,就在上周的世界人工智能大会上,可灵AI亮出成绩单,目前可灵 AI 在全球已经有超过 4500 万创作者,产品发布到现在升级了

2025-08-05