AI在线 AI在线

大模型推理大变革!CMU 与英伟达携手推出 Multiverse,实现超高速并行生成

随着人工智能的发展,大型语言模型(LLM)的应用越来越广泛,但目前的推理方式仍然存在不少局限性。 传统的自回归生成方式需要逐个生成 token,效率较低且无法充分利用现代硬件的并行计算能力。 为了解决这一问题,卡耐基梅隆大学(CMU)与英伟达的研究团队推出了一种名为 Multiverse 的新型生成模型,旨在实现原生并行生成,从根本上改变我们对 LLM 推理的理解。

随着人工智能的发展,大型语言模型(LLM)的应用越来越广泛,但目前的推理方式仍然存在不少局限性。传统的自回归生成方式需要逐个生成 token,效率较低且无法充分利用现代硬件的并行计算能力。为了解决这一问题,卡耐基梅隆大学(CMU)与英伟达的研究团队推出了一种名为 Multiverse 的新型生成模型,旨在实现原生并行生成,从根本上改变我们对 LLM 推理的理解。

QQ20250618-091616.jpg

Multiverse 并不仅仅是加快生成速度,而是重新思考了模型的架构。研究者们发现,当前主流的大语言模型在生成过程中其实暗含了一种并行性。通过这一发现,Multiverse 框架采用了类似 MapReduce 的结构,将生成过程分为三个阶段:任务的自适应分解、子任务的并行执行,以及无损结果的合并。这样的设计能够充分发挥计算资源的潜力,实现更高效的推理过程。

image.png

根据实验数据显示,Multiverse-32B 模型在相同的上下文长度下,性能较自回归模型提高了近2%。这表明 Multiverse 不仅在速度上有显著提升,还在扩展性上表现优越,能够在不同的批量大小下实现最高两倍的速度提升。为了让这一成果能够更广泛应用,研究团队还开源了整个 Multiverse 生态系统,包括数据、模型权重和训练细节,方便其他研究者进行进一步探索。

在实际应用中,Multiverse 能够根据生成需求灵活调整,并通过一种专用的控制标签实现顺序与并行生成的动态切换,确保生成内容的连贯性和逻辑性。这项技术的推出无疑为自然语言处理领域注入了新的活力,让我们期待它在实际应用中的表现。

相关资讯

Multiverse发布全球首款AI生成多人在线游戏,以超低成本改写游戏开发规则

昨日,游戏开发与AI技术领域见证了一场颠覆性创新——EnigmaLabsAI团队正式发布Multiverse,这款号称全球首款由AI生成的多人在线游戏标志着游戏开发进入全新纪元。 这一突破性项目不仅以其AI驱动的动态世界引发广泛关注,更凭借惊人的低成本研发模式震撼行业。 Multiverse核心优势在于其革命性的实时动态世界模拟技术。
5/9/2025 10:01:41 AM
AI在线

英伟达AI研究人员推出FFN融合技术:加速大型语言模型推理

人工智能芯片巨头英伟达的研究人员近日发布了一项名为“FFN融合”(FFN Fusion)的创新架构优化技术。 该技术旨在通过解决Transformer架构中固有的串行计算瓶颈,显著提升大型语言模型(LLMs)的推理效率,为更广泛地部署高性能AI应用铺平道路.近年来,大型语言模型在自然语言处理、科学研究和对话代理等领域展现出强大的能力。 然而,随着模型规模和复杂性的不断增加,其推理过程所需的计算资源也大幅增长,导致了效率瓶颈。
3/31/2025 1:48:00 PM
AI在线

消息称 DeepSeek-R2 AI 模型开发进程因美国当局英伟达 H20 芯片出口限制而延迟

由于美国当局对英伟达H20芯片的出口限制,DeepSeek R2 AI模型的开发进程被迫延迟。这不仅影响了新模型的研发,也对现有R1模型的实际部署造成困扰。#AI芯片# #DeepSeek#
6/27/2025 8:09:47 AM
漾仔
  • 1