MeDuSA

大模型推理速度飙升3.6倍，「美杜莎」论文来了，贾扬清：最优雅加速推理方案之一

去年，在加速大语言模型推理层面，我们迎来了一个比推测解码更高效的解决方案 —— 普林斯顿、UIUC 等机构提出的 Medusa。如今，关于 Medusa 终于有了完整技术论文，还提供了新的版本。如你我所知，在大型语言模型（LLM）的运行逻辑中，随着规模大小的增加，语言生成的质量会随着提高。不过，这也导致了推理延迟的增加，从而对实际应用构成了重大挑战。从系统角度来看，LLM 推理主要受内存限制，主要延迟瓶颈源于加速器的内存带宽而非算术计算。这一瓶颈是自回归解码的顺序性所固有的，其中每次前向传递都需要将完整的模型参数从

1/24/2024 2:54:00 PM

机器之心

资讯热榜

Mac也能跑Qwen3，一文看懂本地部署qwen 3配置要求小米开源“Xiaomi MiMo”大模型：为推理而生，以 7B 参数超越 OpenAI o1-mini Unsloth发布Qwen3动态量化2.0版本，优化本地运行体验小米首个推理大模型Xiaomi MiMo开源看不懂新开源的DS-Prover V2版本？解读来了，攻克像人类一样数学证明，达到SoTA水平，不知道如何测？样题来了小米首个推理大模型开源Xiaomi MiMo，70 亿参数性能与效率的双赢:Qwen3横空出世，MoE架构大幅降低部署成本 DeepSeek-Prover-V2-671B 模型开源，数学推理领域迎来新突破

标签云

人工智能 OpenAI AI AIGC ChatGPT AI绘画 DeepSeek 模型数据机器人谷歌大模型 Midjourney 智能用户开源学习 GPT 微软 Meta 图像 AI创作技术论文 Gemini Stable Diffusion 马斯克算法蛋白质芯片代码生成式英伟达腾讯神经网络研究 Anthropic 计算 3D Sora AI for Science AI设计机器学习开发者 GPU AI视频华为场景人形机器人预测百度苹果伟达 Transformer 深度学习 Claude xAI 模态字节跳动大语言模型搜索驾驶具身智能神器推荐文本 Copilot LLaMA 算力视觉安全训练视频生成干货合集应用大型语言模型亚马逊科技智能体 AGI DeepMind