DIFFUSSM

丢掉注意力的扩散模型：Mamba带火的SSM被苹果、康奈尔盯上了

替代注意力机制，SSM 真的大有可为？为了用更少的算力让扩散模型生成高分辨率图像，注意力机制可以不要，这是康奈尔大学和苹果的一项最新研究所给出的结论。众所周知，注意力机制是 Transformer 架构的核心组件，对于高质量的文本、图像生成都至关重要。但它的缺陷也很明显，即计算复杂度会随着序列长度的增加呈现二次方增长。这在长文本、高分辨率的图像处理中都是一个令人头疼的问题。为了解决这个问题，这项新研究用一个可扩展性更强的状态空间模型（SSM）主干替代了传统架构中的注意力机制，开发出了一个名为 Diffusion S

12/11/2023 3:55:00 PM

机器之心

资讯热榜

Mac也能跑Qwen3，一文看懂本地部署qwen 3配置要求 Ollama 支持全线的 Qwen 3 模型 Qwen3正式发布，优化编码与代理能力，强化MCP支持引领AI新潮流小米开源“Xiaomi MiMo”大模型：为推理而生，以 7B 参数超越 OpenAI o1-mini Unsloth发布Qwen3动态量化2.0版本，优化本地运行体验小米首个推理大模型Xiaomi MiMo开源看不懂新开源的DS-Prover V2版本？解读来了，攻克像人类一样数学证明，达到SoTA水平，不知道如何测？样题来了 DeepSeek-Prover-V2-671B 模型开源，数学推理领域迎来新突破

标签云

人工智能 OpenAI AI AIGC ChatGPT AI绘画 DeepSeek 模型数据机器人谷歌大模型 Midjourney 智能用户开源学习 GPT 微软 Meta 图像 AI创作技术论文 Gemini Stable Diffusion 马斯克算法蛋白质芯片代码生成式英伟达腾讯神经网络研究计算 Anthropic Sora 3D AI for Science AI设计机器学习开发者 GPU AI视频华为场景人形机器人预测百度苹果伟达 Transformer 深度学习 xAI Claude 模态字节跳动大语言模型搜索驾驶具身智能神器推荐文本 Copilot LLaMA 算力安全视觉视频生成训练干货合集应用大型语言模型亚马逊科技智能体 AGI DeepMind