腾讯混元图像 2.0 发布：实时生图毫秒级速度与超写实画质

作者：AI在线 2025-05-16 02:00

腾讯正式发布其最新的混元图像2.0模型（Hunyuan Image2.0），标志着 AI 图像生成技术迈入 “毫秒级” 响应时代。新模型在速度上有了显著提升，相比于前代产品，混元图像2.0的参数量提高了一个数量级，结合了高效的图像编解码器和全新的扩散架构，能够在同类商业产品通常需要5到10秒的推理速度下，实现毫秒级的快速响应。用户在生成图像时，可以一边输入文本或进行语音指令，一边获得实时图像输出，极大地改变了传统的 “抽卡 - 等待 - 抽卡” 模式，提升了用户的交互体验。

腾讯正式发布其最新的混元图像2.0模型（Hunyuan Image2.0），标志着 AI 图像生成技术迈入 “毫秒级” 响应时代。

新模型在速度上有了显著提升，相比于前代产品，混元图像2.0的参数量提高了一个数量级，结合了高效的图像编解码器和全新的扩散架构，能够在同类商业产品通常需要5到10秒的推理速度下，实现毫秒级的快速响应。用户在生成图像时，可以一边输入文本或进行语音指令，一边获得实时图像输出，极大地改变了传统的 “抽卡 - 等待 - 抽卡” 模式，提升了用户的交互体验。

超写实的图像质量

除了速度上的突破，混元图像2.0在图像生成的质量方面也有显著进步。该模型通过强化学习和引入大量人类美学知识，有效避免了 AI 生成图像常见的 “AI 味”，生成的图像不仅真实感强，细节丰富，且具有很高的可用性。在国际权威的 GenEval 基准测试中，混元图像2.0在复杂文本指令的理解与生成能力评估中准确率超过95%，远超其他同类模型。

创新的实时绘画板功能

本次升级还推出了实时绘画板功能，利用新模型的实时生图能力，用户在绘制线稿或调整参数时，预览区能够同步生成上色效果。这一功能突破了传统的 “绘制 - 等待 - 修改” 流程，极大地便利了专业设计师的创作过程。此外，实时绘画板支持多图融合，用户可以上传多个草图，AI 将自动协调透视与光影，按照用户的提示词生成融合图像，进一步丰富了 AI 生图的互动体验。

腾讯还透露，原生多模态图像生成大模型正在研发中，新模型将在多轮图像生成和实时交互体验等方面表现出色，期待为用户带来更为丰富的创作体验。

产品入口:https://hunyuan.tencent.com/

实时视频生成新突破：Meta StreamDiT 仅需单 GPU，逐帧生成高质量视频

Meta 和加州大学伯克利分校的研究人员共同开发了 StreamDiT，这是一款革命性的 AI 模型，能够以每秒16帧的速度实时创建512p 分辨率的视频，并且仅需单个高端 GPU。与以往需要完整生成视频片段才能播放的方法不同，StreamDiT 实现了逐帧实时视频流生成。 StreamDiT 模型拥有 40亿个参数，展现了令人印象深刻的多功能性。

7/14/2025 10:12:19 AM

AI在线

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

科技媒体 MSPoweruser 昨日（10 月 14 日）发布博文，报道称微软公司获得了一项新的专利，描述了基于用户实时输入的语音来生成图片。根据美国商标和专利局最新公示的清单，该专利共计 20 页，微软于 2023 年 4 月 5 日提交申请，于 10 月 10 日获批。根据专利描述，该系统可以在会议或讲座中实时捕捉音频，随后通过语言模型进行总结，并生成相应的 AI 图像。

10/15/2024 11:57:27 AM

故渊

腾讯元宝文生图功能升级支持混元和DeepSeek两大模型生成

腾讯元宝宣布其文生图功能全面升级，支持混元和DeepSeek两大模型生成图片。这一升级使得用户只需通过简单的一句话描述，即可生成高质量、复杂且富有想象力的图像。腾讯元宝的这一功能升级结合了腾讯混元最新的文生图模型，已在元宝全端上线。

5/7/2025 5:00:44 PM

AI在线

腾讯混元图像 2.0 发布：实时生图毫秒级速度与超写实画质

相关资讯

实时视频生成新突破：Meta StreamDiT 仅需单 GPU，逐帧生成高质量视频

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

腾讯元宝文生图功能升级 支持混元和DeepSeek两大模型生成

腾讯元宝文生图功能升级支持混元和DeepSeek两大模型生成