AI在线 AI在线

腾讯混元视频生成工具 HunyuanCustom 宣布开源,融合文本、图像、音频、视频等多模态输入生视频的能力

腾讯表示,Hunyuan Custom 模型能实现单主体视频生成、多主体视频生成、单主体视频配音、视频局部编辑等能力,其生成的视频与用户输入的参考主体能保持高度一致。
感谢腾讯混元宣布今天正式推出并开源全新的多模态定制化视频生成工具 Hunyuan Custom。该模型基于混元视频生成大模型(Hunyuan Video)打造,主体一致性效果超过现有的开源方案。

据介绍,Hunyuan Custom 融合了文本、图像、音频、视频等多模态输入生视频的能力,是一款具备高度控制力和生成质量的智能视频创作工具。

腾讯表示,Hunyuan Custom 模型能实现单主体视频生成、多主体视频生成、单主体视频配音、视频局部编辑等能力,其生成的视频与用户输入的参考主体能保持高度一致。

其中,单主体生成能力已经开源并在混元官网(AI在线附官网地址:https://hunyuan.tencent.com/)上线,用户可以在“模型广场-图生视频-参考生视频”中体验,其他能力将于 5 月内陆续对外开源。

腾讯混元视频生成工具 HunyuanCustom 宣布开源,融合文本、图像、音频、视频等多模态输入生视频的能力

有了 HunyuanCustom,用户只需上传一张包含目标人物或物体的图片,并提供一句文本描述(例如“他正在遛狗”),HunyuanCustom 就能识别出图片中的身份信息,并在完全不同的动作、服饰与场景中生成连贯自然的视频内容。

腾讯混元视频生成工具 HunyuanCustom 宣布开源,融合文本、图像、音频、视频等多模态输入生视频的能力

除了单主体以外,这个能力同样能实现多主体视频的生成,用户提供一张人物和一张物体的照片(比如一包薯片和一名男子的照片),并输入文字描述(比如“一名男子正在游泳池旁边,手里拿着薯片进行展示”),即可能让这两个主体按要求出现在视频里。

腾讯混元视频生成工具 HunyuanCustom 宣布开源,融合文本、图像、音频、视频等多模态输入生视频的能力

此外,HunyuanCustom 不止于图像和文本的配合,还具备强大的扩展能力。在音频驱动(单主体)模式下,用户可以上传人物图像并配上音频语音,模型便可生成人物在任意场景中说话、唱歌或进行其他音视频同步表演的效果,广泛适用于数字人直播、虚拟客服、教育演示等场景。

腾讯混元视频生成工具 HunyuanCustom 宣布开源,融合文本、图像、音频、视频等多模态输入生视频的能力

在视频驱动模式下,HunyuanCustom 支持将图片中的人物或物体自然地替换或插入到任意视频片段中,进行创意植入或场景扩展,轻松实现视频重构与内容增强。

此前大部分的视频生成模型主要能实现文生视频和图生视频。文生视频每次均根据本文提示词重新生成,很难持续保持人物和场景的一致性。而图像生成视频模型主要实现的是“让图片动起来”。例如,上传一张人物照片,最终生成的视频通常只能在照片的原始服饰、姿态和场景下做出一些固定表情或动作,服装、背景和姿态几乎无法修改。

但在部分场景下,创作者希望保持人物一致的情况下,改变人物所在的环境和动作。此前的视频生成模型无法实现,多模态视频生成模型 HunyuanCustom 则可以很好地满足创作者的需求,通过引入身份增强机制和多模态融合模块,真正实现了“图像提供身份,文本定义一切”。

参考资料:

  • 体验入口:https://hunyuan.tencent.com/modelSquare/home/play?modelId=192

  • 项目官网:https://hunyuancustom.github.io/

  • 代码开源:https://github.com/Tencent/HunyuanCustom

  • 论文地址:https://arxiv.org/pdf/2505.04512

相关资讯

腾讯最新财报显示AI战略进入重投入期 全年研发投入707亿

腾讯近期发布的财报数据显示,公司正全面加速AI领域的投入与布局。 2024年,腾讯研发投入达706.9亿元,七年累计投入已高达3912亿元。 资本开支方面更是亮眼,连续四个季度实现同比三位数增长,年度资本开支突破767亿元,同比增长221%,创下历史新高。
3/19/2025 4:55:00 PM
AI在线

消息称腾讯重构混元大模型研发体系,加大 AI 投入

腾讯对混元大模型研发体系进行全面重组,成立大语言模型部和多模态模型部,强化数据与平台建设。混元大模型已在700多个内部场景部署,2024年全面开源。#腾讯AI# #混元大模型#
4/29/2025 8:03:50 PM
远洋

腾讯文档正式接入DeepSeek-R1满血版

2月17日,腾讯文档宣布正式接入DeepSeek-R1模型满血版,进一步提升用户在文档创作、信息处理和协作编辑中的效率。 此次接入的DeepSeek-R1模型具备深度思考、联网搜索、多轮对话等功能,能够为用户提供更全面、专业和高效的内容生成与处理体验。 用户在腾讯文档的AI文档助手中选择DeepSeek-R1模型后,即可在腾讯文档小程序、网页版、移动端和桌面端(支持3.9.5及以上版本)体验该功能。
2/17/2025 9:56:00 AM
AI在线
  • 1