Upscale-A-Video

「花果山名场面」有了高清画质版，NTU提出视频超分框架Upscale-A-Video

扩散模型在图像生成方面取得了显著的成功，但由于对输出保真度和时间一致性的高要求，将这些模型应用于视频超分辨率仍然具有挑战性，特别是其固有的随机性使这变得复杂。来自南洋理工大学 S-Lab 的研究团队提出了一种用于视频超分的文本指导（text-guided）潜在扩散框架 ——Upscale-A-Video。该框架通过两个关键机制确保时间一致性：在局部，它将时间层集成到 U-Net 和 VAE-Decoder 中，保持短序列的一致性；在全局范围内，无需训练，就引入了流指导（flow-guided）循环潜在传播模块，通过

1/2/2024 11:12:00 AM

机器之心

资讯热榜

Mac也能跑Qwen3，一文看懂本地部署qwen 3配置要求 Ollama 支持全线的 Qwen 3 模型 Qwen3正式发布，优化编码与代理能力，强化MCP支持引领AI新潮流小米开源“Xiaomi MiMo”大模型：为推理而生，以 7B 参数超越 OpenAI o1-mini Unsloth发布Qwen3动态量化2.0版本，优化本地运行体验小米首个推理大模型Xiaomi MiMo开源看不懂新开源的DS-Prover V2版本？解读来了，攻克像人类一样数学证明，达到SoTA水平，不知道如何测？样题来了 DeepSeek-Prover-V2-671B 模型开源，数学推理领域迎来新突破

标签云

人工智能 OpenAI AI AIGC ChatGPT AI绘画 DeepSeek 模型数据机器人谷歌大模型 Midjourney 智能用户开源学习 GPT 微软 Meta 图像 AI创作技术论文 Gemini Stable Diffusion 马斯克算法蛋白质芯片代码生成式英伟达腾讯神经网络研究计算 Anthropic Sora 3D AI for Science AI设计机器学习开发者 GPU AI视频华为场景人形机器人预测百度苹果伟达 Transformer 深度学习 xAI Claude 模态字节跳动大语言模型搜索驾驶具身智能神器推荐文本 Copilot LLaMA 算力安全视觉视频生成训练干货合集应用大型语言模型亚马逊科技智能体 AGI DeepMind