AI新词:OmniAudio
通义大模型发布OmniAudio 可从 360° 视频生成空间音频
近日,通义实验室语音团队在空间音频生成领域取得里程碑式成果,推出OmniAudio技术,该技术可直接从360°视频生成FOA(First-order Ambisonics)音频,为虚拟现实和沉浸式娱乐带来全新可能。 空间音频作为一种模拟真实听觉环境的技术,能提升沉浸式体验,但现有技术大多基于固定视角视频,对360°全景视频空间信息利用不足。 传统视频到音频生成技术主要生成非空间音频,无法满足沉浸式体验对3D声音定位需求,且多基于有限视角视频,错过全景视频丰富视觉上下文。
5/29/2025 6:00:54 PM
AI在线
- 1
资讯热榜
我国水利标准 AI 大模型正式发布,采用海量知识库 + DeepSeek / Qwen 双模型
Hume AI重磅发布EVI 3:懂你情绪的语音AI,比GPT-4o还快!
Character.AI 推出新功能AvatarFX,用户可制作个性化动画视频
NUS 推出 OmniConsistency:低成本实现图像风格化一致性,挑战 GPT-4o!
AI 教父本吉奥宣布创建 “科学家 AI” 系统,致力于防范智能体欺骗
基于Gemini与Qdrant构建生产级RAG管道:设计指南与代码实践
为什么非要做Agent?我用传统方法也能实现啊!
OpenAI 抛弃 Node.js,用 Rust 重写 AI 编程工具 Codex CLI
标签云
人工智能
AI
OpenAI
AIGC
模型
ChatGPT
DeepSeek
AI绘画
谷歌
数据
机器人
大模型
Midjourney
用户
智能
开源
微软
GPT
学习
Meta
图像
技术
AI创作
Gemini
论文
马斯克
Stable Diffusion
算法
代码
英伟达
Anthropic
芯片
生成式
蛋白质
开发者
腾讯
神经网络
研究
3D
生成
计算
训练
Sora
苹果
机器学习
智能体
AI设计
AI for Science
Claude
GPU
AI视频
人形机器人
华为
搜索
场景
百度
xAI
预测
大语言模型
伟达
深度学习
Transformer
字节跳动
Agent
模态
具身智能
神器推荐
LLaMA
文本
视觉
Copilot
算力
工具
驾驶
API
应用
大型语言模型
LLM
RAG
亚马逊