谷歌发布多模态直播 API：解锁看、听、说，开启 AI 音视频交互新体验

作者：故渊 2024-12-13 08:44

谷歌昨日在发布 Gemini 2.0 的同时，还发布了全新的多模态直播（Multimodal Live）API，帮助开发人员开发具有实时音频和视频流功能的应用程序。

谷歌昨日在发布 Gemini 2.0 的同时，还发布了全新的多模态直播（Multimodal Live）API，帮助开发人员开发具有实时音频和视频流功能的应用程序。

该 API 实现了低延迟、双向的文本、音频和视频交互，以音频和文本形式输出，带来更自然流畅、如同人类对话般的交互体验。用户可以随时打断模型，并通过共享摄像头输入或屏幕录像与其进行互动，就内容提问。

该模型的视频理解功能扩展了通信模式，用户能够使用摄像头实时拍摄或共享桌面并提出相关问题。该 API 已经向开发者开放，同时也向用户提供了一个多模态实时助手的演示应用。AI在线附上演示如下：

该 API 支持集成多种工具，开发者只需一次 API 调用，即可完成复杂的用例。

相关标签：

谷歌

消息称谷歌将推出明星网红 AI 聊天机器人，与 Meta 竞争

根据 The Information 爆料消息，谷歌正在基于明星和 YouTube 网红构建新的 AI 聊天机器人。这个想法并不是谷歌首创的，目前包括 Character.ai 这样的初创公司，以及像 Meta 这样的大公司已经推出了类似的产品。爆料称，谷歌的明星网红 AI 聊天机器人将由该公司的 Gemini 大语言模型提供支持。该公司还在尝试与有影响力的明星网红建立合作伙伴关系，并且还在开发一项功能，让人们只需描述自己的个性和外表就可以创建自己的聊天机器人，类似 Character.ai 的做法。IT之家还发现

6/25/2024 9:20:42 AM 汪淼

谷歌Gemini1.5火速上线：MoE架构，100万上下文

今天，谷歌宣布推出 Gemini 1.5。Gemini 1.5 建立在谷歌基础模型开发和基础设施的研究与工程创新的基础上，包括通过新的专家混合 (MoE) 架构使 Gemini 1.5 的训练和服务更加高效。谷歌现在推出的是用于早期测试的 Gemini 1.5 的第一个版本 ——Gemini 1.5 Pro。它是一种中型多模态模型，针对多种任务的扩展进行了优化，其性能水平与谷歌迄今为止最大的模型 1.0 Ultra 类似，并引入了长上下文理解方面的突破性实验特征。Gemini 1.5 Pro 配备了 128000

2/16/2024 5:39:00 PM 机器之心

谷歌更新 Gemini 2.5 Pro 预览版模型至 06-05 版本，多项 AI 性能基准测试评分提升

谷歌于今年 3 月底发布了 Gemini 2.5 Pro 模型，紧接着又在 4 月推出了面向更广泛用户的轻量级版本 Gemini 2.5 Flash。两者目前仍处于预览阶段，但 Flash 版本已可通过 Gemini App 向全球用户开放体验。目前，谷歌再度更新 Google AI Studio 中的 Gemin 2.5 Pro 模型（更新至 06-05 版本），并声称该模型刷新了多项 AI 性能基准“跑分”

6/6/2025 7:56:28 AM 漾仔

谷歌发布多模态直播 API：解锁看、听、说，开启 AI 音视频交互新体验

相关资讯

消息称谷歌将推出明星网红 AI 聊天机器人，与 Meta 竞争

谷歌Gemini1.5火速上线：MoE架构，100万上下文

谷歌更新 Gemini 2.5 Pro 预览版模型至 06-05 版本，多项 AI 性能基准测试评分提升