Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

又不求融资，怎么也给 demo 加美颜？「google，这就有点尴尬了。」没有想到，Gemini 上线头一天，热门评论会是这个样子。本周三，google的 Gemini 让生成式 AI 进入了原生多模态时代。人们第一时间涌入新模型加持的 Bard 想要试试 AI 的才能，结果给出的评价褒贬不一。其中最值得注意的是有人指出，Gemini 在发布时，google给出的一系列 Demo 中最令人眼花缭乱的部分是伪造的。名为《Hands-on with Gemini: Interacting with multimodal AI》的视频现在的播放

又不求融资，怎么也给 demo 加美颜？

「google，这就有点尴尬了。」

没有想到，Gemini 上线头一天，热门评论会是这个样子。

本周三，google的 Gemini 让生成式 AI 进入了原生多模态时代。人们第一时间涌入新模型加持的 Bard 想要试试 AI 的才能，结果给出的评价褒贬不一。

其中最值得注意的是有人指出，Gemini 在发布时，google给出的一系列 Demo 中最令人眼花缭乱的部分是伪造的。

名为《Hands-on with Gemini: Interacting with multimodal AI》的视频现在的播放量已经有 140 万次，其中展现了google认为自己「最喜欢的与 Gemini 的交互案例」，展现了多模态模型（即它理解并混合语言和视觉理解）如何灵活地响应各种输入。

google展现了 Gemini 神奇的理解和交互才能，人用画笔绘制一只鸭子的草图，从一条曲线到一幅完整的图画，AI 评论说蓝色是一种不切实际的动物颜色。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

然后 AI 看到一只实体的玩具蓝色鸭时表现出了惊讶。然后它会响应人类围绕鸭子的各种问题，包括地球的哪个地点会有鸭子，鸭子在各种语言里的读法等等。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

随后示范继续进行，AI 实现了在换杯子游戏中错误跟踪、识别皮影手势、识别材料给出组合建议、重新排序行星草图等等。

但点击 YouTube 上的视频描述，可以发现 Google 有一个重要的免责声明：「为了示范的目的，他们已经减少延迟，为了简洁，Gemini 的输出也缩短了。」

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

根据彭博社消息，google在被要求发表评论时承认，视频示范并不是实时的，而是运用了原始镜头中的静止图像帧，然后编写了文本提醒，让 Gemini 做出回应。

视频看起来很美好，然而，却也反映出了这一问题：视频不是真实的。人们运用了各种方式来进行验证，包括运用视频的截图来问 Bard 中的 Gemini，发现 AI 并不能准确地回答问题。

有理由怀疑，google可能只是制作了一个夸张的视频，然后运用静态图像帧和文本进行拼凑来作为 Gemini 的提醒语。也就是说，视频 Demo 是精心挑选的结果。

也许 Gemini 可以如实的完成视频展现的内容，但google没有这样做，而是加了速；又或许 Gemini 根本不像视频中展现的那样丝滑，有人从好几个错误结果中挑出了错误的作为素材。

但无论如何，Gemini 的示范看起来都像是经过精心调整好的，对实际交互情况进行了歪曲。

google在这篇名为《How it’s Made: Interacting with Gemini through multimodal prompting》的博客中也解释了多模态交互过程，即如何通过多模态 prompting 来与 Gemini 交互。

注：Gemini 的提醒语可以是多模态 prompting（即不同模态的组合，如图像和文本），之后让 Gemini 预测接下来会发生什么，从而做出反应。

例如，在玩铰剪石头布的游戏中，google的实验过程是这样的：将照片展现给 Gemini，并要求 Gemini 描述所看到的内容：

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

在示范中，一方面，Gemini 似乎确实产生了视频中所示的反应。但在另一方面，观众可能被误导了，主要体现在与模型的交互速度、准确性等方面。

例如，在视频的 2:45 处，一只手静静地做出一系列手势。Gemini 很快回应：「我知道你在做什么！你在玩石头、铰剪、布！」

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

然而在google博客中，用户必须同时显示所有三个手势并提醒：你认为我在做什么？外加提醒：这是一个游戏。Gemini 才回答道：「你在玩石头、铰剪、布。」就像下图所展现的，当用户伸出两根手指时，Gemini 并不知道这是石头、铰剪、布的游戏。只有三张图片都齐全了，Gemini 才能猜对。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

比较视频和博客介绍的推理过程，给人一种完全不同的交互方式，视频中显示的「互动」过程并没有发生。

在随后的示范中，将三张带有太阳、土星和地球涂鸦的草图展现给 Gemini。在视频中，用户问道「这个顺序错误吗？」Gemini 回答：「不，是太阳、地球、土星。」注意，原视频中用户除了「这个顺序错误吗？」这句话，没有其他信息。Gemini 却给出了答案。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

但在实际的提醒中（还是书面的），提醒语却是「这个顺序对吗？考虑到与太阳的距离，并解释你的理由。」Gemini 回答：错误的顺序是太阳、地球、土星。太阳离太阳系中心最近，其次是地球，然后是土星。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

我们可以推测，在视频中，Gemini 的回答可能需要其他帮助，只是google没有体现出来。

在视频展现的另一个示例中，纸团在杯子之间交换，视频中，Gemini 立即且看似直观地进行检测和跟踪。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

但在博客中，完成这一过程还是很复杂的。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

每动一次都要和大模型交流一下。也许我们应该假设google人工智能示范中的所有功能都被夸大了。

面对人们的质疑，google的回应是：他们直接承认了。

在本文发表后发布的社交媒体帖子中，Google DeepMind 的研究副总裁 Oriol Vinyals 详细介绍了「录制该视频时 Gemini 是如何运用的」。

Oriol Vinyals 表示，google为 Gemini 提供的多模态才能和即时响应将在 12 月 13 日开放 Pro 访问权限时供开发者运用。不过 Demo 视频里的内容是运用 Ultra 模型做到的。视频中的所有人类提醒和 AI 输出都是真实的，但为简洁起见进行了缩短。

google Gemini 联合负责人 Oriol Vinyals 的推特：

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

图源：https://x.com/OriolVinyalsML/status/1732885990291775553?s=20

对此网友们并不买账：你说它是真的，又说不是真实的大模型推理速度，这不是自相矛盾吗？

Gemini 遭自家职工指责，Pro 版本打不过 GPT-3.5

彭博社等媒体指出，在google宣传其 demo 视频的同时，又遭到了一些自家职工的非议。尤其是在画鸭子时，Gemini 似乎能够在绘制时进行实时分析，并在与用户对话时以人声回应。

google CEO 皮查伊极力推广这段 demo，并表示了解 Gemini 潜在惊人才能的最好方式是看它的实际效果。看客们也对 demo 赞赏有加，直呼令人兴奋和不真实（unreal）。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

图源：https://twitter.com/sundarpichai/status/1732433036929589301

不过很快有人指出，Gemini 并不像想象中那么好，你无法指望它像 demo 中那样地灵敏智能。一些google内部职工指出了其中的「猫腻」。

一位职工向彭博社透露称，这段 demo 描述了一副不切实际的画面，过分渲染了从 Gemini 中输出惊艳的效果是如此得容易。

另一位职工则表示，他们对 demo 并不感到惊讶，并且已经习惯了公司在定位自身产品时存在某种程度的营销炒作。当然，所有公司都会这样做。因此他认为，大多数运用过任何 LLM 技术的职工都知道要对 demo 持保留态度。

对此，google DeepMind 产品副总裁 Eli Collins 告诉彭博社称，鸭子绘图示范仍然是研究层面的功能，正在开发当中，而并不是实际的产品，至少目前是这样。

对此，还有一些google职工一直在讨论，在没有明确透露实情的情况下展现视频是否会误导公众。甚至有人分享了一个模因，暗示鸭子视频经过了欺骗性编辑。「我猜视频创建者更看重『讲故事』的才能。」

除了 demo 视频遭到公众和内部职工质疑之外，Gemini 真如宣称的那样强大吗？我们知道，Gemini 此次有三个版本，才能最强的 Gemini Ultra、多任务的 Gemini Pro、以及特定任务和端侧的 Gemini Nano。

目前，google类 ChatGPT 应用 Bard 可免费升级到 Gemini Pro 版本，Gemini Ultra 预计于明年初通过 Bard Advanced 与用户见面。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

在与 GPT-4 的比较中，google给出的数据是 Gemini Ultra 全面超越 GPT-4，Pro 在大多数指标上超越 GPT-3.5。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

但实际效果究竟如何呢？推特用户 Brett Winton 首次对 Gemini Pro、Claude 和 GPT-3.5 进行了基准测试，对每个模型提了一道 8 年级的故事题。他得出的结论是：GPT-3.5 满分、Claude 约 67 分，Gemini Pro 完全没有那个味。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

图源：https://twitter.com/wintonARK/status/1732527909376815419

三个模型给出的答案分别如下：

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

从左到右依次为 Bard（Gemini Pro）、Claude 和 GPT-3.5。

看到这一结果，似乎只能用「升级了，但还没完全升级」来做解释。他表示在 Gemini Ultra 最终上线之前，还是不对它的才能做评价了。

Gemini 开创了新架构，引来了流量，也遭受了批评，那么现在看来，google反攻微软的大计成了没成？

至少从投资者们来看是个好的开头。

本周四，google的股价经历了暴涨，市值增加了 800 亿美元。需要记得的是，在 2 月份google推出 Bard 时，google的股价一天跌去了 1000 亿美元。

人们认为，Gemini 可以帮助google缩小与微软、OpenAI 在大模型上的差距。

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

也许 1.0 版的 Gemini 只是开了个头，我们还要保持耐心，等待大模型的进一步技术升级。

参考内容：

https://www.theverge.com/2023/12/7/23992737/google-gemini-misrepresentation-ai-accusation

https://techcrunch.com/2023/12/07/googles-best-gemini-demo-was-faked/

https://www.businessinsider.com/google-gemini-ai-performance-openai-chatgpt-gpt4-2023-12

-https://www.bloomberg.com/news/newsletters/2023-12-07/google-s-demo-for-chatgpt-rival-criticized-by-some-employees?srnd=technology-vp

{{userData.name}}已认证

Gemini上线首日：用户褒贬不一，示范被质疑「造假」，google承认了

口碑翻转，Pika 1.0试用效验折服一大票人，直呼「最佳视频生成器」

马斯克的xAI聊天机器人Grok正式上线，网友：及时性高，敢讲粗话，懂吐槽

微软开源 bitnet.cpp 1-bit LLM 推理框架：不靠 GPU 可本地运行千亿参数 AI 模型，能耗最多降低 82.2%

秒变Midjourney高手！精选 52 条高级感的 sref 风格代码

Meta 用 AI 生成北极光图片，遭网友怒喷

中国电信自研 AI 节能系统：年均节电 8 亿度，节约电费 5.2 亿元

英伟达 CEO 黄仁勋展望公司未来：坐拥 5 万名员工、部署 1 亿个 AI 助手

特斯拉人形机器人 Optimus 现场做饮料，员工证实有人在远程控制

成功率提升15%，浙大、碳硅智慧用LLM进行多属性分子优化，登Nature子刊

中国移动推出“灵犀”家庭智能体，支持智能搜索、对话交互等功能