幻觉评估

使用人工智能幻觉评估图像真实感

译者 | 朱先忠审校 | 重楼引言最近，俄罗斯的一项新研究提出了通过一种非常规方法来检测不切实际的人工智能生成的图像。这种方法的主要思想是：不是通过提高大型视觉语言模型（LVLM）的准确性，而是通过有意利用它们产生幻觉的倾向。这种新方法使用LVLM提取有关图像的多个“原子事实”，然后应用自然语言推理（NLI）系统地衡量这些陈述之间的矛盾，从而有效地将模型的缺陷转化为检测违背常识的图像的诊断工具。

4/9/2025 8:23:49 AM

朱先忠

大模型幻觉率排行：GPT-4 3%最低，谷歌Palm竟然高达27.2%

排行榜一出，高下立见。人工智能发展进步神速，但问题频出。OpenAI 新出的 GPT 视觉 API 前脚让人感叹效果极好，后脚又因幻觉问题令人不禁吐槽。幻觉一直是大模型的致命缺陷。由于数据集庞杂，其中难免会有过时、错误的信息，导致输出质量面临着严峻的考验。过多重复的信息还会使大模型形成偏见，这也是幻觉的一种。但是幻觉并非无解命题。开发过程中对数据集慎重使用、严格过滤，构建高质量数据集，以及优化模型结构、训练方式都能在一定程度上缓解幻觉问题。流行的大模型有那么多，它们对于幻觉的缓解效果如何？这里有个排行榜明确地对比了

11/15/2023 10:46:00 AM

机器之心

资讯热榜

阿里推出 AI 医学助手 App“氢离子”：收录千万级核心期刊文献，还可查疾病、找药品 OpenAI 董事会主席：如果你想快速烧掉百万美元，就开发自己的 AI 模型吧 Meta 被指控盗用 2000 余部成人影片训练 AI，或面临 3.5 亿美元天价赔偿刷新无监督异常检测上限！首提「匹配代价滤波for异常检测」范式 | ICML'25 行业首个 100% 开源的企业级智能体，京东云开源 JoyAgent 微软 Copilot 官方形象上线，AI 聊天更生动业界首个，腾讯混元 3D 世界模型正式发布并开源 AI和云基础设施初创企业E2B如何成为88%的财富100强企业的必备选择

标签云

人工智能 AI OpenAI AIGC 模型 ChatGPT DeepSeek AI绘画谷歌机器人数据大模型 Midjourney 开源智能用户 Meta 微软 GPT 学习技术图像 Gemini AI创作马斯克论文智能体 Anthropic 英伟达代码算法训练 Stable Diffusion 芯片蛋白质开发者腾讯生成式 LLM 苹果 Claude 神经网络 AI新词 3D 研究机器学习生成 AI for Science Agent xAI 计算人形机器人 Sora AI视频 GPU AI设计百度华为搜索大语言模型工具场景字节跳动具身智能 RAG 大型语言模型预测深度学习伟达视觉 Transformer AGI 视频生成神器推荐亚马逊 Copilot DeepMind 架构模态应用

幻觉评估

使用人工智能幻觉评估图像真实感​

大模型幻觉率排行：GPT-4 3%最低，谷歌Palm竟然高达27.2%

使用人工智能幻觉评估图像真实感