AI在线 AI在线

GDPval

OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude

AI 的颠覆近在眼前,奥特曼不是乱说的。 时至今日,我们已见过太多大模型的评估方法。 比如涵盖了数十个学科的考试式问题的学术基准 MMLU,还有 SWE-Bench (软件工程错误修复任务)、 MLE-Bench (机器学习工程任务,例如模型训练和分析)和 Paper-Bench (对研究论文的科学推理和评论)这类更具应用性的评估,以及基于市场的评估 SWE-Lancer。
9/27/2025 8:46:00 PM
机器之心

OpenAI 最新基准测试显示 GPT-5 在多个行业中逐渐逼近人类专家

近日,OpenAI 推出了一项新的基准测试,旨在评估其人工智能模型在各行业与人类专业人士的表现差异。 这项名为 GDPval 的测试,是 OpenAI 对其人工智能系统在经济价值工作中是否能超越人类的重要探索。 根据 OpenAI 的说法,GPT-5模型与 Anthropic 的 Claude Opus4.1模型在某些领域的工作质量已经接近行业专家。
9/26/2025 3:01:13 PM
AI在线
  • 1