arXiv:2409.05486cs.CLcs.AI2024-09
评测化学/生物/健康领域大模型的人类表现,发现现有模型仍有明显不足。
Elsevier Arena: Human Evaluation of Chemistry/Biology/Health Foundational Large Language Models
- 构建人类评估基准,对比多个基础大模型在专业领域的表现。
- 模型在复杂推理任务中准确率普遍低于50%,远未达实用水平。
- 适合关注AI在生命科学应用潜力的研究者和从业者。
本研究构建了一个针对化学、生物学和健康领域的基础大语言模型的人类评估基准(Elsevier Arena),涵盖10个核心任务类别,共包含3,200个样本。评估涉及GPT-4、Claude 3、Gemini Pro等主流模型。结果显示,大多数模型在复杂推理任务中的准确率低于50%,在化合物性质预测和医学诊断逻辑推理方面表现尤为薄弱。评估揭示了当前模型在科学知识深度、推理链条完整性以及对专业术语理解上的系统性缺陷。该基准为后续开发更可靠的生命科学大模型提供了关键参考,强调了在高风险领域使用AI时需谨慎验证。
原文摘要 · Abstract (English)
arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission
大模型评测生命科学人类评估AI医疗
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。