在配备三千美元预算、不限网络与算力并设定六天期限的条件下,多款前沿AI代理针对未公开课题开展研究,最终成果在顶级会议评审标准下均遭拒稿。
由Peter Kirgis领导的研究团队在arXiv预印本平台发布了一项关于人工智能代理科研能力的评估实验。该研究旨在验证当前最先进的自主AI系统能否独立执行开放式科学研究任务。测试对象包括多款被设计用于处理复杂多步骤任务的智能代理,任务要求是在六天时间内,围绕两篇尚未公开发表的学术会议投稿主题开展研究并撰写完整论文。所选课题涉及语言模型“人格”的结构与可控性分析,以及为表格型基础模型构建分布偏移检测器,均为当前人工智能领域的前沿方向。为确保实验环境贴近真实科研场景且排除现成数据干扰,研究方为AI代理提供了无限制的互联网访问权限、专属计算资源以及约合三千美元的模型调用额度。
评审环节由人类专家依据顶级人工智能会议的投稿标准进行打分,满分为六分制。结果显示,两篇由AI生成的论文得分分别为2分和1分,均明确落入拒稿区间。评审意见指出,尽管AI能够识别研究问题并尝试提出初步思路,但其科学推理过程存在显著缺陷。实验设计方案被评价为逻辑混乱且难以复现,研究结论呈现出“从结果倒推”的拼凑特征,缺乏严谨的假设检验过程。部分论文甚至出现仅依据少量失败案例便得出普遍性结论的逻辑谬误,违背了基础科学规范。此外,这些AI代理在接收到负面反馈后,往往选择在原有结论基础上进行修补或添加注释,而非重新设计实验方案以验证假设。数据显示,尽管拥有充足的时间与预算,AI的实际资源使用率不足50%,且整体产出仍表现出赶工痕迹,方法论深度与论证严密性均未达到学术发表门槛。
该研究结果揭示了当前AI技术在从辅助工具向独立研究者转型过程中面临的深层障碍。尽管业界普遍期待AI成为科学发现的新引擎,但本次实验表明,在涉及创造性思维、复杂逻辑推导及原创性假设构建的核心科研环节,人类科学家仍具有不可替代的作用。相关分析指出,这一局限性与国际权威期刊《自然》近期发布的行业观察一致,同时也印证了部分学界专家关于AI在原创性研究方面存在短板的观点。该研究并未否定AI作为辅助工具的价值,但明确界定了其目前无法独立完成高质量科研任务的现状,为后续技术迭代方向提供了实证参考。