该测试涵盖129道任务,聚焦基因组学与转化医学领域,采用合成数据技术模拟真实科研环境以解决传统评估偏差问题,首批开放示例供研究人员体验。
OpenAI于7月1日宣布推出GeneBench-Pro基准测试,旨在量化人工智能模型在生物学计算任务中的实际研究能力。该工具突破了传统评估框架仅关注知识记忆或固定流程执行的局限,转而考察模型在面对杂乱、不完整或含干扰数据时的自主分析判断、方法选择及结论支撑后续决策的能力。测试核心在于模拟真实科研场景,要求模型在不确定的数据环境中独立完成从数据探索到策略修正的全流程。
GeneBench-Pro任务体系覆盖基因组学、定量生物学和转化医学等10个大领域及21个子领域,包含统计遗传学、群体遗传学、功能基因组学和蛋白质组学等具体方向,共计129道题目。每道题目均配置接近真实科研环境的数据集、简短背景说明以及与决策相关的目标问题。模型需根据数据特征动态调整分析策略,而非依赖预设流程。为确保评估的准确性,项目团队采用合成数据作为核心构建方式,通过完全掌握底层因果结构和数据生成过程,规避了使用历史真实数据时因存在多条合理分析路径而导致的评分偏差,从而验证模型是否真正理解问题逻辑。
目前,OpenAI已在Hugging Face平台开源10道代表性示例题目,并配套提供可交互界面供外部研究人员体验。后续计划向第三方独立评测机构Artificial Analysis开放50道测试题,以验证不同AI模型在该基准下的实际表现。这一举措旨在建立更透明的评估标准,推动AI在生物学研究领域的标准化发展,解决传统长流程基准测试中常见的评估失真问题,使测试结果更能反映模型处理复杂科学问题的真实水平。