这一广场式测评由B站创作者按真实工作流、专业应用和趣味场景自主出题,覆盖代码、推理、协作与知识等方向;首轮上百模型比较后,GPT-6 Astra暂居第一,前五名国产占三席。
B站于9月20日上线「AI无限竞技场」测评榜,把站内创作者的大模型体验内容组织为可更新排名。首轮结果显示,GPT-6 Astra在10位UP主相关测评中暂列第一,并以更多登顶记录排在GLM-5.3之前;前五名中有三个为国产品牌。
该项目不以统一跑分为主要依据,而是聚合不同分区UP主围绕真实工作流、专业软件和脑洞任务设置的自主题目,在同一题目下对比模型输出差异。内容覆盖编程、逻辑推导、协同写作与知识问答等方向,参与比较的对象包括DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy与MiniMax等主流模型。榜单面向全站创作者持续报名,名次随新测评不断刷新。
这种社区化评测建立在B站已有AI知识内容消费基础上:过去一年平台AI相关内容观看时长增加72%,平均每月观看此类内容的用户超过1.9亿,模型发布、讨论、试用、求助和共建形成连续生态。相比固定题库或标准化分数,创作者主导的实战题型更接近使用场景,但也依赖个体选择和应用语境,因而提供的是参考性比较而非唯一结论。