B站上线“AI无限竞技场”:上百模型真机实测,GPT-6Astra暂居榜首

0 阅读

B站搞了个新擂台:让模型在真实任务里打一场

B站最近上线了一个叫“AI无限竞技场”的测评榜单,名字听着有点中二,但玩法确实和以往的跑分榜不太一样。它不靠标准数据集打分,而是把上百个大模型扔进UP主们的真实工作流里,看谁更能扛住实际任务的考验。

首轮测试由10位来自不同分区的UP主操刀,涵盖编程、逻辑推理、多轮协作、专业知识调用等场景。有人拿模型写游戏脚本,有人让它辅助科研文献综述,还有人测试它能不能帮自己剪视频、回私信、甚至策划一期视频选题。这些任务没有统一评分标准,但胜在“真用”——不是实验室里的理想输入,而是带着错别字、模糊指令、上下文跳跃的真实需求。

结果出炉,GPT-6Astra拿下综合第一,同时是被最多UP主评为“最好用”的模型。排在第二的是智谱的GLM-5.3,差距并不大。前五名里,除了GPT-6Astra和Claude,其余三个席位都被国产模型占据:千问、DeepSeek和Kimi各有亮点。值得注意的是,像豆包、MiniMax、Hy等也在特定任务中表现突出,比如豆包在短视频文案生成上得分很高,而Hy在数学推导环节被一位理工科UP主点名表扬。

不拼参数,拼“能不能干活”

传统的大模型排行榜,比如Hugging Face的Open LLM Leaderboard或者LMSYS的Chatbot Arena,主要依赖标准化测试或匿名对战投票。它们有价值,但有个问题:和普通用户的日常使用脱节。你可能看到某个模型在MMLU(大规模多任务语言理解)上拿了高分,但一到写Python脚本就卡壳,或者听不懂“帮我把这段话改得更毒舌一点”这种非正式指令。

ScreenShot_2026-09-20_141201_653.png

B站的思路是反过来:先有任务,再看模型表现。UP主们自己出题,自己打分,甚至公开录屏展示整个交互过程。比如一位做前端教学的UP主让所有模型根据设计稿生成React组件,不仅要代码能跑,还得结构清晰、注释到位;另一位历史区UP主则测试模型能否基于《资治通鉴》片段推理出某场政变的深层动因,并避免现代价值观的强行代入。

这种测评方式天然带有“场景偏置”——不同UP主关注点不同,结果没法简单加权平均。但恰恰是这种“不统一”,反而更接近真实世界。毕竟没人会拿着同一份考卷去问所有AI,大家关心的永远是“在我这个活儿上,它行不行”。

国产模型正在贴身肉搏

从首轮结果看,国产大模型已经不再是陪跑角色。GLM-5.3在中文长文本理解和复杂指令遵循上表现稳定;千问在多模态任务(比如根据草图生成产品描述)中优势明显;DeepSeek则在代码生成和调试环节多次被提及,尤其擅长处理Go和Rust这类相对小众但工程要求高的语言。

有意思的是,一些海外模型在中文语境下反而“水土不服”。比如Gemini在英文技术问答中反应迅速,但面对带方言色彩的提问(如“咋整这bug啊?”)时常误解意图;Claude虽然逻辑严谨,但在需要“脑洞”或“网感”的任务里显得过于保守,被一位生活区UP主吐槽“像个认真但无趣的实习生”。

这种差异背后,其实是训练数据和优化目标的不同。国产模型普遍在中文互联网语料上投入更多,对B站、知乎、小红书等平台的语言风格更熟悉;而海外模型即便支持中文,底层思维模式仍偏向英文世界的表达习惯。

为什么是B站?

B站押注这个榜单,不是临时起意。数据显示,过去一年平台AI相关内容的总观看时长同比增长72%,月均观看AI内容的用户超过1.9亿。这里早已形成一个活跃的AI讨论社区:有人发模型对比视频,有人直播调参过程,还有人专门做“AI翻车合集”来提醒大家别盲目信任输出结果。

更重要的是,B站的用户既是消费者,也是生产者。很多UP主本身就是开发者、设计师、研究员或内容创作者,他们对工具的需求非常具体。当模型迭代速度越来越快——有些公司甚至每周发新版——传统的静态排行榜根本追不上节奏。与其等第三方机构慢悠悠出报告,不如让每天和模型打交道的人直接说话。

“AI无限竞技场”目前向全站UP主开放报名,只要提交实测视频并标注所用模型和任务类型,就有机会被纳入榜单计算。B站表示后续会引入更多维度,比如响应速度、API稳定性、成本效益等,但核心原则不变:以真实使用为尺,而非理论分数

榜单之外,更值得看的是“怎么用”

比起排名本身,这些实测视频里藏着更多干货。比如有UP主发现,GPT-6Astra在处理模糊需求时会主动追问细节,而不是瞎猜;而GLM-5.3在长上下文任务中能更好保持信息一致性,适合写万字分析稿。还有人测试了模型在连续对话中的“记忆”能力——能否记住前几轮提到的项目名称、偏好设置等,这对实际工作效率影响很大。

这些细节很难被量化成一个数字,但对用户来说至关重要。一个模型可能在基准测试里落后几分,但在你的工作流里就是更顺手。反过来,某个“冠军”模型如果API贵得离谱或者响应慢到让人想砸键盘,实际价值也会大打折扣。

B站没打算取代专业评测机构,但它提供了一个补充视角:当技术讨论下沉到具体场景,胜负往往不在参数表里,而在一行行代码、一段段文案、一次次真实的交互中。

实时更新,但别太当真

需要提醒的是,这个榜单是动态的。随着更多UP主加入、新模型发布、旧模型升级,排名随时可能变化。GPT-6Astra现在领先,不代表一个月后还是第一。而且不同任务权重不同,不能简单说“XX模型全面碾压”。

但它至少做对了一件事:把评测从黑箱里拉出来,变成一场公开、可验证、带烟火气的实验。你可以在视频评论区看到观众追问“为什么不用这个prompt试试”,UP主也会回复“下次安排”。这种互动本身,就是社区生态的价值。

未来,或许会有更多平台效仿这种“创作者驱动”的评测模式。毕竟,在AI已经进入日常工具箱的今天,用户要的不是“最强模型”,而是“最适合我的那个”。而答案,往往藏在真实使用的一线反馈里。