← 資訊首页 | 货源大厅

前沿模型一年跃升30分,但基准测试测对了吗?

2026-09-10 · 来源:{'name': 'Unite AI', 'url': 'https://www.unite.ai/human-aligned-ai-task-alignment-benchmarks-dependence/'}

前沿模型一年跃升30分,但基准测试测对了吗?

斯坦福2026年AI指数显示,前沿模型在Humanity's Last Exam上的得分一年内跳升约30个百分点,这引发了关于任务导向型基准能否衡量真正重要之处的质疑。

AI排行榜已进入近乎持续洗牌的状态:每隔几个月就有一款新模型问世,并一次次重排名次。斯坦福2026年AI指数报告量化了这种洗牌速度——报告发现,前沿模型在Humanity's Last Exam上的得分一年内提升约30个百分点,而这一基准从设计之初就是专门用来为难AI的。过去需要多年研发才能实现的能力飞跃,如今几个月内便能兑现。

在行业内部,每一个新的高分都被当作AI正在变强的证据。文章作者并不否认进步的真实性,也承认这些系统在其设计目标上表现出色。真正的担忧在别处:这些分数究竟证明了什么,以及其背后的基准是否在衡量真正该衡量的东西。

这种担忧的关键,在于文章对任务导向评估与人类导向评估的区分。Humanity's Last Exam的构建初衷就是让机器觉得难,这意味着不断攀升的分数衡量的是模型应对为其量身打造的人为挑战的能力——而非它们对最终使用它们的用户有多大用处。


萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅