2026-09-17 · 来源:{'name': 'deep-www.unite.ai-p12', 'url': 'https://www.unite.ai/scale-ai-reports-rok-fortress-findings-on-multilingual-ai-safety/'}

该双语基准由Scale AI与韩国AI安全研究院(Korea AI Safety Institute)联合打造,评测显示:扎根韩语语境的提示词在几乎全部14款前沿模型上都呈现更低的实测危害。
Scale AI于2026年9月17日发布ROK-FORTRESS的评测结果。该基准是一套英韩双语对抗性安全基准,由Scale AI与韩国AI安全研究院(Korea AI Safety Institute)联合开发。其核心结论是:以韩文撰写、扎根韩国语境的提示词,在参与评测的14款前沿模型中几乎全线对应更低的实测危害。值得注意的是,这一规律在整个前沿模型评测阵营中保持一致,而非个别模型的孤立行为——这正是该基准最重要的发现。
基准设计是ROK-FORTRESS区别于行业惯例之处。大多数多语言安全基准只是把固定提示词翻译成另一种语言再测量模型回应——这种做法保留了字面措辞,却剥离了本地语境。Scale AI与韩国AI安全研究院则围绕一套'创译矩阵'(Transcreation Matrix)构建该基准,报告将其与'翻译优先'的多语言测试相对照:让对抗性提示词与韩国语境对齐,而非把固定的英文提示词机械译成韩文。
为何重要:这些发现表明,实测危害并非语言无关。如果前沿系统在韩语、扎根本地语境的提示词上表现出系统性更低的实测危害,那么基于英文评测得出的安全分数,可能无法完整刻画同一模型面对韩语用户时的实际行为。对于在英韩双语环境中部署前沿模型的机构而言,这项研究为其提供了在常规英文安全审计之外开展本地化对抗测试的充分理由。
与韩国AI安全研究院的联合开发,也让这项工作置身于官方安全评估体系之中——一个国家级AI安全机构与一家商业评测服务商共同撰写对抗性基准,本身就不同寻常。随着14款前沿模型完成评测且跨模型结果高度一致,ROK-FORTRESS为多语言安全研究补充了一个双语、语境敏感的数据点。报告指出,这一领域的研究过去严重依赖固定提示词的直接翻译。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅