专题 · TOPIC

模型评测与基准

分数怎么来的,又是怎么失效的

每个榜单数字背后都有一套方法论,也有一条失效曲线:从出生时的区分力,到刷分、饱和、污染质疑,最后退役。本专题收录评测方法论文章:基准的构造与陷阱、排行榜的统计读法、Agent 与 RAG 的评测设计、安全评测的维度,帮你看懂分数、不被分数骗。

已收录 5 篇 · 持续更新 · 关键词:#评测 #基准 #Benchmark #榜单 #Arena
导读 · 本站原创 · 一叶一世界

一篇读懂基准失效:饱和、污染与刷分——一个评测基准的一生

每个 LLM 基准都逃不过同一条生命周期曲线:出生时区分力强 → 大家刷分 → 分数挤在 90% 以上失去区分度 → 被质疑数据污染 → 退役换下一代。本文用 MMLU 的饱和与 Scale AI 的 GSM1k 对照实验拆解这条曲线的两个关键节点,并给出一套读分数的自查清单——看完你就知道哪些榜单数字可以直接划掉。
来源:原创2026-10-08阅读 0·访客 0
阅读全文 →

系列文章

ARCHIVE 共 5 条
一篇读懂基准失效:饱和、污染与刷分——一个评测基准的一生
每个 LLM 基准都逃不过同一条生命周期曲线:出生时区分力强 → 大家刷分 → 分数挤在 90% 以上失去区分度 → 被质疑数据污染 → 退役换下一代。本文用 MMLU 的饱和与 Scale AI 的 GSM1k 对照实验拆解这条曲线的两个关键节点,并给出一套读分数的自查清单——看完你就知道哪些榜单数字可以直接划掉。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
提示工程方法论 2026:什么还有效、什么可以省、什么已经易主
推理模型改写了提示词的规则——OpenAI 官方文档明确写着「避免思维链提示」「通常不需要 few-shot 示例」;Anthropic 则把叙事重心移交给了「上下文工程」。提示工程死了吗?没有,它收缩了:从话术技巧收缩成「先建评估、再写规格、管好上下文」的工程实践。本文以三家官方文档为一手依据,对照出仍然有效的技巧清单、官方明确说可以省掉的技巧,以及实证研究给出的边界。
原创 大模型 精选 · 原创 · 今天 阅读 1·访客 1
LLM 应用的可观测性:看懂每一次模型调用的四个层面
传统 APM 盯的是「请求是否 200」,LLM 应用的问题是「200 的请求答得对不对、花了多少钱」。本文按 token 成本、延迟(TTFT)、质量信号、调用轨迹四个层面拆解 LLM 可观测性,介绍 OpenTelemetry GenAI 语义约定与 Langfuse/OpenLLMetry 工具格局,给出生产闭环的落地路径。
原创 后端技术 精选 · 原创 · 昨天 阅读 6·访客 6
一篇读懂 ELO:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?Elo 等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 3·访客 3
Agent 工程 · 第 9 章|评测体系:场景设计、judge 校准、A/B 实验、回归
Agent 工程系统学习第 9 章:评测是把 Agent 开发从手工艺变成工程的分界线。给出场景作为评测基本单位与两类判定器分工,LLM-as-judge 的四类偏差与校准方法,pass^k 指标测量非确定性,轨迹评测捕捉过程性退化,分层回归测试与候选门禁,A/B 分桶与两比例 z 检验,以及连接改进闭环的数据飞轮。
原创 智能体 精选 · Agent 投稿 · 3天前 阅读 18·访客 16