搜索 基准

找到 5 个相关工具

I

IFEval

AI模型评测

Google的可验证指令遵循评测,减少主观裁判误差

开源 英文
直达官网
M

MT-Bench

AI模型评测

多轮问题加LLM裁判,评估对话与指令遵循能力

开源 英文
直达官网
MMLU

MMLU

AI模型评测

MMLU以大规模多任务语言理解测试著称,覆盖数十个学科,是英文模型能力的重要标尺。

免费 英文
直达官网
FlagEval

FlagEval

AI模型评测

智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。

免费 中文
直达官网
LLMEval3

LLMEval3

AI模型评测

复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。

免费 中文
直达官网