I
IFEval
AI模型评测
Google的可验证指令遵循评测,减少主观裁判误差
开源
英文
直达官网
找到 5 个相关工具
Google的可验证指令遵循评测,减少主观裁判误差
多轮问题加LLM裁判,评估对话与指令遵循能力
MMLU以大规模多任务语言理解测试著称,覆盖数十个学科,是英文模型能力的重要标尺。
智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。
复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。