C
CLiB中文评测
AI模型评测
中文语言理解测评基准,聚焦中文语义与知识能力
免费
中文
直达官网
找到 12 个相关工具
中文语言理解测评基准,聚焦中文语义与知识能力
上海AI实验室司南体系,提供大模型全维度开放评测
综合数学推理与视觉理解的多模态基准
以长度控制胜负率快速比较指令遵循模型
把提示、模型与评测放进团队协作流水线
H2O Elo评级机制给大模型打分,可输出相对排名,适合快速建立模型强弱的直观认识。
智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。
复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。
上海AI实验室的OpenCompass提供开放评测体系和模型榜单,支持复现与多维度横向比较。
斯坦福HELM强调多维度评测模型,同时考察准确性、鲁棒性、公平性、效率等,避免单分论英雄。
MMBench覆盖图像理解等多模态能力,包含中文题目,适合检验多模态模型的中文表现。
Chatbot Arena让用户盲选匿名模型回答,靠众包投票反映真实主观偏好,结果常被引用。