找到 3 个相关工具
智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。
复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。
H2O Elo评级机制给大模型打分,可输出相对排名,适合快速建立模型强弱的直观认识。