搜索 评测

找到 12 个相关工具

M

MathVista

AI模型评测

综合数学推理与视觉理解的多模态基准

开源 英文
直达官网
A

AlpacaEval

AI模型评测

以长度控制胜负率快速比较指令遵循模型

开源 英文
直达官网
H

Humanloop

AI提示指令

把提示、模型与评测放进团队协作流水线

Freemium 英文
直达官网
H2O EvalGPT

H2O EvalGPT

AI模型评测

H2O Elo评级机制给大模型打分,可输出相对排名,适合快速建立模型强弱的直观认识。

免费 英文
直达官网
FlagEval

FlagEval

AI模型评测

智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。

免费 中文
直达官网
LLMEval3

LLMEval3

AI模型评测

复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。

免费 中文
直达官网
OpenCompass

OpenCompass

AI模型评测

上海AI实验室的OpenCompass提供开放评测体系和模型榜单,支持复现与多维度横向比较。

免费 中文
直达官网
HELM

HELM

AI模型评测

斯坦福HELM强调多维度评测模型,同时考察准确性、鲁棒性、公平性、效率等,避免单分论英雄。

免费 英文
直达官网
MMBench

MMBench

AI模型评测

MMBench覆盖图像理解等多模态能力,包含中文题目,适合检验多模态模型的中文表现。

免费 中文
直达官网
Chatbot Arena

Chatbot Arena

AI模型评测

Chatbot Arena让用户盲选匿名模型回答,靠众包投票反映真实主观偏好,结果常被引用。

免费 英文
直达官网