大模型评测【综合能力篇】|8大领域、107个大模型实测横评综合能力排行榜04.01

本期汇总各个大模型综合能力的评测数据,综合能力得分类目为:医疗、教育、金融、法律、行政公务、心理健康、推理与数学计算、语言与指令遵从共8个领域得分的平均值。同时,大模型的通用能力、垂直行业应用等领域不同类型、不同阶段、不同维度的评测,都在爆肝输出中,敬请期待。

完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

我们的目标是:

通过评测为大家透视化呈现,各个大模型的能力边界,以支持大家高效使用!

以下是本期107个大模型的评测综合得分和排名,以及涉及推理、商用、开源、价格、参数量等不同细分类型和维度的大模型排行榜。目录如下:

一、综合能力排行榜(图)

1.1 推理类模型排行榜(表)

1.2 商用大模型排行榜(含开源模型的付费API)

(1)输出价格30元及以上(表)

(2)输出价格5~30元(表)

(3)输出价格1~5元(表)

(4)输出价格1元以下(表)

1.3 开源大模型排行榜

(1)5B以下(表)

(2)5B~20B(表)

(3)20B以上(表)

完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

一、综合能力排行榜(图)

绿色(闭源),蓝色(开源)

图片

完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

1.1 推理类模型排行榜

<

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值