大模型评测【行业应用篇】教育行业|「小学学科考试」大模型应用实测

评测结果,如图所示:

公众号:大模型评测EasyLLM

图片

【评测结论】:阿里系qwq-plus-2025-3-5(new)得分第一,豆包第二,qwq-32bn(ew)第3,腾讯系、百度系占据第4和第5名,其中qwq-32bn(ew)是前五中唯一的开源模型。

各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

【模型数量】:110个大模型(国内外,开源、闭源的大模型)

【评测维度】:「小学学科-试题答题」类目的5个学科的择题题集评测

  1. 小学英语

  2. 小学数学

  3. 初中语文

  4. 小学道德与法治

  5. 小学科学

【错题集】:请前往以下链接查阅👇

各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

大模型评测EasyLLM,目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测(详情可回顾以下链接👇),接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评,看看谁是各个垂直领域的最强打工人!宝子们看好哪个大模型可以在哪些岗位胜任最强牛马?或者想评测大模型的哪方面能力?评论区留言,有求必测,一一公布结果!有评测样本、有图有真相!

  往期文章  

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
红包 添加红包
表情包 插入表情
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值