大模型评测【行业应用篇】教育行业｜「高考答题」大模型应用实测横评03.28

原创于 2025-04-03 14:10:27 发布 · 998 阅读

·

30

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#高考 #AI大模型评测 #大模型评测 #大模型行业应用评测 #教育大模型应用评测 #高考答题大模型评测 #大模型实测横评

大模型评测【行业应用篇】专栏收录该内容

14 篇文章

订阅专栏

教育行业大模型应用评测，往期文章：小学至高中3个阶段，9个学科，110个大模型应用实测横评！https://blog.youkuaiyun.com/easyllm/article/details/146845813?spm=1011.2415.3001.10575&sharefrom=mp_manage_link

教育行业｜细分类目01「高考答题」评测结果，如图所示：

【评测结论】：deepseek得分第一，腾讯系混元系列模型、阿里系qwq系列模型分列2-5名，其中deepseek和qwq-32b（new）是前五中唯二的开源模型。

各科目完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

【模型数量】：110个大模型（国内外，开源、闭源的大模型）

【评测维度】：「高考-试题答题」类目的8个学科的择题题集评测

高考生物
高考语文
高考数学
高考物理
高考化学
高考地理
高考政治
高考历史

【错题集】：请前往以下链接查阅👇

各科目完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

大模型评测EasyLLM，目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测（详情可回顾以下链接👇），接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评，看看谁是各个垂直领域的最强打工人！宝子们看好哪个大模型可以在哪些岗位胜任最强牛马？或者想评测大模型的哪方面能力？评论区留言，有求必测，一一公布结果！有评测样本、有图有真相！

往期文章

医疗行业｜110个大模型，12个分类、18科目应用实测！

Llama/Qwen/DeepSeek开源之争——CLiB开源大模型排行榜03.04

那些免费的大模型API效果到底好不好？——CLiB大模型排行榜

参数量5B以下端侧大模型03.13——CLiB大模型排行榜

DeepSeek｜到底强在哪？这个评测一目了然！

关于大模型评测EasyLLM

最全——全球最全大模型产品评测平台，已囊括203个大模型
最新——月更各个大模型各项能力指标评测，输出排行榜
最方便——无需注册/梯子，国内外各个大模型可一键评测
结果可见——所有大模型评测的方法、题集、过程、得分结果，可见可追溯！
错题本——百万级大模型错题本

大模型评测EasyLLM目前已囊括187个大模型，覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型，以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。不仅提供能力评分排行榜，也提供所有模型的原始输出结果！

完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

评论

成就一亿技术人!

拼手气红包6.0元

还能输入1000个字符

添加红包

插入表情

表情包

代码片

HTML/XML
objective-c
Ruby
PHP
C
C++
JavaScript
Python
Java
CSS
SQL
其它

条评论被折叠查看

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。