教育行业大模型应用评测,往期文章:小学至高中3个阶段,9个学科,110个大模型应用实测横评!https://blog.youkuaiyun.com/easyllm/article/details/146845813?spm=1011.2415.3001.10575&sharefrom=mp_manage_link
教育行业|细分类目01「高考答题」评测结果,如图所示:
【评测结论】:deepseek得分第一,腾讯系混元系列模型、阿里系qwq系列模型分列2-5名,其中deepseek和qwq-32b(new)是前五中唯二的开源模型。
各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark
【模型数量】:110个大模型(国内外,开源、闭源的大模型)
【评测维度】:「高考-试题答题」类目的8个学科的择题题集评测
-
高考生物
-
高考语文
-
高考数学
-
高考物理
-
高考化学
-
高考地理
-
高考政治
-
高考历史
【错题集】:请前往以下链接查阅👇
各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark
大模型评测EasyLLM,目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测(详情可回顾以下链接👇),接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评,看看谁是各个垂直领域的最强打工人!宝子们看好哪个大模型可以在哪些岗位胜任最强牛马?或者想评测大模型的哪方面能力?评论区留言,有求必测,一一公布结果!有评测样本、有图有真相!
往期文章
Llama/Qwen/DeepSeek开源之争——CLiB开源大模型排行榜03.04
那些免费的大模型API效果到底好不好?——CLiB大模型排行榜
关于大模型评测EasyLLM
-
最全——全球最全大模型产品评测平台,已囊括203个大模型
-
最新——月更各个大模型各项能力指标评测,输出排行榜
-
最方便——无需注册/梯子,国内外各个大模型可一键评测
-
结果可见——所有大模型评测的方法、题集、过程、得分结果,可见可追溯!
-
错题本——百万级大模型错题本
大模型评测EasyLLM目前已囊括187个大模型,覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型, 以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。不仅提供能力评分排行榜,也提供所有模型的原始输出结果!
完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark