主要概览
司南 OpenCompass 大语言模型官方自建榜单(9 月榜)评测拟定于 10 月上旬发布,现诚挚邀请新加入的合作方参与评测。本次评测围绕强化能力维度,全面覆盖语言、推理、知识、代码、数学、指令跟随、智能体等七大关键领域,进一步细化评测颗粒度,确保模型能力的精准衡量,并提供客观、全面的评测结果,为评估当前技术水平、牵引产品研发、支撑行业应用提供抓手。诚挚欢迎新加入的模型厂商、组织机构申请参与评测,共同推动大模型技术的发展与创新。
评测维度
司南 OpenCompass 大语言模型官方自建评测榜单,综合评估商业 API 模型和开源模型在 语言、推理、知识、代码、数学、指令跟随、智能体七大能力维度,这七个维度可以被进一步细分为包括自然语言处理、理工科知识、常识推理、数值计算能力、代码续写、算法面试、高等数学、通用工具调用等十余项细分任务,力图对行业开源模型和商业 API 模型进行全面评测分析。

评测模型类型
开源模型
开源模型参与榜单评测,请提供 Hugging Face 或 ModelScope 公开模型权重仓库链接
已提供商业化服务,可访问的 API 模型
-
API 模型参与评测,提供 API 网址链接,并写明模型版本
-
若为 API 模型,请务必提前向 OpenCompass 提交 PullRequest,加入贵司 API 的实现,可以参考类似实现

最低0.47元/天 解锁文章

被折叠的 条评论
为什么被折叠?



