GitHub
chinese-llm-benchmark
观察池 · 暂无正式排名
该项目当前未满足“两个有效维度 + 两种数据源”的主榜门槛。
— 未排名
可观测采用度缺失 —
动量当前有效 · 2026-09-12 14
关注度当前有效 · 2026-09-12 25
信号可信度 依据当前有数据的独立评分维度数量计算。
中2/3 · 1 种数据源
项目介绍
以及hy3、step3.7-flash、kimi-k2.7、ernie4.5、MiniMax-M3、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.2、MiMo-V2、LongCat、gemma4、mistral等开源大模型。
隆重推出 一站式 AI 模型超市 🛒,提供当下最全的大模型,让您永远快人一步。
拒绝“盲选”大模型🎉!上传你的【专属测试数据】📊,5分钟🔍测出哪个模型在你的场景下效果最好🏆、最划算💰!选择最合适模型,成本或降90%💥!去体验>>
“综合能力”计分方式:“综合能力”改为“专业能力”和“通用能力”的加权分,权重分别为0.3,0.7;其中“专业能力”为“教育”、“医疗与心理健康”、“金融”、“法律与行政公务”4大领域平均分,“通用能力”为“推理与数学计算”、“语言与指令遵从”、“agent与工具调用”、“coding” 4大领域平均分。
☛☛完整排行榜见医师 (1)内科,排行榜 内科规培结业:badcase, 中医内科主治医师:badcase, 内科主治医师:badcase, 心血管内科与呼吸内科主治医师:badcase, 肾内科主治医师:badcase, 消化内科主治医师:badcase, 中西医结合内科主治医师:badcase, 消化内科高级职称:badcase, 普通内科高级职称:badcase, 呼吸内科高级职称:badcase, 心内科高级职称:badcase, 结核病主治医师:badcase, 内分泌科高级职称:badcase
(2)外科,排行榜 外科规培结业:badcase,…
各数据源
6.4k Star
- Star 6.4k
- Fork 265
- 提交 501
- 发布 70