模型对比分析
逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。
HY-4(Hy4 preview)与 GLM-5.3 对比:770B 对 744B,两款国产 MoE 旗舰怎么选?
HY-4 与 GLM-5.3 的总参数分别为 770B 和 744B,激活参数分别为 49B 和 40B,规模与定位非常接近。当前 12 项共同评测中 GLM-5.3 领先 10 项,HY-4 则在 NL2Repo-Bench 与 Toolathlon-Verified 上小幅领先;前者已 GA,后者仍是 preview。
国产三款 Flash 模型横评:GLM-5.3-Flash、Qwen3.8-Flash-Next 与 DeepSeek-V4-Flash-Vision-Exp 怎么选?
三款 2026 年 8 月发布的国产 Flash 模型正面交锋:GLM-5.3-Flash 在现有共同评测中整体最稳,DeepSeek-V4-Flash-Vision-Exp 胜在 1M 上下文、384K 输出和分时低价,Qwen3.8-Flash-Next 则以 125B/6B 的紧凑 MoE、视频输入和开放权重形成差异化。
GLM-5.2 与 Kimi K2.6 对比:10 项评测的胜负、许可差异与部署门槛
GLM-5.2 在双方共有的 10 项评测中赢下 9 项、平均分高 6.6 分,Terminal-Bench 2.1 一项就差 27.4 分;Kimi K2.6 的体量大出三成,且许可是 Modified MIT 而非标准 MIT。
AI 大模型列表常见问题
这份大模型列表多久更新一次?
新模型、版本迭代、价格调整与评测结果一经公开即同步收录,通常在官方发布后数小时内即可看到。数据入库后,页面缓存会在 5 分钟内自动刷新,确保访客始终看到最新信息。
"开源"筛选项下的许可方式有什么区别?
一个模型可以是开源的(权重公开),但许可证仍可能限制商业使用——例如部分 Llama 变体禁止大规模商业化部署。三个选项的含义:"免费商用"表示可直接用于生产,无需授权费;"收费商用"表示商业使用需付费授权;"不可商用"表示该模型不得用于任何商业产品。
如何挑选适合自己业务的大模型?
建议先用顶部的能力筛选(对话、编程、推理、多模态等)缩小范围,再用各模型详情页的评测结果对比与你业务最相关的基准。生产场景还要综合考虑 API 价格、上下文长度与许可证——评测分高的模型不一定是总持有成本最低的选择。
收录了哪些机构的大模型?
覆盖全球主流大模型发布机构,包括 OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek、阿里通义(Qwen)、智谱(GLM)、月之暗面(Kimi)等。可在筛选项中按机构精确查询。
能查看某个模型的完整评测结果吗?
可以。点击任意模型卡片进入详情页,可查看完整评测表、参数规模、上下文长度、许可证、API 价格,以及指向官方论文、Hugging Face、GitHub 的原始链接。





















