模型对比分析
逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。
GPT-6 Astra vs GPT-5.6 Sol:按评测版本、测试配置与任务成本比较
更新至 2026-09-05 核验快照:AA Coding Agent Index v1.4 的 Codex max 对照为 67 对 65,Sol 历史 80 分不与新版本混比。Astra 在多项官方 Agent 和长上下文评测领先,但 AA 编程测试中也有 Sol 更强的子项及更短的耗时。标准 token 单价相差 2.5 倍,不等于任务账单相差 2.5 倍。
GPT-6 Astra对比Claude Fable 5.1,谁更强,哪个价格更有优势
GPT-6 Astra 与 Claude Fable 5.1 是 OpenAI 和 Anthropic 在 2026 年推出的两款旗舰级模型,两者都面向复杂推理、编程、Agent 和长时程知识工作。从目前可直接对比的 8 项评测来看,GPT-6 Astra 以 5 项领先、3 项落后的成绩取得小幅整体优势,在 ARC-AGI、AutomationBench、Terminal-Bench 及科学工具任务上表现更突出;Claude Fable 5.1 则在 HLE、AA Intelligence Index 和 OSWorld 2.0 等知识推理与计算机操作评测中占优。两款模型均提供约 100 万 token 上下文和 128K 最大输出,API 基础价格也同为每百万 token 输入 10 美元、输出 50 美元,因此实际选型更取决于任务类型、Agent 工作流以及缓存使用方式,而非单纯的价格或综合分数。
Claude Fable 5.1 / Fable 5 / Opus 5 与 GPT-5.6 Sol 四方对比:评测、价格与选型
四款模型共有的 4 项 0–100 量表评测里,Fable 5.1 平均 58.8 分居首,Opus 5 50.3、Fable 5 46.7、GPT-5.6 Sol 42.5;计算机操作(OSWorld 2.0 partial)上 Fable 5.1 以 77.9 对 75.4 小幅领先 Opus 5,但它的价格是 Opus 5 的两倍、Sol 的 2.5 倍。
AI 大模型列表常见问题
这份大模型列表多久更新一次?
新模型、版本迭代、价格调整与评测结果一经公开即同步收录,通常在官方发布后数小时内即可看到。数据入库后,页面缓存会在 5 分钟内自动刷新,确保访客始终看到最新信息。
"开源"筛选项下的许可方式有什么区别?
一个模型可以是开源的(权重公开),但许可证仍可能限制商业使用——例如部分 Llama 变体禁止大规模商业化部署。四个选项的含义:"免费商用"表示可直接用于生产,无需授权费;"有条件免费商用"表示商用免费但附带条件,通常只约束超大规模服务商(如 GLM-5.3 要求年收入超 100 亿美元的 MaaS 运营方先通过安全审查);"收费商用"表示商业使用需付费授权;"不可商用"表示该模型不得用于任何商业产品。
如何挑选适合自己业务的大模型?
建议先用顶部的能力筛选(对话、编程、推理、多模态等)缩小范围,再用各模型详情页的评测结果对比与你业务最相关的基准。生产场景还要综合考虑 API 价格、上下文长度与许可证——评测分高的模型不一定是总持有成本最低的选择。
收录了哪些机构的大模型?
覆盖全球主流大模型发布机构,包括 OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek、阿里通义(Qwen)、智谱(GLM)、月之暗面(Kimi)等。可在筛选项中按机构精确查询。
能查看某个模型的完整评测结果吗?
可以。点击任意模型卡片进入详情页,可查看完整评测表、参数规模、上下文长度、许可证、API 价格,以及指向官方论文、Hugging Face、GitHub 的原始链接。



















