73.9/100
综合得分
- 测试套件
- full
- 完成小项
- 27 / 27
- 测试日期
- 2026-08-29
MODEL BENCHMARKS
查看经 muchtoken 网关真实请求生成的 AI 模型实测结果,按模型品牌、上下文窗口与测试套件比较指令遵循、推理、结构化输出和抗幻觉表现。
平台模型通过 muchtoken 网关端到端请求,自定义模型通过运营审核的兼容接口请求。每条结果固定保存测试套件与评分版本,公开前经过审核;不同版本之间不假装可以直接横比。
仅展示已完成并公开发布的结果。
综合得分
综合得分
综合得分
综合得分
综合得分
综合得分
综合得分
综合得分