MODEL BENCHMARKS

AI 模型实测与基准测试

查看经 muchtoken 网关真实请求生成的 AI 模型实测结果,按模型品牌、上下文窗口与测试套件比较指令遵循、推理、结构化输出和抗幻觉表现。

这些结果如何产生

平台模型通过 muchtoken 网关端到端请求,自定义模型通过运营审核的兼容接口请求。每条结果固定保存测试套件与评分版本,公开前经过审核;不同版本之间不假装可以直接横比。

按模型品牌查看

按上下文区间查看

最新模型实测结果

仅展示已完成并公开发布的结果。

8 RESULTS