#大模型评测

Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。 参数与定价 Qwen3.8-Max 沿…
Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。 性能表现是否接近旗舰水平? 综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。…
LMArena:这个大模型评测试用台,全免费!GPT-5.2、Claude 4.5、Gemini 3 随便用
作为一名常年跑新模型、做选型评测的产品经理,如果只把 LMArena 视为一个查看“公开模型对比平台”,那你就错了。 普通用户可以在这里薅羊毛。 你可以免费体验 GPT-5.2、Gemini 3 Pro、C…
盘点4个AI大模型评测榜单网站,2026最全 AI 大模型选型榜单参考指南,建议收藏!
最近这半年,各大模型厂商密集发布新版本,从OpenAI、Anthropic到国内的GLM、Qwen,新模型层出不穷。 问题随之而来:这些模型到底处于什么水平?性能、成本、推理速度如何权衡? 如果你也有过这样的困惑,比如GLM 4.7发布后不…