[NS :
Z.ai先后发布了GLM-5.3和GLM-5.3-Flash两份评测报告,但两张图的基准版本并不一致(比如TerminalBench一个用2.1、一个用3.0),直接对比会产生“84分vs28分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上KimiK3、GPT-5.6Sol、DeepSeek-V4
cogoxu] GLM-5.3-Flash 我要打十个Z.ai先后发布了GLM-5.3和GLM-5.3-Flash两份评测报告,但两张图的基准版本并不一致(比如TerminalBench一个用2.1、一个用3.0),直接对比会产生“84分vs28分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上KimiK3、GPT-5.6Sol、DeepSeek-V4