洞见
GLM-5.2 对比
Opus 4.8:
技术迁移实测
2026-6-26


我们在一个真实的客户项目上测试了 Z.AI(智谱)的开放权重模型 GLM-5.2,并与 Claude Opus 4.8 进行对比。同样的任务,同样的工具,唯一改变的只有模型本身。以下是我们的发现。
去年我们写过 Claude Code 与 Opus 4.5,它已经成为我们日常开发方式的一部分。此后,网上有很多讨论说 GLM-5.2 以极低的成本达到了最强闭源模型的水平。
我们身在上海,一个能从中国境内服务器直接访问的高水平模型,对我们的意义不只是价格。我们想验证这些说法是否属实。
GLM-5.2 是中国公司 Z.AI(智谱)推出的开放权重模型:模型本身可以免费下载,但运行它需要相当强的硬件,所以包括我们在内,大多数团队都是通过智谱自己的服务来使用它。这项服务的价格远低于闭源模型,而且服务器就在中国境内,无需 VPN。
Opus 4.8 是 Anthropic 最先进的模型,也是我们平时的默认选择。我们把两个模型都放在 Claude Code 这个同样的终端工具里运行,因此两次测试之间唯一的变量就是模型本身。
我们为一家家具客户重建了网站。旧站建于大约八年前,前端使用 React 和 Gatsby,后端使用 Contentful。Contentful 是一个托管式内容管理系统,费用已经变得昂贵,而且在中国境内的访问表现并不稳定。
我们把前端迁移到了 Next.js,内容迁移到了 Payload——它免费、开源,可以部署在任何地方,包括中国境内。这才是客户真正的收益,也是这类迁移如今成为我们主要业务的原因。
每次测试前,我们都把代码重置到同一个起点,让两个模型从完全相同的状态开始。两次使用同一条严格的提示词:这只是一次技术迁移,严格遵循原有设计,除非有充分理由,否则复用现有前端代码。
我们还让两个模型参考了我们在同一技术栈上的两个过往项目,要求遵循同样的结构和标准。我们衡量四件事:能否完成、是否尊重原设计、消耗了多少工作量、以及在我们办公室实际用起来有多快。
两个模型都完成了迁移,也都在一开始犯了同一个错误。我们明确说过不要重新设计任何东西,但两个模型都还是改动了一些地方。
各自经过一次坚决的纠正后就改正了。谁都没能一次做对,但也都不需要第三次提醒。
两次都不是一步到位。两个模型都能独立把网站完成到百分之九十左右。最后一段是细节工作:逐页与原站对照、修正间距和细小的布局差异、手工连接零散的内容。
这部分很正常。迁移的完成标准是每一页都与原站一致,而不是第一版能跑起来,这最后一段路仍然需要有经验的人仔细走完。
两个结果非常接近。在内容模型的一处棘手环节上,Opus 的处理略干净一些;GLM 的版本我们手工做了一处小修正。
如果把标签去掉,把两个完成的网站交给我们,我们很难分辨哪个是哪个模型写的。
我们对两个模型都使用包月套餐,所以当天的测试并没有产生额外费用。但对于要决定为哪个付费的人来说,价格和速度才是真正的问题。下面是每个模型消耗的工作量、按各家公布的价格估算的费用、以及工作会话的时长。美元数字请当作粗略估计。
按单次使用计算,GLM 在这个任务上便宜四到五倍,与外界的说法一致。需要说明的是,包括我们在内,大多数团队用的是包月套餐,而不是按量付费;把套餐分摊到所有工作上,这个差距会缩小。
这是对我们最重要的部分,也解释了上面时长差异的一部分原因。在上海使用 Opus 需要 VPN,连接缓慢且时常中断。GLM 的服务器就在中国境内,不需要 VPN,也没有断线。一天用下来,它就是更快、更顺畅。
对中国以外的团队来说这不是问题;但对我们来说,这正是做这次测试的主要原因。
Claude Code 由 Anthropic 开发,为自家模型做了调优,所以这不是一个完全中立的赛场。GLM 的读图能力较弱,这对需要用眼睛检查结果的设计工作有影响。
而且,一次顺利的迁移不等于一年的日常使用。在完全信任它之前,我们会继续在真实项目上测试。
对于这次迁移这样目标明确的技术任务,GLM-5.2 的表现与 Opus 4.8 足够接近,差距没有影响最终结果。按单次使用计算它便宜得多,而且从我们所在的位置看,访问更快、更稳定。