
GLM-5.2 试了两天,好话坏话都讲
我花了两天试了一下 GLM-5.2。这东西能干重活,但别指望它什么都能干。\n\n先说怎么把它跑起来。GLM-5.2 是智谱 AI 的旗舰模型,今年 6 月开源了权重。开源权重这个事对做调查的人有吸引力,意思是模型文件能拿下来自己部署,数据不出内网。我这边没自己搭集群,走的是国内云平台的托管入口,注册、实名、建一个 API key,前后不到二十分钟。这里插一句老话,我上个月写别的模型时也提过,密钥别写死在脚本里,先丢环境变量。新手栽跟头十有八九栽在这一步,跟模型本身没关系。\n\n第一件事是测它能不能老老实实吐结构化数据。所谓结构化,就是让它按固定格式输出,比如 JSON,方便程序接着往下处理。我拿一份带日期的日志丢进去,要求它按字段拆出来。结果比我预想的干净,两列格式不统一的日期它自己归拢了,没有像有些模型那样给你回一段散文。这一项我给高分。\n\n然后是长上下文。这个模型的卖点是 1M token,token 可以粗略理解成模型眼里的字数单位,1M 大概是一本厚书、或者一个中型项目的代码量。我把自己维护的一个小工程整包塞进去,让它说清楚模块之间怎么调用的。它答得出来,还指出了两处我自己没注意的循环依赖。这一步确实有点东西。\n\n### 卡住的地方也得说\n\n第一个卡点是它不出图。这是纯文本模型,你要它画个流程图,它只能给你一段 SVG 代码或者字符画,还得自己再渲染。我一开始没反应过来,以为提示词写得不对,来回试了三轮才确认,就是不行。想拿它做图文一体的活,趁早换工具。\n\n第二个是延迟。上下文塞得越满,等的时间越长。长程任务这东西听着好听,实际是拿时间换的。我这边测下来,塞满以后一次回复要等挺久,具体多久看任务复杂度,不好一概而论。\n\n第三个不算它的错,是我自己查资料时发现的。两个来源对上线日期说法不一致,一个说 6 月 17 日,另一个说法略有出入。这种小出入在国产模型的通稿里挺常见,不致命,但提醒一句,看到榜单和日期,先多方求证再下结论。\n\n还有一点。有评测说它在几个长程任务测试集上的成绩落在 Claude Opus 4.7 和 4.8 之间,其中一项只比 4.8 低大约 1 个百分点,是排名最高的开源模型。\n\n> 长程任务测试集,看的是 AI 能不能像顶级工程师那样,在几小时到几十小时的尺度上把一个复杂项目做完。\n\n这个数据我没法自己复现,只能记下来,不当结论用。\n\n### 适合谁,不适合谁\n\n适合手上有大代码库、想一次性喂进去做分析的开发者,也适合做智能体的团队。智能体就是能自己调工具、分步骤干活的程序,它的工具调用和 MCP 支持是齐的。有数据合规要求、想拿开源权重自己部署的团队,也可以考虑。\n\n不适合做图像生成的,不适合只想拿它闲聊、图个便宜快的。还有完全不懂密钥管理和调用流程、想直接套壳上线的人,最后这类我见得多了,出事都出在这一步。\n\n行动建议就一条,别一上来就塞整个工程。先拿一个文件、一个函数跑通一次调用,确认 key、计费、返回格式都对,再往上加量。长上下文是能力也是成本,动手之前先想清楚,你非塞那么多不可吗。
物界前沿