Clipping 微信公众号

GLM-5.2 + Claude Code实测!1M 上下文用法来了

by 筱可 原文 ↗
Created: 2026-06-18

公众号名称:Datawhale

作者名称:筱可

发布时间:2026-06-18 22:00

Datawhale干货

作者:筱可,Datawhale成员

昨天,智谱上线并开源了 GLM-5.2,主打 Coding 和长程任务。官方数据十分亮眼:前端盲测 Code Arena 拿了全球可用模型第一,长程任务上整体介于 Claude Opus 4.7 和 4.8 之间,是目前排名最高的开源模型。

我们提前拿到了内测资格,这阵子一直在 Claude Code 里拿 GLM-5.2 干长活,慢慢摸出了一套用好它 1M 上下文的方法。正好赶上正式发布,把这套用法完整分享出来。

一、用好 1M 上下文,在完成长程任务里很重要

评价一个 AI 编程助手的标准,正在发生变化。过去我们看的是它答得对不对:问题抛过去,回答准确就行。

但现在的任务复杂得多。模型要自己读文件、查资料、记录决策、排查日志,一次任务往往是几千次工具调用、连着跑大半天。这种时候,单次回答的好坏已经不是关键,关键是它能不能把整件事从头做到尾、中间不跑偏。

而要做到这点,模型得有一段足够长、又不出错的”记忆”。大家这两年盯着越来越长的上下文不放,就是这个原因。

但光有 1M 没用。窗口多大是一回事,往里面怎么组织信息是另一回事,后者才真正决定效果。下面这套方法,就是我拿 GLM-5.2 用下来觉得值得分享的部分。

二、先花两分钟,把 1M 上下文开起来

在 Claude Code 里启用 GLM-5.2 的 1M 模式,配置很简单,改一下 .claude/settings.json 就行。把 ANTHROPIC_BASE_URL 指到智谱的 anthropic 接口,再把模型名填成带 [1m] 后缀的那个。

这里有个容易踩的小坑:后缀 [1m] 一定要带上,不带的话默认还是普通上下文的长度。配好之后用 /status 看一眼,确认走的是 1M 的那条线路。

关于 [1m] 后缀的注意事项:Claude Code 走 Anthropic 接口时模型名必须带 [1m] 后缀;如果你同时使用 Kimi Code 走 OpenAI 兼容接口,则不带后缀,避免照搬踩坑。智谱官方的接入指南对此有详细说明。

想让它跑长程任务,再把思考档位调到 /effort max,需要联网查资料的话配上 MCP。具体命令和踩坑记录我都放在文末的完整教程里,照着走几分钟就能跑通。

教程地址:
https://my.feishu.cn/docx/KNeqdPly7o6iWexfRKOcTqBxnbH

开起来之后,我一开始也以为万事大吉,把所有东西一股脑全塞进去。试下来发现没这么简单:好不好用,我总结了三条经验。

三、实测下来的三条经验

经验一:给模型一个固定的锚点

第一个经验,是给模型一个固定的锚点。长任务跑到第五十步时,它常常已经忘了第二步定下的约定。

我的做法是把这些约定都写进 CLAUDE.md:命名规则、代码风格、哪些目录不能碰,让它每一轮都先读一遍。别指望”它应该记得”,只有把关键信息写下来,它才真的记得住。

经验二:先判断这个任务到底要不要开 1M

第二个经验听起来有点反常:我大部分任务其实是不开 1M 的。窗口越大,单次成本越高、速度也越慢,不分场景一律拉满,纯属浪费。

我自己有个简单的判断:看信息密度、时间跨度、出错代价这三样,中了两样才开。改个小函数、写个脚本,普通上下文够用;但要重构一整个模块、跨几十个文件改一套逻辑,这种活就值得把 1M 拉满。

把这步想清楚,比无脑开大窗口有用得多。该省的时候省,该上的时候上。

经验三:把长任务切成阶段,每段留检查点

第三个经验,是别让它一口气闷头跑到底。再稳的模型,连着跑几十轮也可能在某一步悄悄跑偏,等你发现的时候已经错出去很远了。

我的做法是把长任务切成几个阶段,每跑十到二十轮,就让它输出一段当前状态的摘要:做到哪了、改了什么、下一步打算干嘛。越早发现偏差,会提前避免很多不必要的麻烦。

四、GLM-5.2 的长程任务实测

光说经验有点空,我拿这套方法跑过两个规模差很远的活,正好能带大家看 GLM-5.2 的长程能力怎么落到具体任务上。

任务一:给学习库补前沿资料

第一个是小任务。我本地有个”认知科学-系统学习”的项目。其中,大概的框架已搭好(四层模型 + 8 个枢纽概念),但前沿素材为空。

运行前状态:4 个文件,48 KB。项目有一份 404 行的学习指南markdown文档,四个文件总共541行内容,定义了四阶段学习路径。而且在相邻领域还有大量知识储备:现象学、决策科学、心理学等。

我没让它自由发挥,而是把任务拆成五轮写进 prompt:广度扫描画地图、覆盖率审计查漏、深度钻取、交叉合成、最后做笔记初始化。开头还加了第零步,让它先把项目里的学习指南读完、把 8 个枢纽概念复述一遍,把后面所有动作都锚在这套已有框架上。

GLM-5.2 在一次会话里连着把五轮跑完,全程没触发上下文压缩。最后从 4 个文件变成 31 个、48KB 涨到 230KB,产出 42 张素材卡,8 个枢纽概念全部补到”充分”以上。

我最在意的是中间两个细节。一个是第二轮的覆盖率审计,它自己查漏补缺:发现”马尔三层次”和”心智模块”两个概念一张卡都没有,没等我提醒就补了 8 组定向搜索把空白填上。

另一个是写到第五轮做交叉笔记时,它还能调用我另一个项目里的现象学内容,引用了胡塞尔的意向性、梅洛-庞蒂的身体现象学。那些是第一轮就读进去的,中间隔了 20 多组搜索,到这会儿居然还在上下文里没被挤掉。跨轮不丢记忆,这正是 GLM-5.2 的1M上下文真正发挥优势的地方。

任务二:把 3473 个文件的知识库重排一遍

第二个任务规模就比较夸张了:一个 134MB、3473 个 Markdown 文件的知识库,让它重排整个目录。这体量是 1M 窗口的二十多倍,不可能一次读完。

所以这回 prompt 我拆成了七轮:骨架扫描、覆盖率审计、结构性重组、目录标准化、递归内容审计、断链修复、治理标准化。关键是分层,前四轮只动目录骨架,第五轮才递归进文件内容,第六轮再回头修链接,不一上来就把整库往里灌。

GLM-5.2 同样一口气把七轮跑完,全程没要我中途确认。3473 个文件、二十多倍窗口的活还能不断线,靠的就是它为长程任务训练到模型里的能力。

md 文件从 3473 个理到 3389 个,目录从 1659 个减到 1382 个、少了近三百个,空壳项目从 19 个清到只剩 1 个,命名不统一的 40 多个目录全部标准化,顺手还修了三百多处断链。

最能说明问题的还是第五轮。它逐个读文件全文做交叉比对,揪出两个内容完全一样的镜像目录、好几对同名不同版本的文件。这些光看文件名根本发现不了,必须把内容都读进来一个个比。这一轮最吃长上下文的环节,短窗口基本做不动。

上面这两个任务,是我自己用 1M 上下文实打实跑过的。后来翻了翻官方放出来的案例,有几个场景让我印象很深。

官方给了一个硬核案例:有人用 GLM-5.2 把当年送人类上月球的登月飞控程序,从六万五千行的老代码整个移植成了 Rust,一行逻辑都没改,整个过程全靠 Agent 自主走完,没人中途接手。

📹 此处为视频内容(vid: wxv_4564159361962426369)(上图为封面),未能直接提取,请前往原文查看:在公众号原文中观看

还有一个更接近日常开发:从开发、联调、测试到打包上线,一次性交付了一个覆盖 Web、移动端、小程序的多端应用,累计用掉 88 万 tokens,几乎把 1M 窗口用满。

📹 此处为视频内容(vid: wxv_4564166235201912832)(上图为封面),未能直接提取,请前往原文查看:在公众号原文中观看

这种复杂任务,现在 GLM-5.2 能在一次长任务里跑完。所以从代码迁移到多端交付,它的能力边界比我用到的宽得多。

当然 GLM-5.2 也不是没有短板。决定它上限的,其实是有效长度和连续工作能力,而不是官方说的1M上下文。上下文一长照样会衰减,“Lost in the Middle”那个老问题,它解决了不少,但你也别指望没有一点损失。目前来看,超长任务上GLM-5.2 还是比 Opus 4.8 低 13%。

所以实际用的时候有两个习惯:关键信息该写进 CLAUDE.md、该重申就重申,别只靠看模型去记;联网的 MCP 有额度,大搜索任务挑非高峰或者分批跑。知道这些边界,反而更清楚该把 1M 用在什么任务上。

写在最后:现在就能上手

GLM-5.2 已经全量开放、MIT 开源,配置就上面那一段,几分钟的事。完整的保姆级教程放在文末,包括怎么改 settings.json、怎么配 MCP、上面两个演示的完整 prompt 和步骤,新手照着走也能跑通。

用了这阵子,我对 1M 的看法也变了。表面看它就是能多塞点东西,但 GLM-5.2 用下来让我发现,它真正的价值是让 AI 能连续干得更久、看得更深、完成得更完整。

教程完整版:
https://my.feishu.cn/docx/KNeqdPly7o6iWexfRKOcTqBxnbH

**一起“**点****赞”三连


内容效果不满意?点此反馈

输入关键词开始搜索