搜索文章

输入关键词开始搜索

如何选择模型与推理强度

AI#AI Coding

最近在做可视化 Agent,涉及大量开发任务和测试,Token 完全不够用。目前自己买了每月 200 美元的 ChatGPT 套餐,有一个没有周额度限制的 GLM 老套餐,还买了 OpenCode Go,但感觉仍然不够用。尤其是 GPT,虽然已经买到 200 美元,额度还是经不起这样消耗。

所以需要把手头几个模型的能力搞清楚。GLM、DeepSeek 能完成的工作,就尽量交给它们;GPT 的额度留给更值得投入的部分。这篇主要比较 GLM-5.3、GLM-5.3-Flash、DeepSeek V4.1 Flash,以及 GPT-5.6 的 Luna、Terra、Sol 和 GPT-6 Astra。

前面已经写过一篇《如何正确使用 GPT 模型的推理强度》,这次把范围扩展到几个我目前实际能用的模型上。

先看这些模型大约处在什么位置

我用的是订阅套餐,GLM 的老套餐没有周额度限制,非常给力。所以即使 GPT 某个模型的 API 单价也不高,只要 GLM 能把事情做好,还是优先用 GLM。OpenCode Go 可以再分担一部分工作,不过它也有自己的额度限制。Go 用量说明

当然,便宜模型反复改不好,最后还要 GPT 重新读代码,也不划算。我想找到的,是哪些工作可以放心分出去,哪些最好一开始就给强模型。

先拿公开跑分做个参照。下面是 2026 年 9 月 14 日查到的 Artificial Analysis Intelligence Index v4.3 数据。同一列表示相同的档位名称,不表示投入了相同的推理预算。

模型LowMediumHighXHighMax
GPT-5.6 Luna2225323538
GPT-5.6 Terra2830343842
GPT-5.6 Sol3439424447
GPT-6 Astra4650515353
GLM-5.3缺数据无此档缺数据无此档45
GLM-5.3-Flash缺数据无此档缺数据无此档42*
DeepSeek V4.1 Flash40,effort=100

来源:LunaTerraSolAstraGLM-5.3GLM-5.3-FlashDeepSeek V4.1 Flash

Flash 的 AA 页面没有单列 effort,按 Z.ai 要求用 Max 复现榜单的说明,暂放在 Max 栏。DeepSeek 支持 1—100 连续调节。GLM 的 Low、High 没查到完整的同口径测试,先留空。

这样看,GLM-5.3 Max 在 Sol XHigh 和 Max 之间;Flash 的榜单分数与 Sol High、Terra Max 相同;DeepSeek Max 则在 Sol Medium 和 High 之间。两个 Flash 都值得拿来承接一部分原本交给 Sol 的工作。具体分哪些,还要看它们擅长什么。

比如 Flash 和 Sol High 都是 42 分,但 AA 的 Terminal-Bench v4.0 分别是 33% 和 21%,专业文档测试 GDP.pdf 则是 15% 和 28%。同分,强项差了不少。做终端任务和读复杂文档,就不该照着同一个等号选模型。分项对照

GLM Flash 先做日常开发

我最关心的是页面、UI 和可视化。这个方向上,Flash 有一个很实用的优势:原生支持视觉输入,可以直接看截图和渲染结果。GLM-5.3 本身是文本模型,换成完整版时反而要注意这件事,别把需要看图的工作一起换过去。Flash 官方说明GLM-5.3 模型信息

Arena 9 月 11 日的 WebDev 榜里,GLM-5.3 Max 是 1614±11,Flash 是 1607±12,分别有 3,725 和 2,925 票。两个区间重叠,在这组网页偏好测试里还看不出完整版有明显优势。这个结果比较符合我想先把页面工作分给 Flash 的方向。Arena WebDev 榜

已有组件模式下的功能修改、小 Bug、资料整理和方案初稿,也可以先用 Flash。跨模块故障、仓库级重构这些工作,保留 GLM-5.3 来处理。我没有准备把完整版完全换掉。

至于 High 还是 Max,社区的反馈正好相反。一篇讨论里,用户觉得 High 在自己的环境中更好用;另一篇里,用户说 High 只修了指出的问题,漏掉同一个脚本下面的同类 Bug,换 Max 后才检查完整。High 讨论Max 讨论

Z.ai 官方推荐 Max。我准备先用 Flash High 做日常默认,看看是否会频繁返工。如果问题已经理解对了,只是分析和检查不够,可以试一次 Max;如果一直没搞清楚模块关系,就换 GLM-5.3 High。换了完整版还有具体难点,再考虑 Max。官方参数建议

这里还有一个容易配错的地方。GLM-5.3 和 Flash 只有 Low、High、Max 三档,官方仓库说明,不传参数或传入其他值会回落到 Max。GLM 参数说明

DeepSeek 要连着客户端一起看

DeepSeek V4.1 Flash 的 Agent 跑分很高,我准备让它分担代码修改、命令行排查和测试修复。不过,要注意这些成绩是在什么环境下跑出来的。

它的官方模型卡列了同一个模型、最大推理强度,在不同 Agent 框架下的 DeepSWE v1.1 成绩:

Agent 框架DeepSWE v1.1
mini-SWE74.2%
DeepSeek Harness Minimal72.6%
Claude Code69.8%
Pi66.2%
Codex65.6%
OpenCode65.5%

来源:DeepSeek 官方模型卡

74.2% 到 65.5%,差了 8.7 个百分点。只看最高分,很容易觉得它已经可以替代 Sol 的最高档;但得把客户端这一层算进去。这个表也说明,仅仅把模型换强,未必能得到榜单里的效果。

实际使用反馈里,有位用户通过 Pi 和官方 API,让 DeepSeek 把旧 Kindle 改成时钟、天气显示设备。他说模型在 Max 下不断改脚本,始终没有识别出路由器客户端隔离造成的连接问题。用户记录

我更在意这个具体的失败方式:模型一直有动作,却没有重新检查原因。如果遇到这种情况,就应该停下来重新排查,继续加 Token 不一定有用。也不能凭这一个案例就认定 DeepSeek 不会做复杂分析。

目前先把它放在步骤比较明确、能不断拿到工具反馈的执行任务上。推理参数可以从 50 或 75 试起,遇到难点再试 100。客户端如果只显示 Low、High、Max,要先查一下实际映射,不能直接拿 GPT 的档位来套。

Astra 值得用,但不用每次都开 Max

加入 Astra 后,GPT 内部的选择也变了。以前碰到难题,容易想到把 Sol 往上调;现在还可以比较一下,直接换 Astra 的中档是否更合适。

Astra 档位AA v4.3 分数AA 加权每任务成本
Low46$0.82
Medium50$1.54
High51$1.72
XHigh53$2.31
Max53$3.26

来源:Astra 分档数据。美元数是 AA 按评测用量计算的成本,不是我的订阅扣量。

Astra Medium 是 50 分、$1.54;Sol Max 是 47 分、$1.99。在这套评测里,换成更强模型的中档,比把 Sol 开到最高档还合算。Sol 分档数据

XHigh 和 Max 都显示 53 分,成本却继续增加。当然,整数总分会掩盖单项差别,这不能用来断言 Max 没用。但对我这种额度紧张的情况,没有理由一上来就常驻 Max。

Astra 的社区反馈也不是一边倒。有人说它解决了 Sol 多次没解决的问题;也有人觉得普通编码区别不大,额度却掉得更快。看这些讨论时,我更想知道前者到底卡在什么问题上,而不是把“更聪明”当成所有任务都升级的理由。Astra 与 Sol 的讨论

我的安排是,普通复杂开发和方案比较使用 Astra Low,需要深入分析再升 High。可视化 Agent 的关键架构、复杂状态关系、疑难 Bug 的根因,直接考虑 Astra High。这类工作如果判断错了,后面会跟着做错很多事情,不值得为了省一点额度先让几个模型轮流试。XHigh 直接跳过,Max 留给还没解决的具体难点。Astra 的 API 支持这五档;Codex 里的 Ultra 还会涉及自动委派,适合有独立工作可以拆开的任务,不需要为了“多想一会儿”就开它。Astra APICodex 模型说明

Luna 和 Terra 也不必从选择里删掉。已经在 Codex 里建立好上下文,顺手改一点东西、整理文档,继续用 Luna Low 或 Medium 就行;普通开发可以用 Terra Medium。没必要每次为了换套餐,把背景重新交代一遍。新开的批量任务,再优先交给 GLM 和 DeepSeek。

实际使用时怎么选

把上面的安排放进一棵树,选模型时方便看。这里给的是起点,后面还是看具体结果。

按任务选择模型的决策树

比如同样是在做可视化 Agent,确定任务边界和关键设计时,可以让 Astra High 来分析;方案已经明确,接下来按现有模式实现功能、运行测试,就可以分给 GLM 或 DeepSeek。实现过程中发现原方案有问题,再把那个问题交回去。交接时留下目标、关键文件、已经做过的判断和失败现象,不用把整段聊天搬过去。

这也要求先分清楚模型卡在哪里。缺日志,就先拿日志;不知道页面应该长什么样,就先补参考和标准。模型已经理解了材料,但推断遗漏,可以提高一次 effort。要是它反复沿着错误方向修改,就换模型或重做方案。我先给自己设一个简单限制:连续两次没有实质进展,就停下来检查,不让它自动重试下去。

测试这一步也不能只按名称分配。运行现有测试很明确,判断这些测试有没有漏掉重要行为,就难得多。页面最终还得渲染出来,交互得真的操作,图表得对照原始数据。

目前还没用自己的任务测出哪一组配置最省。接下来先观察 DeepSeek V4.1 High 和 GLM 5.3 Flash High 能接走多少工作,尤其记下那些最后又交回 GPT 的任务:究竟是模型能力不够,还是一开始就没把问题说清楚。