前提:平时编程还是以 Codex 为主。
最近买了几台新机,不想自己跑脚本,就拿几家 AI 测试部署代理、照着旧机器配置新机,以及途中排错。
用到的主要是:
- GPT-5.6 Sol Medium
- DeepSeek 4.1 Flash High + 最新 DSH
- GLM-5 Max
- GLM-5.3 Flash(Zcode / 火山)
目前个人体感:
| 模型 | 优点 | 问题 |
|---|---|---|
| GPT-5.6 Sol Medium | 综合最稳,理解需求准,调优/排错靠谱 | 思考稍慢 |
| DeepSeek 4.1 Flash High | 找 Bug 很快 | 容易过度思考、扩大任务 |
| GLM-5 Max | 找资料、折腾冷门配置强 | 排错容易跑偏,比较吃提示词 |
| GLM-5.3 Flash | 便宜、速度还行 | 理解波动大,经常没检查就直接回答 |
大概排序:
GPT-5.6 Sol Medium>DeepSeek 4.1 Flash High ≈ GLM-5 Max>GLM-5.3
火山方舟的 5.3,我自己用下来感觉尤其明显有降智。
GPT-5.6 Sol Medium
目前综合最好。
测试节点、调优、查配置、Search 整个项目都比较稳,最大的区别还是理解你到底想干什么。
很多时候不需要把提示词写得特别精准,它自己就能找到正确方向。
缺点就是思考会慢一点。
DeepSeek 4.1 Flash High
找 Bug 很快。
之前一个 VLESS 配置有问题,GLM 折腾了半小时都没找到,实际原因只是:VLESS 地址写错了
DeepSeek 一分钟左右就找到了。
但它特别容易过度思考。
本来只让它处理一个问题,就说其他问题去了。。。而且权限没给很多都是自己就改了,遇到降智会灾难
而且思考过程偶尔突然变英文。
所以它属于:排错很强,但最好限制修改范围。
GLM-5 Max
这个模型挺偏科。
找资料、研究冷门配置很强。
比如之前让它研究光猫开 IPv6,自己找方法、一步步操作,最后做得挺稳。
但拿来找 Bug,经常容易方向跑偏,提示词写得越精准越好。
还有一点很迷:研究光猫开 IPv6:正常;看 Shadowrocket 规则配置:触发安全限制
另外现在还特别喜欢往记忆里写东西。
GLM-5.3 Flash
这个理解能力有时候真的很奇怪。
我发现提示词写成 Markdown 后,效果会明显正常一点:
最大问题是它经常不检查就开始回答。
比如一个实际问题:电脑和手机在同一个 Wi-Fi,通过 Nikki 分流。电脑:同一个网站测试无 DNS 泄漏
手机:测试有 DNS 泄漏
结果它思考搜索了半天给我的解释是:可能是手机单独安装了一个 Nikki 导致的。
……
所以目前 GLM-5.3 Flash 给我的感觉就是:提示词得写得很明确,而且最好强制它先看配置、再回答。
5.3f就是个垃圾除了闲时免费没啥好处了,现阶段ds的模型我觉得都过拟合了而且注意力容易分散
@鲁西西 #1 是的,也就5.3能用,f放弃了