跳转至

了解你的 Agent (与背后的 LLM)的特性

不同的 Agent 框架和 LLM 的特长不同,能力区别很大。同一任务、但是框架不同/框架相同但模型不同,会导致执行情况天差地别。

虽然一般读者只会使用一个 Agent 与订阅附赠的 LLM,但是对于复杂、困难的任务,全程使用最强模型,额度消耗会非常快。因此读者大概率会尝试使用多个 LLM 共同工作。据此,了解不同的 LLM 的特性是有必要的。

作者总结常见的 LLM 的“脾气”、 “特性” 与优缺点总结如下。

1. GPT(GPT 5.6 Sol / Terra /Luna)

优点: 1. 死脑筋,但是力气非常大,几乎什么题都能做 2. 喜欢写代码。面对不同问题,直接从语义理解未必能做,但变成代码问题就会做了 3. 很擅长科学问题,有丰富的科学知识,常见理工科甚至有硕士~低年级博士水平

缺点: 1. 简单问题复杂化,复杂问题代码化 2. 过度书写测试,忽略语义特性 3. 喜欢偷懒,总是漏一些细节,跑一遍任务大概率做不完整 4. 不说人话,喜欢 “不是而是”,美式中文,互联网黑话等常见中文问题 5. 执行 2 小时以上的长任务容易思维涣散、无法把握任务要点,需要结合外部 Skill 或直接指导项目管理 6. 设计品味很差,写网页不加约束只会写成扁平风

GPT Luna 的额外缺点: 1. 长程任务性能极差,只适合做单点任务 2. 不适合指挥其他模型工作

GPT Terra 表现的性能不如 Luna Max,建议忽略这个模型

2. Claude (Fable 5, Opus 4.6 / 4.7 / 4.8 / 5 )

优点: 1. Fable 5 是 2026 年上半年能力最强的模型,除了贵几乎没有缺点 2. 工程品味很好,能比较妥善地安排工程设计 3. 前端设计品味很好,网页设计水平优秀,掌握多种设计风格

缺点: 4. Fable 5 总觉得用户的水平不如他,然后以此为理由偷懒、甚至自动降级到 Opus 系列模型 1. "Too Dumb to Use Fable" 5. Fable 过于敏感,遇到(它认为的)安全问题就会降级到 Opus 系列模型 6. Opus 4.7 及之后的模型偶尔不说人话,具有 GPT 所有的不说人话症状,但相对轻微 7. 执行时间过长时(> 30 min)会开始混用日、韩语,甚至把大段的输出全部换成日、韩语

3. Gemini (Gemini 3.5 Flash / 3.6 Flash)

优点: 1. 在北美模型中具备最丰富的世界知识,文理工商等各科知识非常全面 2. 因为优点 1,在各种非代码任务、甚至奇怪任务中的表现出奇得好 3. 前端设计品味尚可 4. 相对比较说人话,可以做一些文字工作

缺点: 1. 全球最谄媚的模型,做任何任务都习惯于讨好用户 2. 多轮对话性能很差,因此甚至难以用于写代码

4. DeepSeek ( DeepSeek V4 Flash / Pro 及正式版本)

优点: 1. 世界知识尚可,思考逻辑符合中国人逻辑,中文性能优秀 2. 上下文召回很强,不太怕忘记任务信息 3. 相对比较说人话,适合一些文字工作

缺点: 1. 过度思考,过度检查 2. (非正式版)没有做良好的后训练,且没有适合自己的 Agent 框架,模型性能未能完全释放 3. 代码能力较弱,复杂工程能力持平 Claude Sonnet 4.5 4. 没有多模态(视觉能力)

5. GLM 和 Kimi ( GLM-5.1/5.2, Kimi-K3 )

优点: 1. 代码能力均较为优秀 2. 前端品味良好,Kimi K3 前端品味较强 3. 在科学问题上表现尚可 4. Kimi K3 的工程设计品味不错,复杂工程的设计、拆分、执行效果都不错

缺点: 1. 长代码任务最终效果均不佳 2. GLM 偶尔容易输出死循环