前言:先交代我自己的使用背景
先说清楚我的情况,免得被当成“键盘评测”——这篇不是什么模型能力排行榜,而是一个普通开发者这几家挨个用下来之后的真实感受。
今年 3 月才开始正经用大模型,最开始那段时间属于发展期,见一个试一个,很乱。
4 月底到现在,主力一直是 GPT。中间对比了一圈价格和能力,最后还是它综合下来最划算。
最近这两周,GPT 不稳定了——官方算力紧张,从新版本发布之后体验明显下滑——所以我又开始认真找替代方案。
下面这六家,有的是我深度用过的,有的是最近才开始上手,有的至今没在实际工作里用过。我会如实标注,没实战过的我会说明白。
本文全是个人实际使用感受,没做过跑分和基准测试。模型迭代太快,观点以 2026 年 9 月为准。
先说结论:一张表看懂六家
不想看我啰嗦的,直接看表。价格那列只是“贵/便宜”的相对感受,不是具体报价;“我的使用状态”才是这张表最有价值的一列。
| 模型 | 强项 | 短板 | 价格感受 | 我的使用状态 |
|---|---|---|---|---|
| GPT | 能力强,复杂任务最稳;比 Claude 略便宜;风控相对没那么严 | 官方算力紧张,最近体验明显下滑 | 正价贵(都贵),中转有低价渠道 | 主力(4 月底至今) |
| Claude | 能力强,社区口碑好,用的人多 | 贵;风控比 GPT 严 | 贵 | 工作里没用过,3、4 月试过几天 |
| Gemini | 前端样式、审美确实比 GPT 强 | 生态兼容性差,工具调用 / MCP 别扭 | 同价位有优势 | 最近才开始上手 |
| Grok | 能力不错,速度也还行,codex 兼容性好 | 生态资料相对少 | 不算太贵 | 最近开始试 |
| DeepSeek | V4.1 Flash 速度快、多模态、稳定 | 此前只有 flash / pro,缺多模态 | 这次降价后性价比明显上来 | 准备当主力 |
| GLM | 5.3-Flash 做日常活够用,前段时间有优惠 | 官方订阅贵;速度不如 DeepSeek V4.1 Flash | 不算太贵(比不带 flash 的便宜) | 深度用过一段时间做日常工作 |
看完上面那张表你会发现,我最后换不换模型,很大程度是被速度推着走的——所以下面单独用一节说速度。
输出速度:这是我这次换模型的最大动力
用久了才发现,速度对日常体验的影响比“能力多强”更直接。同样一个问题,20 token/s 和 200 token/s 是两个世界。下面这组数据是我自己在中转接入下实际体感的区间:
| 模型 | 实测速度(token/s) | 体感 |
|---|---|---|
| DeepSeek V4.1 Flash | 200+ | 目前最快,快到有点不真实 |
| Gemini | 100–200 | 能飙上去,出长内容很爽 |
| Grok | 40–50 | 稳定,基本不怎么波动 |
| GLM 5.3 Flash | 30–40 | 够用,高峰期会波动 |
| GPT | 常见 20–30;好时 60–70;差时 2–3 | 方差极大,最难受的就是它 |
| Claude | — | 我没实际跑过,不做评价 |
说明:以上都是我在中转渠道下的实际体感区间,不是实验室跑分。速度受渠道、时段、上下文长度、输出内容影响很大,你那边测出来的数字可能跟我完全不一样——尤其 GPT,它是这几家里抖动最厉害的,同一个渠道不同时段能差十倍。
其中 DeepSeek 的“200+”不是我随口说的:下面讲 DeepSeek 那节我贴了任务记录截图,一次真实任务跑下来是 227 tok/s。
六家逐个说
1、GPT:目前的主力,但最近两周体验在滑坡 主力
先把时间线说清楚:4 月底到现在,我一直用它当主力,中间试过别的,最后都会回到它。
能力强。复杂一点的活、需要多轮改的活,它兜底能力最好,这也是我没换掉它的主要原因。
比 Claude 略便宜。同样是第一梯队,它的价格相对好接受一点。
风控没有 Claude 那么离谱。当然它自己也风控,而且最近感觉还收紧了,但整体比 Claude 宽松。
速度方差极大。前段时间走中转接入,大部分时候只有 20–30 token/s,状态好的时候能到 60–70,但差的时候只有 2–3 token/s,慢到怀疑人生。这也是我最近想换掉它的直接原因之一。
最近的问题:官方算力紧张。从新版本发布之后,高峰期限流、响应慢,体验明显不如以前——这也是我最近开始折腾替代方案的原因。
关于价格的一个常识:正价贵不是 GPT 一家的毛病,所有模型的正价都贵。真正影响成本的是渠道——中转渠道基本都有低价,这也是为什么实际用起来未必有那么肉疼。
一句话总结:能力上限最高、我最熟,但最近不稳定,需要备胎。
2、Claude:能力和口碑都在线,但我没真正用于工作 没实战过
说句实话:这是六家里我唯一没在实际工作里用过的。
用的人其实很多,社区口碑一直很好,属于“公认的强”。
我为什么没用:一是贵;二是那会儿 GPT 还能用,没有非换不可的理由。
我唯一接触的一段:3、4 月那会儿 opus 4.6 / sonnet 4.6 出来,我试了几天,属于初期探测性质,后来发现 GPT 更便宜,就换回去了。
风控:据我了解比 GPT 严,这也是很多人绕开它的原因之一。
一句话总结:以后预算宽裕、或者遇到 GPT 啃不下来的硬骨头,我会优先考虑它;但目前它不在我的日常流程里。
3、Gemini:前端样式和审美,确实比 GPT 强 最近上手
以前只是听说它前端写得好,最近才亲自上手试,试完的感受是:传闻不虚。
前端样式、审美能力强于 GPT。这个对比是在同价位的前提下说的——不是拿最顶的档去压 GPT 的基础档那种比法。
改样式特别省事。我最直接的体会就是:丢一句“这块样式不好看,调一下”,它就能给你改得不错,不用来来回回解释半天。
输出速度快。实测能飙到 100–200 token/s,是这几家里最快的之一,出长内容的时候体验很爽。
短板还是兼容性。没法原生接进通用客户端;就算通过网关接进去了,工具调用、MCP 支持性也不好,还有个 thinking 标签的问题(思考内容容易乱入正文)。
使用建议:把它当成专门干前端 / 出效果的“专才”来用,别指望它当全能主力。它也得用专门的载体去接(比如 antigravityCli 这类 CLI),硬塞进通用客户端只会浪费时间。
效果对比:我让它调过的两个界面
光说“审美更好”太抽象,直接上对比。下面这两组界面我都只提了一句“样式不好看,帮我调一下”,没有给具体怎么改:
智能排班助手:排班表格 + 预览确认这套界面,调整后整体更清爽、层次更分明。
华仔 AI 工作台:对话区 + 右侧会话信息面板,调整后信息密度和视觉重量都更舒服。
我的感受是:它不是在“套模板”,而是在改你现有页面的比例、间距和层次。同价位下这一点比 GPT 明显,而且它改完你不用大动,能直接用。
一句话总结:做前端、调样式,它值得单独留一个位置。
4、Grok:最近试的,综合表现比较均衡 最近上手
也是最近才开始试的一家,试下来整体印象不错:
能力不错,实际输出质量比我预期好,做得比较到位。
速度稳定在 40–50 token/s 左右,波动很小,用起来不闹心。
价格不算太贵,属于中间档。
codex 兼容性挺好的,这点很关键——接进各种客户端基本不折腾。
一句话总结:能力不是最顶尖那一档,但“好用、好接、不贵”这三点它都占了,很适合当备胎。
5、DeepSeek:今天刚发的 V4.1,我觉得可以当主力了 准备转正
这家这段时间升级幅度挺大的,我按时间线说:
早期(只有 v4 flash 和 pro 的时候):简单用过一下,没深入。原因是当时没有多模态,跟我现在的工作习惯不匹配。
后来有多模态了:但按使用量算,官方调用的价格没有 GPT 的中转渠道划算,所以我还是没转过去。
直到今天 V4.1 发布:价格又降了一点,速度特别快。我拿真实场景测了一轮,已经能完成不少工作,而且完成得不错。速度更是夸张,实测能到 200+ token/s,目前是我用过的里面最快的。
我的判断:它现在可以当主力用了——理由是稳定和高效,再加上国内网络直连。我准备接下来把它放进日常流程里跑一段时间看看。
一句话总结:升级力度最大的一家,性价比和速度都上来了。
实测:让它画一只“鹈鹕骑车”
光说“能力强”太虚,说一个我实际测的场景——需求就一句话:用 SVG 画一只骑自行车的鹈鹕,要能动起来。这是最近挺火的一个测试题,正好拿它试试水。
结果不只是画出来了:它自己做了一轮校验,中途还发现并修掉了一个真实 bug——SMIL 的 rotate 用的是绝对角度,而基础图形本身已经画在 θ=0 的位置上了,导致远侧腿的落脚位置偏移了 108px 左右。修完之后它把 50 个关键帧全改成了相对基线增量,还自己复核了脚掌和脚踏圆心的最大偏差。
出来的效果:自行车、道路、云、树、太阳,连车轮辐条和腿部踩踏都有。整个文件是自包含的,浏览器打开就跑。
这次任务跑完,工具里留下的记录是这样的:
本轮 4.4M token、缓存命中率 99.5%、用时 28 分 59 秒、首 token 1.4 秒、输出速度 227 tok/s——前面表里说的“200+”,依据就是这里。
6、GLM 5.3 Flash:拿来干日常活的性价比选手 深度用过
这家我是真真切切深度用过一段时间的,日常都拿它来跑。
定位就是 flash:新出的 5.3 Flash,价格相对不带 flash 的型号便宜一些(不算太贵),前段时间还有优惠活动。
日常工作够用。常规任务完成得不错;太难的任务我没交给它,也没必要砸牛刀。
官方订阅特别贵——这是它最大的槽点。中转渠道如果有,用用还是可以的,性价比能拉回来。
速度:30–40 token/s,高峰期也会波动;比不上今天刚发布的 DeepSeek V4.1 Flash(200+),这个差距挺明显的。
一句话总结:预算有限、跑日常和批量任务,它是很实在的选择。
场景对照:什么情况用哪个
按具体工作场景整理,比单纯看能力榜实用:
| 使用场景 | 我的选择 | 说明 |
|---|---|---|
| 前端页面、调样式 / 审美 | Gemini | 同价位下它的样式和审美确实更强,改样式一句就到位 |
| 复杂任务、多轮修改 | GPT | 我目前最信任的兜底选手;不稳定时可切 Claude |
| 硬骨头(GPT 也啃不动) | Claude | 口碑一直很好,我还没实战过,准备留着应急 |
| 日常写代码、跑量 | DeepSeek V4.1 Flash / GLM 5.3 Flash | 两个都快、都便宜;速度上 DeepSeek 更好 |
| 多模态(截图、设计稿) | DeepSeek V4.1 / GLM 5.3 Flash | 都能看图;DeepSeek 之前就吃过缺多模态的亏,现在补上了 |
| 超长上下文 | DeepSeek / GLM | 窗口大小看具体型号,以渠道文档为准 |
| 客户端里当备胎 | Grok | 代码客户端的兼容性好,接入基本不折腾 |
| 追求输出速度 | DeepSeek V4.1 Flash / Gemini | 一个能到 200+,一个能到 100–200,出长内容差距特别明显 |
| 预算敏感 | 国产 Flash + 中转渠道 | 正价大家都贵,中转渠道的价格才是实际成本 |
我现在的组合
当前状态(2026-09)
主力:GPT——4 月底至今没换过,最近不稳定但还没找到完全替代的。
正在考察:DeepSeek V4.1 Flash——速度快、稳定、多模态补齐了,准备转正。
专项:Gemini——只用来做前端和调样式。
备胎:Grok——接各种客户端不折腾。
日常跑量:GLM 5.3 Flash——常规活够用,官方订阅贵就走中转。
应急:Claude——没用过,但遇到啃不动的活会考虑。
核心就一句:GPT 还能打,但不能再单点依赖它。这也是我最近这两周被迫折腾替代方案的最大收获。
以上都是我这几个月的真实使用感受,用的是同一套工作习惯,但样本有限,也一定有偏颇的地方。如果你有不同体验,欢迎来交流。














还没有评论,来说两句吧...