WRITING
三家订阅的跑分账:K3 管量、Claude 管质、GPT 管尖

我同时订着三家 AI:Kimi、Claude、GPT。每个月三笔订阅费雷打不动地扣,但说实话,分工一直靠手感——写代码顺手开这个,写文档顺手开那个,到底谁该干什么,没认真算过账。
上周 Kimi K3 发布,官方放出一组对比跑分:14 项 benchmark,K3、Claude 新旗舰 Fable 5、GPT-5.6 Sol 同台,全部把 thinking effort 拉满。我把两张图拆开逐项抄了一遍,再对照自己过去一个月的用法,把五类日常任务的路由重新排了一遍。
结论先说:日常干活 Kimi K3 主力,成稿质感和视觉理解 Claude,深推理单点和终端疑难 GPT。下面是账。
一、14 项总账:没有谁通吃,但冠军分布很说明性格
把 14 项 bench 按冠军归堆:

第三方口径总数上 Fable 5 领先一个身位,但看冠军落在哪:
- K3 的 5 冠:SWE Marathon(长程软件工程,42.0 vs 第二名 40.0)、Program Bench(77.8)、Automation Bench(30.8)、SpreadsheetBench(34.8)、BrowseComp 联网调研(91.2)。
- Fable 5 的 6 冠:GDPval 职业案头(Elo 1760)、Briefcase 商务案头(1583)、JobBench(57.4)、FrontierSWE 大重构(86.6)、CharXiv 图表理解(93.5)、Zerobench 视觉推理(46.0)。
- GPT-5.6 Sol 的 2 冠:DeepSWE 深推理(73.0)、Terminal Bench(88.8)。
看出性格了吗?K3 赢的全是"高频体力活"——长程 agentic、联网找资料、自动化、表格,这些恰好是我每天调用次数最多的场景。Fable 5 赢的全是"案头质感活"——职业文档、商务写作、视觉理解。GPT-5.6 赢的是"尖峰脑力活"——单点深推理和终端操作。
Terminal Bench 值得单独说一句:GPT-5.6 是 88.8,K3 是 88.3,差 0.5 基本算打平,而 Opus-4.8 和 Fable 5 都只有 84.6。
二、Coding 六项细看:长程 agentic 是分水岭

我最关心的是代码。六项里信息密度最高的是 SWE Marathon:它测的不是写一段代码对不对,而是连续几个小时、几十轮工具调用的长程工程能力——这正是我用 AI 干活的主战场。
K3 在这里 42.0 排第一,Opus-4.8 40.0 第二,GPT-5.6 Sol 39.0 第三。而 GPT-5.5 只有 14.0——同一家的两代模型,长程能力差了将近三倍。
这不是纸面数据。这篇文章的素材本身,就是 K3 干出来的一个典型长程活:我让它审计我的整个期权交易工作区,它先派 6 路并行子代理分头摸底,再派 5 路并行施工,70 项文件变更、41 项归档搬家、最后 100 个测试全绿、文档一致性检查零违例,一把过。中间只撞了一次配额上限,续上接着跑。
但要诚实:DeepSWE(深推理)上 GPT-5.6 是 73.0,明显甩开 Fable 5 的 70.0 和 K3 的 67.5。遇到那种"想半小时才能动笔"的硬算法题,GPT-5.6 仍是第一选择。
三、联网调研和自动化:K3 的两个"隐形冠军"

自媒体创作者最该看的是 BrowseComp(联网调研):K3 91.2 第一,GPT-5.6 90.4 紧随其后,Fable 5 只有 88.0。选题、找素材、查证事实——自媒体工作流的前半截就是调研,这项第一直接决定了我把调研活派给谁。
Automation Bench(自动化)K3 30.8 也是第一。加上 SpreadsheetBench(34.8 对 Fable 的 34.7 险胜),日常那些"帮我跑个脚本整理数据"的活,K3 都是最优解。
四、我的五类任务路由表
把跑分翻译成自己的分工。我每天的任务就五类:
| 任务 | 主力 | 什么时候换 |
|---|---|---|
| 代码(harness/引擎/网页) | K3 | 单点深推理算法 → GPT-5.6;全新架构/大重构 → Fable 5 |
| 写文档(报告/长稿) | 草稿改版 K3,重要成稿 Fable 5 | 机械格式活 → Opus-4.8 分包 |
| 自媒体(小红书/公众号/X) | 调研+初稿 K3 | 终稿文风打磨 → Fable 5 |
| 视频 | 视频分析/抽帧理解 Fable 5 | 脚本口播稿按自媒体走;视频生成这些模型都不干 |
| 生图 | 走专用生图模型 | prompt 工程/HTML 作图 → K3;验图 → Fable 5 / K3 |
两个额外说明:
- 视频和生图,这 14 项跑分都不覆盖。语言模型不产视频也不产图,别拿它们干这个。跑分里和视觉沾边的只有 CharXiv 和 Zerobench 两项"视觉理解"——看视频、验生成图用,Fable 5 双冠,K3 双亚只差 2 分。
- Opus-4.8 没被淘汰,是被降级。它现在只接机械分包活——这不是性能判断,是成本判断:Fable 配额要省着用,简单的活点名分包给 Opus。
五、泼两盆冷水
第一盆:14 项里有一项(Kimi Code Bench 2.0)是官方自测,我给它打了折扣,没计入冠军统计口径的核心证据。剩下 13 项是第三方或公开 bench,相对可信。
第二盆:所有数字都是 thinking effort 拉满档跑出来的。日常开低档快速问答,排名可能完全不同。这张路由表只对"重活"有效——轻活我向来是谁手边开谁。
收尾
三笔订阅费,以前是为"万一要用"付的保险费,现在各有各的岗:K3 管干活的量,Claude 管成稿的质,GPT 管推理的尖。
跑分会变,模型会换代,这张表估计也就管用两三个月。但"按任务性格分工"这个思路不会过时——下次新模型发布,把它的跑分往这张表里一插,路由重新排一遍就是了。