# 案例二：AI 编程工具深度测评 — 研究框架与初版结论

> **状态**：IN PROGRESS（框架已完成，系统性测试进行中）
> **角色**：独立研究者 —— 定义评测框架、执行真实任务测试、输出选型建议
> **研究对象**：Claude Code · Codex CLI · Qwen Code（三家均为终端 Agent 形态）
> **本文档价值**：展示如何把「我用过」变成「我能告诉你团队该用什么」

---

## 1. 研究问题

市面上不缺 AI 编程工具的跑分榜单。缺的是回答这个问题的内容：

> **一个真实的开发者/小团队，每天的工作流里，什么任务应该交给哪个工具，为什么？**

### 目标读者

不是围观跑分的爱好者，而是要做**采购与引入决策**的 tech lead / 产品负责人。他们关心的是：

- 哪些任务能放心托管，哪些必须人盯；
- 月度成本怎么预估、怎么封顶；
- 出了错（误删文件、错误提交）的兜底机制。

### 为什么我有资格做这件事

三个工具都在我的日常工具链里重度使用（非试用）：

| 工具 | 我的真实使用场景 |
|------|----------------|
| Claude Code | 日常主力：项目重构、作品集开发、Obsidian 工作流 |
| Codex CLI | 经 CLIProxyAPI 接入，作为备用通道与对照 |
| Qwen Code | 阿里云百炼 Coding Plan 订阅，OpenClaw 六部制中工程类 Agent 的底层引擎 |

同时我是 stata-mcp 的深度定制用户（把它改造成自己论文流水线的执行引擎），并运营一套 10+ Agent 的生产系统——这些场景本身就是最好的测试床。

---

## 2. 评测框架：四维模型

刻意**不用**「基准测试分数」作为主轴——跑分环境与真实任务的相关性太弱。改用四个维度：

### 维度①：任务适配（什么活干得好）

按任务的「上下文广度 × 正确性代价」分四类：

| 任务类型 | 特征 | 典型例子 |
|---------|------|---------|
| T-a 广度型 | 要读很多文件，写很少 | 架构理解、技术债盘点 |
| T-b 深度型 | 单点深挖，正确性代价高 | 复杂 bug、并发问题 |
| T-c 流水型 | 模式重复、量大 | CRUD、样板代码、数据脚本 |
| T-d 协作型 | 跨轮次长会话、需要记忆 | 重构接力、结对调试 |

### 维度②：上下文管理

- 上下文窗口的**有效利用率**（标称大小 ≠ 可用大小）；
- 长会话衰减：第 N 轮还记得第 1 轮的约定吗；
- 压缩策略：自动摘要会不会丢关键约束。

### 维度③：成本

- 计费模式：订阅制 vs 按 token vs 混合；
- **单任务成本方差**（同一个任务不同模型/路径的成本差多少）；
- 成本可预测性：能不能做月度预算。

### 维度④：可控性

这是最容易被忽略、出事最贵的一维：

- 权限模型：文件写入 / shell 执行 / git 操作的审批粒度；
- 可逆性：出错后回滚是否容易；
- 行为透明度：它打算做什么，你能不能提前知道。

---

## 3. 评测任务集

五个任务全部来自我的真实工作流，拒绝人造题：

| # | 任务 | 覆盖类型 | 来源 |
|---|------|---------|------|
| E1 | 在陌生代码库中定位并解释一个跨模块 bug | T-b | GenericAgent 二次开发 |
| E2 | 扩展 MCP 工具链：为既有 Server 增加工具并接通调用 | T-b/T-d | stata-mcp 定制扩展 |
| E3 | 清洗一份脏数据集并产出回归分析脚本 | T-c | CFPS 论文实证流程 |
| E4 | 单文件落地页的设计还原与响应式适配 | T-c/T-d | 本作品集站点开发 |
| E5 | 长会话运维：诊断远端服务异常并给出修复方案 | T-a/T-d | OpenClaw 六部制运维 |

每个任务记录：完成质量、人工干预次数、往返轮数、token 消耗、是否出现危险操作。

> ⚠️ 局限性声明：单人样本、特定技术栈（Python/前端/数据科学）、时间截面快照。结论是「初版判断」，框架本身比结论更持久。

---

## 4. 三工具画像（初版）

### Claude Code — 「重装备的工程合伙人」

- **形态**：终端 Agent，AGENTS.md/CLAUDE.md 项目级指令 + Skills/Hooks/MCP 扩展体系；
- **强项倾向**：T-b/T-d。多步推理与长会话保持力是其设计重心；扩展生态（MCP、hooks、subagent）让「流程固化」成为可能——我的实证研究自动化技能库就建在它上面；
- **可控性**：权限模式分级明确（每步审批 / 会话内放行），危险操作有闸门；
- **成本**：订阅制为主，重会话日边际成本低；上下文压缩机制在超长会话中主动触发。

### Codex CLI — 「通道灵活的备援」

- **形态**：终端 Agent，轻量启动快；
- **在我的体系里的角色**：经代理网关接入，作为 fallback 与交叉验证的第二意见；
- **观察重点**：同样任务下与主力的路径差异——差异本身就有信息量（哪类任务两家方案分歧大，说明该任务对工具敏感）。

### Qwen Code — 「性价比流水线」

- **形态**：终端 Agent，深度绑定 qwen3-coder 系列；
- **强项倾向**：T-c 流水型任务。中文语境理解好，订阅制（百炼 Coding Plan）下高频调用的边际成本极低；
- **在生产中的证据**：六部制中工部/兵部/太子三个高频 Agent 全部由 qwen3-coder-next 驱动——**这不是评测，这是已经跑了半年的生产负载**。

---

## 5. 初版判断（待系统测试校准）

| 维度 | Claude Code | Codex CLI | Qwen Code |
|------|------------|-----------|-----------|
| 任务适配 | 深度型/协作型优先 | 均衡 | 流水型优先 |
| 上下文管理 | 强（主动压缩+项目记忆文件） | 中 | 中 |
| 成本 | 订阅内重度使用友好 | 视通道而定 | 高频场景最优 |
| 可控性 | 审批粒度细 | 中 | 基础 |

**一句话版本**：没有「最好」的工具，只有「任务-工具」的匹配表——这正是本文档 §6 要交付的东西。

## 6. 最终交付物（进行中）

1. **选型决策树**：输入你的任务类型分布 + 预算约束 → 输出推荐组合；
2. **团队引入清单**：权限基线、成本护栏、上手路径、退出方案（lock-in 评估）。

---

## 附：方法论自检

- ✅ 所有工具均为付费/生产级使用，非浅尝；
- ✅ 任务来自真实工作流，可复现；
- ⚠️ 无盲测（无法对自己常用的工具盲测）——用「分歧任务重点复核」缓解；
- ⚠️ 版本迭代快，结论注明测试时间窗。

*相关案例：[CASE-001 六部制多 Agent 系统](case-001-multi-agent-system.md) · [CASE-003 数据研究工作台](../index.html#cases)*
