← 返回列表

同一模型换 harness,成绩差一截:我怎么做可复现对照

·2026-09-23已进箱
固定任务集再换外壳测一轮,比换模型更便宜也更诚实。

大家好,我是珂抖屁。

圈里又在传一类对照:同款前沿模型、同一批任务,只换外壳(harness),成绩能差一截。

讨论里出现的型号写法不一——有人写 GPT-5.5,有人写 GPT-5.x 家族——我按公开帖与评测文的口径称,不编造官方发布单上不存在的细节。对照形态才是重点:权重不动,agent 循环、工具表、重试、沙箱、上下文策略换了,分数或体感跟着跳。

有公开评测把同款模型放进原生 Codex 壳与另一套 SDK / 产品壳里比,功能项可以拉开到几十个百分点量级(例如 Endor Labs 相关报道对 GPT-5.5:原生 Codex 一侧与 Cursor SDK 一侧的功能分差距被写成大约二十六分)。也有更克制的配对研究(同模型、原生壳 vs 中立壳)给出「平均优势分不出、区间很大」的结论。方向不必吵成信仰:外壳是一等变量。 有人把同一逻辑顺手接到「那 Claude Code 和 Codex 我该拴哪边」——这才是一人公司真正要买的决策,不是又一张领袖板截图。

这和「体验大于模型分」不是同一篇文章

我写过日常主力按「住得下来」选壳:打断少、搬运少、失败能看懂。那是体感采购

这篇换刀口:可复现对照。 不问你喜不喜欢某个 UI,问——同一模型、同一任务集,换壳之后,通没通、稳不稳、贵不贵。

口号「体验 > 模型分」容易变成站队。对照实验逼你诚实:若壳 A 让同模型多过 20% 的你自己的题,你还在为壳 B 的品牌故事付钱,那是捐赠,不是选型。

外壳到底动了什么

同权重只换外壳:两套壳成绩对照示意

同权重只换外壳:两套壳成绩对照示意

模型权重可以一字不改。外壳仍在改这些东西:

1.下一步谁说了算:agent loop 怎么规划、何时停、失败是否重试。

2.工具长什么样:schema 厚度、默认权限、输出怎么灌回上下文。

3.仓库怎么进脑子:检索、编辑、终端、测试门禁是否开箱即用。

4.错误怎么被看见:diff 清晰度、日志、是否只剩一句「弄坏了一些东西」。

所以「同模型」对照,测的从来不是智商百分比本身,是智商被哪套操作系统托管。Sam Altman 一类公开访谈里也有人把 harness 与模型说成越来越分不开——这话我当提醒:你买的经常是组合,发票上却只印模型名。

一人公司怎么测:便宜、可复现、别自拍自演

我不要二十一组矩阵。固定一套自己的任务集,十到二十条就够:

含:改小功能、修红测、读陌生模块写说明、一次带工具的排查。

写清:仓库快照、禁止动的路径、怎样算过(测试绿 / diff 可审 / 行为可演示)。

先锁模型,只换壳;或先锁壳,只换模型——一次只动一个旋钮。

每条题记四列:通否、你打断几次、大致花费、翻车是否可解释。

跑两轮同壳,看方差。方差比均值难看时,别急着宣布冠军——说明题太噪,或壳太飘。

公开榜单可以当叫醒钟。你的任务集才是合同。Endor 那类大分差,证明「值得测」;不证明「你的仓库也会差二十六分」。克制研究证明「平均可能拉不开」;不证明「你的高频题也无感」。自己的对照,仲裁权在你。

接到「Claude Code vs Codex」时怎么用

产品选型讨论里,人们常把两壳绑在不同模型光环上。可复现对照逼你拆开:

若你关心的是某家权重,就把它放进两套你够得到的壳里各跑一轮。

若你关心的是日常班底,再叠体感项:合盖能否续、权限是否敢隔夜、skills 是否锁死在壳目录。

可能出现尴尬结果:榜单宠儿在你的题上不如「更顺的壳 + 够用的模型」。也可能相反。尴尬比站队有用。

我以前写过 Harness 税:成功率差不多,成本可以差一截。这篇是税的下一章——有时成功率本身也被壳拉动。 成本账与正确率账要一起看:贵且正确,和便宜且正确,和便宜却总返工,是三种生意。

选型纪律:先换壳,再换模型(多数时候)

默认顺序我钉成:

1.任务集冻结(本周不改题)。

2.同模型换壳测一轮。

3.仍不够,再 同壳换模型

4.最后才考虑换账号体系、迁 skills、重训团队习惯——那是搬家,不是调参。

为什么先换壳?因为一人公司换模型常连带换账单、限流、工具默认值;变量缠在一起,你分不清是谁赢了。壳若支持多模型,先在壳内做 A/B,是最便宜的诚实。

例外:你的壳根本锁死模型,或合规只允许一家——那就别装可插拔,直接在约束内优化任务集与权限。

边界:对照不是真理机

防三种误读:

把单次评测差当分永恒物理定律。 壳会改版,模型会改版,你的题会过期。

把「壳赢了」读成「模型不行」。 可能是模型配错了操作系统。

为了追分关掉所有安全闸。 分高但敢隔夜跑,才叫产线;分高但不许碰生产,那是演示。

对照的目的是减少自欺,不是生产新的宗教。

我自己的判断

模型不是瓶颈的全部句子;外壳经常才是你体感瓶颈的那半句。

近两天的同模型换壳讨论,价值不是又给某品牌加冕,是给你一套更便宜的选型动作:固定任务集,换外壳测一轮,再决定要不要为「更强模型」付溢价。

我自己会把这句话贴在采购表上:先问「同权重换壳差多少」,再问「换权重值不值」。 前一个问题,一人公司测得起;后一个问题,在没做前一个之前,答案多半是气氛。