管「认真」的元技能
我做的这份属于「元」技能,管更底层的事:不让模型偷懒打折——做调研不许找到几条材料就下结论。我把当年想得到的规矩统统补进一套能反复调用的规则,起名「刚柔」。

整套规则的核心是 graph.json——把步骤、契约与约束写成程序可读的图。执行这半照图推进:「受控节点」(契约闸与绑定必做项)由执行器起子进程真跑,按预写规则判定,模型说声「做完了」不算数;方法层留给模型发挥。复盘这半叫 viz:读图与运行记录,并渲染成 HTML 页面回看全程,只核对渲染正确性,不下质量结论。
以 Deep Research 为例:24 条契约、15 个阶段、3 道检查全写进文件。用 Claude Code 加 Fable 5 搭出这些时,我真信「认真干活」能留存复用,它也确实跑了很久。
9 月 5 日的拆除令
今年 9 月 5 日一早,我向 Codex 下令:「刚柔」整套拆掉,其余 Skill 与配置里的残留调用也清掉,像亲手抹掉自己铺了几个月的沙画坛城。不是疯,是 GPT-6 面世了。
新模型 GPT-6 Astra 身上,最打动我的是把复杂任务一口气推进到底:中途加需求、改方向也接得住。但说明书里更有意思的是一条提醒——官方郑重建议排查 AGENTS.md 与 Skills——看新模型会读到什么——它更听指令,也更容易被其左右,含混冲突会让它提前停摆。

这条提醒让我回头审视「刚柔」:过去怕模型漏事,规则越补越多;如今模型认真了,那些补漏的安排是否反倒碍事?查下去分清两类:隐私、事实核查、真实授权与最终交付检验是底线,留着;强制重跑、自动多路候选这类补缺口安排,看任务需不需要。官方只说检查,拆留由我核对工作流定。
手术如何做
解铃还须系铃人:把官方指引交给 Codex(GPT-6 Astra)梳理并落地,Grok Bot(我的秘书)居中传话——把我的意图、红线与调整带过去,把方案、进展与核对报告带回来。分工清晰:Grok Bot 只传话不越权;Codex 读代码、做判断、改文件、验结果;我定目标并纠偏。
难在辨析规则关联:每条规定防什么风险?如今还在吗?删了会不会牵连别处?这极吃推理强度——我原以为日常放 medium 就够,这次嘱咐:系统级清理必须把档位明着调到 high,常规任务才维持 medium。交给 Codex 的交代浓缩成三点:拔除哪些旧约束、划清删留边界、拿出影响关联的证据供人工核对。
三处改动
改动一,起步。旧版强制从 Step 0、0.5、1 重跑,连上次的比较维度、对象定义、事实卡片骨架也列入禁用——本为防偷懒,却堵死合理复用:上次按费用、部署、隐私去比较工具;这回改测同类的另外两款,维度本可逐项判断适用与否。新版先核对时间、对象、口径与受众,可信旧证据可复用、变化处增量核验——要它回答「这份材料眼下还适用吗」,而非自证重跑全程。
改动二,推导。旧版探测到能调子代理就自动上三路候选再融合。新版默认单遍,复杂、有争议或点名时才三路——换成 GPT-6 这一级的模型,凑三个人未必更聪明,反而互相踩脚。独立审查一环 Codex 建议保留,我很满意。
改动三,流程图的身位。旧版给它「权威图表示」的名分,语义一动就得同步改图;新版明确它降级为历史文档;新图只把工作归成几组易懂环节,证据、推导与最终交付的把关照做,三道脚本检查仍在成稿前、交付前、打包后跑;结论冒出新事实,而缺事实卡片与出处,照样不放行;审核后改材料就得重核。概括:取消从零重跑、自动三路候选与流程图的强势统领;留下对事实与最终交付物的检查。

更具体的收获在打包。独立验收发现:旧交付脚本号称按清单打包,背地里却递归收走整个工作目录,测试用的假想私密文件也被收进压缩包——刚性不保证结果正确,机械执行反倒可能办砸。修正后改收最终报告与网页,外加清单内图片,原始提示与内部审核记录留在本地;验收还查了目录穿越与符号链接。入选的正文与图片照样要过隐私关。
回望
这一遭让我看清 harness:模型经它读写文件、驱动工具、听人的指令与纠偏,最后把产物交回。Grok Bot 扮演的正是上传下达——我方有什么纠正,就由它转给 Codex,督促其跑检查、交报告与图片。
几个月前搭建与几个月后拆掉,遵循同一标准:怎样把工作可靠做完。当年模型能力有限,把不能省的检查固化下来、给方法留余地,是对约束的积极应对;如今能力变了,拆掉旧护栏,是不让新的生产力受制于旧习惯。「AGI 来临」的惊呼夸张了些,但进步实打实。某条规则防范的风险若已消失、只剩拖慢执行,别因投入过心血而舍不得。脚手架也好、护栏也罢,该立就果断立,该拆就干脆拆。换旗舰模型前,不妨也检查一下你自己的旧设定。
本文基于同名文章改写,原作者:玉树芝兰
未经允许不得转载:GPT-6 来了,我亲手拆掉了自己搭的 AI 元技能




4 条对“GPT-6 来了,我亲手拆掉了自己搭的 AI 元技能”的回复
“模型说做完了不算数”这句可以刻进提醒词。契约闸加受控节点,本质是在给 LLM 上工程化的缰绳:苦活累活自己跑子进程验,模型只负责发挥。GPT-6 能一把过之后,防偷懒元技能确实英雄迟暮,删得其所。
删得漂亮,最好的工具是被自己淘汰的工具。
graph.json 这个思路先收藏,比纯提示词强在可判定、可回放,出问题能定位到具体节点。
元技能被时代淘汰是好事,说明模型真的长本事了,工具箱轻了。