200 支队伍的前 23 名进决赛,我们拿了第 6:靠 126 篇笔记“驯服“ AI

发布时间:2026/8/25 15:56:16
200 支队伍的前 23 名进决赛,我们拿了第 6:靠 126 篇笔记“驯服“ AI 决赛第 6 名线上赛官方分 71.9 → 89.11SLA 和精度全程零扣分。这场先导杯大模型推理优化赛国产加速卡上优化千问的推理服务打完最大的体会不是学会了多少 kernel 技巧而是当 AI 是你的主要执行者时拉开差距的不是谁优化写得猛是协作的状态管理。AI 协作的三个失控瞬间比赛中重度用 AIClaude Code / Codex / Cursor 都一样的应该都经历过1. 记忆蒸发。上次会话里 AI 明明分析过这条优化路线收益只有 0.3%别继续了。开个新会话它兴冲冲又跑了一遍——一天算力没了。会话会被压缩、会断开只存在聊天记录里的结论等于不存在。2. 约定漂移。口头说过不要动 benchmark 参数它当时答应了。三天后帮你顺手优化的时候改了。不是故意的——新会话的它根本不知道有这个约定。3. 噪声当收益。官方评测本身有波动我们实测同版本两次评测分差有 0.06。多少团队把 0.1 的波动当成自己的优化成果反复提交、来回折腾这三个问题的根因是同一个人跟 AI 协作时记忆、口头约定、临时判断全都在悄悄背叛你。解法全部换成落盘文件一句话说清AI 是执行者和审计者但不是记忆者。每次新会话它第一件事不是干活是读文件恢复状态。我们全程靠 5 个机制机制一句话编号持久化笔记每个实验结论落盘日期_主题_状态.md笔记是唯一事实源聊天不算数量化门槛动手前先定多少收益才继续不过线立即关闭不修修补补拖时间不可污染保底最高分版本打 tag SHA256 锁死实验只从干净副本拉分支关闭路线登记表AI 开新路线前必须先查表已关闭且不满足重试条件的直接拒绝执行评测台账每次提交记差值分差在方差内 噪声禁止为噪声改代码两个真实例子差点被噪声骗了。有次官方分从 89.01 掉到 88.95第一反应就是哪次改动导致的回归差点全面排查。台账一查——同一版本的历史评测波动就在这个范围判噪声代码一个字没动。下一场分数回来了验证了判断。没有台账的话这一天就烧在找一个大问题上了。以为很干净的目录。比赛期间我们至少四次在自认为干净的工作目录里抓到上轮实验的残留脏文件有一次险些把失败实验的残留当成提交源码。从此定死铁律动手前git status --short必须为空对外导出永远git archive HEAD绝不复制工作目录。四次是什么概念这种坑不是小心就能避开的是没有纪律一定会踩。另外把官方规则逐条翻译成 if-then 硬规则“git status 不为空 → 停止”、“无授权记录 → 拒绝提交”是我们全程零扣分的直接原因。执行纪律本身就是分数。拿去用这套体系不绑定赛种Kaggle、CTF、黑客松、科研复现都适用。已经做成开源 Agent Skill通用格式Claude Code / Cursor / Codex / 任意聊天 AI 都能用带一键骨架脚本30 秒生成全套目录 https://github.com/yfgug/competition-engineering-skill每个机制的完整故事和细节版见下一篇文章。在 AI 深度参与工程的时代给 AI 建一套持久化的记忆与约束层不是锦上添花——它是决定上限的基础设施。