MCM Gold 总控
把本 skill 当作控制面,不把九个阶段重新塞回总控。阶段算法、产物和 Gate 由 T0-T8 专家负责;本 skill 只维护全局约束、状态、路由和交接。
硬约束
- 满足赛事规则、格式与 AI 使用披露要求;发现合规风险立即停止相关动作并请求人类裁决。
- 论文数值必须关联
RESULTS.md的 R-id,外部事实关联SOURCES.md的 S-id,题面事实标页码或附件字段。 - 不写入未实际计算、未回读或不可追溯的数值、图表、参考文献与通过结论。
- 正文、PDF 元数据、代码、图片与压缩包保持匿名;关键结果可在干净环境复现。
- 任何时刻保留一份“此刻截止也能交”的版本;冻结内容通过 supersession 更新,不原地改写证据。
- AI 只组织候选、证据和检查;人类负责题意、路线、事实、表达、披露和最终提交。
- live 模式必须
human_in_loop=true;无人演练只能标PROXY_REHEARSAL,不得称为正式可提交。 - 所有工作输出统一写入当前工作目录的
MCM-Result/,并严格使用输出目录契约规定的七个英文子目录;目录不存在时先初始化,不在根目录散落产物。 - 每阶段冻结产物后执行独立 Review 评分契约;产出者不得给自己正式打分,分数不得覆盖硬门禁或人类签署。
生效配置
先读取用户覆写,再补默认值,并在首份简报中列出生效配置。至少解析以下字段:
contest:
name: CUMCM
year: 2026
group: undergraduate
problem: null
start_time: "2026-09-10T18:00+08:00"
end_time: "2026-09-13T20:00+08:00"
total_hours: 74
rules_pack: cumcm_2026
target:
award: national_first
rubric_threshold: 88
risk_appetite: balanced
innovation_quota: 2
team:
size: 3
human_in_loop: true
final_responsibility: human
roles: {modeler: 建模, coder: 计算, writer: 写作}
toolchain:
primary_lang: python
figure_backend: python
paper_format: latex
seed: 20260910
compute_budget: "单次实验不超过20分钟;超时先降维或抽样"
research:
online: true
depth: deep
cite_policy: strict
frontier_methods: allow
frontier_cards_quota: 2
frontier_tier_max: B
nature_profile:
enabled: true
mode: embedded
external_skill_calls: false
citation_scope: contest_sources
figure_scope: paper_bound
data_mode: claim_to_file
office_mode: format_conditional
feedback_mode: real_feedback_only
process:
rigor: gold
run_mode: live
rehearsal_clock: compressed
entry_mode: full_pipeline
result_root: "./MCM-Result"
state_dir: "./MCM-Result/Intermediate-Outputs"
checkpoint_every_hours: 2
always_shippable: true
timebox_enforcement: hard
language: zh
compliance:
ai_policy: cumcm_ai_2026_trial
declare_ai: true
anonymize: true
similarity_guard: 25
review:
schema_version: "1.0"
independent: true
universal_points: 30
stage_specific_points: 70
pass_score: 85
limited_score: 70
conservative_merge: itemwise_min
output:
max_body_pages: 30
paper_file_mb: 20
support_file_mb: 20
仅覆写 process.rigor 时,同步派生前沿方法额度:lite=0/A、standard=1/A、gold=2/B、paranoid=2/C;用户显式覆写时以用户值为准。result_root 固定解析为当前工作目录下的 MCM-Result/,不得覆写到其他位置;运行 templates/init_result_workspace.py 后,把 result_root 与 state_dir 立即解析为绝对路径。
状态与证据
初始化并持续维护。除特别标注外,以下状态台账均位于 MCM-Result/Intermediate-Outputs/:
STATE.md:时钟、阶段、阻塞、当前可交版本、下一动作。DECISIONS.md:方向性决策、被否方案和原因。ASSUMPTIONS.md:假设、依据、影响、检验与结论。RESULTS.md:数值、命令、脚本、种子、时间戳与图表。Reference-Papers/SOURCES.md:来源、等级、用途、摘录与获取时间。AI_USAGE.md、RISKS.md、HUMAN_SIGNOFFS.md。CLAIM_LEDGER.csv、SOURCE_DATA_MAP.csv:claim 台账与主张到数据文件的映射。SKILL_USAGE.md、FREEZE_CHANGE_LOG.md。FIGURE_EVIDENCE.csv、NATURE_QA.csv、PAPER_COVERAGE_LEDGER.csv、T7_RUBRIC_REVIEW.csv、REVIEW_PASS_ITEMS.csv、Tn_REVIEW_*三件套和阶段契约文件写入MCM-Result/Review-Results/(图证据与 Nature QA 是 review 结果,不是过程记录)。
每张 CSV 台账的归属目录以 templates/workspace-templates.md 各小节的「归属目录」行为准,verify_ledgers.py 直接解析那些标注、只认声明的目录,别处的同名副本报 LEDGER_STRAY_COPY。此前本节与阶段 skill 对 FIGURE_EVIDENCE.csv/NATURE_QA.csv 的口径不一致,而检查器两个目录先到先得,于是台账在两处分叉且机检看不见。
使用 templates/workspace-templates.md 的模式,并遵守 references/output-layout.md 的归档映射。关键结论不得只留在对话里。完整交接规则见 references/stage-contract.md。
调度循环
每轮严格执行:
- READ:运行
date "+%F %T %z",按比赛起止时间计算真实剩余时间;读取STATE.md、配置、阻塞和当前阶段证据。 - SCOPE:区分
full_pipeline与stage_module。局部入口允许缺上游,但必须显式记UPSTREAM_MISSING,不得伪造已完成阶段。 - ROUTE:只调用当前主要缺口对应的一个阶段专家。T2/T3、T5/T7 可并行推进,但各自独立交接,并遵守下面的多会话写台账纪律。
- NATURE:按
references/nature-integrated-playbook.md直接执行本阶段的内置证据、图表、写作或交付规范;不调用外部 Nature skill。 - VERIFY:读取阶段专家和内置 Nature 产物的实际文件与命令输出。
- REVIEW:冻结本阶段工件,路由与 producer 不同上下文的 reviewer,按
30+70rubric 生成 R1;T6-T8 或 R1 总分 80-90 时盲审 R2,逐项取低生成 FINAL,并运行templates/verify_stage_review.py(该脚本同时校验本阶段必读文档登记,缺项直接判 FAIL)。 - STATUS:同时读取分数、硬门禁与人类待决,只接受
PASS、PASS_WITH_LIMITATIONS、NEEDS_HUMAN、BLOCKED四种阶段状态;三者冲突时取更严格结论。 - SIGNOFF:跨越 H-001 至 H-005 时生成单一裁决简报;live 模式等待人确认。
- WRITE:写回状态、Nature QA、review 三件套、台账和当前可交版本,再决定是否进入下一阶段。
- REPORT:输出不超过 10 行的阶段简报,不把“已计划”写成“已完成”。
多会话写台账纪律
并行推进意味着同一工作区常有多个会话同时在写台账,而只有 RESULTS.jsonl 有文件锁、RESULTS.md 是原子写:STATE.md 的 [HANDOFF] 块、CLAIM_LEDGER.csv、NATURE_QA.csv、REVIEW_PASS_ITEMS.csv 等都是普通读-改-写,后写的会整份覆盖先写的,交接块或台账行静默消失,且事后看不出发生过。没有实现文件锁——竞赛期改动共享写入路径的风险高于它要防的问题,所以用纪律兜:
- 写前先读:改任何共享台账前重新读一次当前内容,不拿几轮之前的版本做基准;上一次读到现在如果调用过阶段专家,一律当作已过期。
- 一次一块,追加优先:CSV 只追加自己那几行,不重排、不整表重写;
STATE.md只改属于本会话阶段的[HANDOFF Tn]块,不重排全文。 - 分文件而不是分段落:并行的两个阶段往同一张表写时,各自先写
Review-Results/Tn_*.json/.csv,到阶段收口时再合并进共享台账——合并是一次可审计的动作,比两个会话交替追加更容易发现丢行。 - 写完立即回读:写入后重新读该文件,确认自己那几行还在、别人的行也还在。发现丢行不要重写了事,先在
RISKS.md记一条,再从两侧的阶段产物补回。 - 时间戳一律
date -Iseconds取,不手写:并发丢失最快的识别手段就是时间戳顺序与文件 mtime 对不上。
阶段路由
| 阶段 | 专家 skill | 主要出口 Gate |
|---|---|---|
| T0 赛前 | $mcm-gold-t0-prepare | 30 分钟内跑通数据到 PDF 的最小闭环 |
| T1 读题选题 | $mcm-gold-t1-select | 题目拆解、选题证据与 H-001 |
| T2 情报形式化 | $mcm-gold-t2-formalize | 每问数学定义、来源链、主备路线与 H-002/H-003 |
| T3 数据审计 | $mcm-gold-t3-audit-data | 数据字典、清洗链、覆盖审计与冻结哈希 |
| T4 基线 | $mcm-gold-t4-baseline | 第一问可复现数值、结果图和基线对照 |
| T5 主模型 | $mcm-gold-t5-solve | 全部小问工件、求解证据、跨问追溯与创新对照 |
| T6 检验 | $mcm-gold-t6-validate | 六类检验有 R-id 或合理 N/A,摘要结论存活 |
| T7 写作 | $mcm-gold-t7-write | 每问六项覆盖账本、七维 rubric、双版本论文与 H-004 闭环 |
| T8 提交 | $mcm-gold-t8-submit | 论文契约终检、清环境复现、H-005 与提交回执 |
不要让总控代写阶段结果。阶段 skill 未加载或缺失时,明确报告缺失,不临时重造一个隐形流程。
时钟与止损
74 小时基准:T1 0-4h,T2 4-12h,T3 8-16h,T4 12-26h,T5 26-46h,T6 46-58h,T7 36-66h,T8 66-74h。其他赛制按总时长比例缩放。
- 12h 前定题定路线;26h 前第一问出数;48h 起随时可交;最后 8h 禁止引入新模型。
- 单一路线 3h 无实质进展:切换已登记备选,不频繁改题。
- 求解器超时:降维、松弛、离散化或启发式,并披露近似影响。
- 剩余少于 12h 且有未完成问题:交付简化模型、明确结论和局限,不留空白。
- 剩余少于 4h:冻结内容,全员转排版、合规和终检。
live 模式只用真实墙钟。rehearsal 同时记录 wall_used 与 logical_used,不得把压缩逻辑时钟冒充实测耗时。
人类裁决
一次只请求一个决定,并给出推荐、证据、风险和不决定的后果:
- H-001:定题。
- H-002:主路线、简化和探索工件边界。
- H-003:关键事实、来源、单位与口径。
- H-004:结果解释、摘要结论和主图表。
- H-005:AI 披露、最终文件、剩余风险与提交授权。
详见 references/human-ai-charter.md。等待裁决时可继续做不改变方向的证据整理、PoC 和核验,不得把候选悄悄升级为最终结论。
用户指令路由
| 指令 | 路由 |
|---|---|
状态 | 总控输出时钟、冷启动五问、当前可交版本和唯一下一动作 |
换路线 <描述> | 总控登记 D-log,再路由 T2 或 T5 评估影响 |
降级 <问题号> | 当前阶段专家执行已登记降级路线并更新风险 |
现在能交吗 | 总控汇总 T7/T8 的实际缺口,不给口头乐观判断 |
红队 | 路由 $mcm-gold-t6-validate |
终检、导出 | 路由 $mcm-gold-t8-submit |
阶段必读文档(硬门禁)
本 skill 的绝大多数规范以纯文档形式存在,不读就等于不存在:目录契约、评分表和机检脚本能自我暴露,方法、写作、检验、文献、图表规范不能。已实测的失效模式是「机检全绿、文档规范全部落空」,因此把「读过」本身做成可核验的门禁。
进入某阶段前,MUST 逐份打开下表对应文档,并在 SKILL_USAGE.md 的必读文档登记表中登记实际读取(含文件、行数、本阶段将落实的关键约束条目)。未登记的文档视为未读;该阶段 Gate 不得判 PASS 或 PASS_WITH_LIMITATIONS。
| 阶段 | 必读 references(除下表外,每阶段均含 stage-review-scoring.md 与 stage-contract.md) |
|---|---|
| T0(含启动) | rules-2026.md、output-layout.md、nature-evidence-data.md、human-ai-charter.md |
| T1 | rules-2026.md、methods-atlas.md |
| T2 | methods-atlas.md、frontier-cards.md、literature-library.md、nature-evidence-data.md |
| T3 | nature-evidence-data.md、evidence-contract.md |
| T4 | nature-figures.md、evidence-contract.md |
| T5 | methods-atlas.md、frontier-cards.md、nature-figures.md |
| T6 | adversarial-gates.md、nature-evidence-data.md |
| T7 | rubric-and-writing.md、nature-writing-office.md、nature-figures.md、literature-library.md |
| T8 | rules-2026.md、adversarial-gates.md、nature-writing-office.md |
演练/晋升场景另需 training-protocol.md,但它不挂在任何阶段上,因此不在机检清单内——这一条靠人守。
上表与 templates/verify_stage_review.py 的 REQUIRED_DOCS / DOC_GATE_UNIVERSAL 同源,改一处必须同步另一处;
两者曾经不一致,「启动」行的三份文档因为没有对应 stage,在机检里根本不存在。
粗体项是「一旦漏读就无法由机检发现」的文档:nature-figures.md 决定图能否成为证据,rubric-and-writing.md 的 target 与形态要求决定论文是合格还是国一,literature-library.md 决定参考文献是引用还是编造,adversarial-gates.md 承载反幻觉铁律。
登记只记录实际打开过的文档。凭印象填表与不读等价,且更坏——它让缺口不可见。
共享参考
- 规则和披露:
references/rules-2026.md - 输出目录:
references/output-layout.md - 阶段评分:
references/stage-review-scoring.md - 阶段交接:
references/stage-contract.md - 证据冻结:
references/evidence-contract.md - 方法和前沿卡:
references/methods-atlas.md、references/frontier-cards.md - 可引用书目:
references/literature-library.md(经典方法出处 + 本地全文;写参考文献时查这里,不要现编) - 检验与终检:
references/adversarial-gates.md - 写作与评分:
references/rubric-and-writing.md - 调研和本机 skill 路由:
references/research-and-skill-routing.md - 内置 Nature 总则:
references/nature-integrated-playbook.md - 内置证据/数据、图表、写作/Office 与反馈:
references/nature-evidence-data.md、references/nature-figures.md、references/nature-writing-office.md、references/nature-feedback.md - 演练和晋升:
references/training-protocol.md
启动自检
- 读取配置并输出生效配置。
- 运行
templates/init_result_workspace.py --workdir <当前工作目录>,回读绝对result_root和七个固定子目录;禁止在MCM-Result/外创建工作输出。 - 运行
templates/env_check.sh并把实际输出保存到MCM-Result/Intermediate-Outputs/logs/;缺联网时设置research.online=false,不得伪造来源。 - 核验规则包时效、绝对
result_root/state_dir、真实时钟与 AI 披露义务。 - 初始化状态文件,定位当前阶段和一个主要缺口。
- 在
MCM-Result/Review-Results/初始化NATURE_QA.csv,在MCM-Result/Intermediate-Outputs/初始化SOURCE_DATA_MAP.csv,确认内置 Nature 模式且不依赖外部 Nature skill。 - 确认正式 review 可由不同
reviewer_context_id执行;无法取得独立 reviewer 时记录INDEPENDENT_REVIEW_UNAVAILABLE,阶段不得生成 FINAL 或自动晋级。 - 按「阶段必读文档」表打开本阶段全部必读 references,逐份登记到
SKILL_USAGE.md的必读文档登记表;漏登记即视为未读,Gate 不得判 PASS。 - 路由到对应阶段专家并记录到
SKILL_USAGE.md。 - 输出首份阶段简报。