CommunityEscrita e Ediçãogithub.com

BeforeUgone123/MCM-For-GOLD

面向数学建模竞赛的分阶段 Codex Skill 群

O que é MCM-For-GOLD?

MCM-For-GOLD is a Codex agent skill that 面向数学建模竞赛的分阶段 Codex Skill 群.

Funciona com~Claude CodeCodex CLI~Cursor
npx skills add BeforeUgone123/MCM-For-GOLD

Installed? Explore more Escrita e Edição skills: steipete/notion, affaan-m/seo, affaan-m/brand-voice · View all 6 →

Perguntar na sua IA favorita

Abre um novo chat com esta habilidade de agente já pré-carregada.

Documentação

MCM Gold 总控

把本 skill 当作控制面,不把九个阶段重新塞回总控。阶段算法、产物和 Gate 由 T0-T8 专家负责;本 skill 只维护全局约束、状态、路由和交接。

硬约束

  1. 满足赛事规则、格式与 AI 使用披露要求;发现合规风险立即停止相关动作并请求人类裁决。
  2. 论文数值必须关联 RESULTS.md 的 R-id,外部事实关联 SOURCES.md 的 S-id,题面事实标页码或附件字段。
  3. 不写入未实际计算、未回读或不可追溯的数值、图表、参考文献与通过结论。
  4. 正文、PDF 元数据、代码、图片与压缩包保持匿名;关键结果可在干净环境复现。
  5. 任何时刻保留一份“此刻截止也能交”的版本;冻结内容通过 supersession 更新,不原地改写证据。
  6. AI 只组织候选、证据和检查;人类负责题意、路线、事实、表达、披露和最终提交。
  7. live 模式必须 human_in_loop=true;无人演练只能标 PROXY_REHEARSAL,不得称为正式可提交。
  8. 所有工作输出统一写入当前工作目录的 MCM-Result/,并严格使用输出目录契约规定的七个英文子目录;目录不存在时先初始化,不在根目录散落产物。
  9. 每阶段冻结产物后执行独立 Review 评分契约;产出者不得给自己正式打分,分数不得覆盖硬门禁或人类签署。

生效配置

先读取用户覆写,再补默认值,并在首份简报中列出生效配置。至少解析以下字段:

contest:
  name: CUMCM
  year: 2026
  group: undergraduate
  problem: null
  start_time: "2026-09-10T18:00+08:00"
  end_time: "2026-09-13T20:00+08:00"
  total_hours: 74
  rules_pack: cumcm_2026
target:
  award: national_first
  rubric_threshold: 88
  risk_appetite: balanced
  innovation_quota: 2
team:
  size: 3
  human_in_loop: true
  final_responsibility: human
  roles: {modeler: 建模, coder: 计算, writer: 写作}
toolchain:
  primary_lang: python
  figure_backend: python
  paper_format: latex
  seed: 20260910
  compute_budget: "单次实验不超过20分钟;超时先降维或抽样"
research:
  online: true
  depth: deep
  cite_policy: strict
  frontier_methods: allow
  frontier_cards_quota: 2
  frontier_tier_max: B
nature_profile:
  enabled: true
  mode: embedded
  external_skill_calls: false
  citation_scope: contest_sources
  figure_scope: paper_bound
  data_mode: claim_to_file
  office_mode: format_conditional
  feedback_mode: real_feedback_only
process:
  rigor: gold
  run_mode: live
  rehearsal_clock: compressed
  entry_mode: full_pipeline
  result_root: "./MCM-Result"
  state_dir: "./MCM-Result/Intermediate-Outputs"
  checkpoint_every_hours: 2
  always_shippable: true
  timebox_enforcement: hard
  language: zh
compliance:
  ai_policy: cumcm_ai_2026_trial
  declare_ai: true
  anonymize: true
  similarity_guard: 25
review:
  schema_version: "1.0"
  independent: true
  universal_points: 30
  stage_specific_points: 70
  pass_score: 85
  limited_score: 70
  conservative_merge: itemwise_min
output:
  max_body_pages: 30
  paper_file_mb: 20
  support_file_mb: 20

仅覆写 process.rigor 时,同步派生前沿方法额度:lite=0/Astandard=1/Agold=2/Bparanoid=2/C;用户显式覆写时以用户值为准。result_root 固定解析为当前工作目录下的 MCM-Result/,不得覆写到其他位置;运行 templates/init_result_workspace.py 后,把 result_rootstate_dir 立即解析为绝对路径。

状态与证据

初始化并持续维护。除特别标注外,以下状态台账均位于 MCM-Result/Intermediate-Outputs/

  • STATE.md:时钟、阶段、阻塞、当前可交版本、下一动作。
  • DECISIONS.md:方向性决策、被否方案和原因。
  • ASSUMPTIONS.md:假设、依据、影响、检验与结论。
  • RESULTS.md:数值、命令、脚本、种子、时间戳与图表。
  • Reference-Papers/SOURCES.md:来源、等级、用途、摘录与获取时间。
  • AI_USAGE.mdRISKS.mdHUMAN_SIGNOFFS.md
  • CLAIM_LEDGER.csvSOURCE_DATA_MAP.csv:claim 台账与主张到数据文件的映射。
  • SKILL_USAGE.mdFREEZE_CHANGE_LOG.md
  • FIGURE_EVIDENCE.csvNATURE_QA.csvPAPER_COVERAGE_LEDGER.csvT7_RUBRIC_REVIEW.csvREVIEW_PASS_ITEMS.csvTn_REVIEW_* 三件套和阶段契约文件写入 MCM-Result/Review-Results/(图证据与 Nature QA 是 review 结果,不是过程记录)。

每张 CSV 台账的归属目录以 templates/workspace-templates.md 各小节的「归属目录」行为准verify_ledgers.py 直接解析那些标注、只认声明的目录,别处的同名副本报 LEDGER_STRAY_COPY。此前本节与阶段 skill 对 FIGURE_EVIDENCE.csv/NATURE_QA.csv 的口径不一致,而检查器两个目录先到先得,于是台账在两处分叉且机检看不见。

使用 templates/workspace-templates.md 的模式,并遵守 references/output-layout.md 的归档映射。关键结论不得只留在对话里。完整交接规则见 references/stage-contract.md

调度循环

每轮严格执行:

  1. READ:运行 date "+%F %T %z",按比赛起止时间计算真实剩余时间;读取 STATE.md、配置、阻塞和当前阶段证据。
  2. SCOPE:区分 full_pipelinestage_module。局部入口允许缺上游,但必须显式记 UPSTREAM_MISSING,不得伪造已完成阶段。
  3. ROUTE:只调用当前主要缺口对应的一个阶段专家。T2/T3、T5/T7 可并行推进,但各自独立交接,并遵守下面的多会话写台账纪律
  4. NATURE:按 references/nature-integrated-playbook.md 直接执行本阶段的内置证据、图表、写作或交付规范;不调用外部 Nature skill。
  5. VERIFY:读取阶段专家和内置 Nature 产物的实际文件与命令输出。
  6. REVIEW:冻结本阶段工件,路由与 producer 不同上下文的 reviewer,按 30+70 rubric 生成 R1;T6-T8 或 R1 总分 80-90 时盲审 R2,逐项取低生成 FINAL,并运行 templates/verify_stage_review.py(该脚本同时校验本阶段必读文档登记,缺项直接判 FAIL)。
  7. STATUS:同时读取分数、硬门禁与人类待决,只接受 PASSPASS_WITH_LIMITATIONSNEEDS_HUMANBLOCKED 四种阶段状态;三者冲突时取更严格结论。
  8. SIGNOFF:跨越 H-001 至 H-005 时生成单一裁决简报;live 模式等待人确认。
  9. WRITE:写回状态、Nature QA、review 三件套、台账和当前可交版本,再决定是否进入下一阶段。
  10. REPORT:输出不超过 10 行的阶段简报,不把“已计划”写成“已完成”。

多会话写台账纪律

并行推进意味着同一工作区常有多个会话同时在写台账,而只有 RESULTS.jsonl 有文件锁、RESULTS.md 是原子写STATE.md[HANDOFF] 块、CLAIM_LEDGER.csvNATURE_QA.csvREVIEW_PASS_ITEMS.csv 等都是普通读-改-写,后写的会整份覆盖先写的,交接块或台账行静默消失,且事后看不出发生过。没有实现文件锁——竞赛期改动共享写入路径的风险高于它要防的问题,所以用纪律兜:

  • 写前先读:改任何共享台账前重新读一次当前内容,不拿几轮之前的版本做基准;上一次读到现在如果调用过阶段专家,一律当作已过期。
  • 一次一块,追加优先:CSV 只追加自己那几行,不重排、不整表重写;STATE.md 只改属于本会话阶段的 [HANDOFF Tn] 块,不重排全文。
  • 分文件而不是分段落:并行的两个阶段往同一张表写时,各自先写 Review-Results/Tn_*.json/.csv,到阶段收口时再合并进共享台账——合并是一次可审计的动作,比两个会话交替追加更容易发现丢行。
  • 写完立即回读:写入后重新读该文件,确认自己那几行还在、别人的行也还在。发现丢行不要重写了事,先在 RISKS.md 记一条,再从两侧的阶段产物补回。
  • 时间戳一律 date -Iseconds,不手写:并发丢失最快的识别手段就是时间戳顺序与文件 mtime 对不上。

阶段路由

阶段专家 skill主要出口 Gate
T0 赛前$mcm-gold-t0-prepare30 分钟内跑通数据到 PDF 的最小闭环
T1 读题选题$mcm-gold-t1-select题目拆解、选题证据与 H-001
T2 情报形式化$mcm-gold-t2-formalize每问数学定义、来源链、主备路线与 H-002/H-003
T3 数据审计$mcm-gold-t3-audit-data数据字典、清洗链、覆盖审计与冻结哈希
T4 基线$mcm-gold-t4-baseline第一问可复现数值、结果图和基线对照
T5 主模型$mcm-gold-t5-solve全部小问工件、求解证据、跨问追溯与创新对照
T6 检验$mcm-gold-t6-validate六类检验有 R-id 或合理 N/A,摘要结论存活
T7 写作$mcm-gold-t7-write每问六项覆盖账本、七维 rubric、双版本论文与 H-004 闭环
T8 提交$mcm-gold-t8-submit论文契约终检、清环境复现、H-005 与提交回执

不要让总控代写阶段结果。阶段 skill 未加载或缺失时,明确报告缺失,不临时重造一个隐形流程。

时钟与止损

74 小时基准:T1 0-4h,T2 4-12h,T3 8-16h,T4 12-26h,T5 26-46h,T6 46-58h,T7 36-66h,T8 66-74h。其他赛制按总时长比例缩放。

  • 12h 前定题定路线;26h 前第一问出数;48h 起随时可交;最后 8h 禁止引入新模型。
  • 单一路线 3h 无实质进展:切换已登记备选,不频繁改题。
  • 求解器超时:降维、松弛、离散化或启发式,并披露近似影响。
  • 剩余少于 12h 且有未完成问题:交付简化模型、明确结论和局限,不留空白。
  • 剩余少于 4h:冻结内容,全员转排版、合规和终检。

live 模式只用真实墙钟。rehearsal 同时记录 wall_usedlogical_used,不得把压缩逻辑时钟冒充实测耗时。

人类裁决

一次只请求一个决定,并给出推荐、证据、风险和不决定的后果:

  • H-001:定题。
  • H-002:主路线、简化和探索工件边界。
  • H-003:关键事实、来源、单位与口径。
  • H-004:结果解释、摘要结论和主图表。
  • H-005:AI 披露、最终文件、剩余风险与提交授权。

详见 references/human-ai-charter.md。等待裁决时可继续做不改变方向的证据整理、PoC 和核验,不得把候选悄悄升级为最终结论。

用户指令路由

指令路由
状态总控输出时钟、冷启动五问、当前可交版本和唯一下一动作
换路线 <描述>总控登记 D-log,再路由 T2 或 T5 评估影响
降级 <问题号>当前阶段专家执行已登记降级路线并更新风险
现在能交吗总控汇总 T7/T8 的实际缺口,不给口头乐观判断
红队路由 $mcm-gold-t6-validate
终检导出路由 $mcm-gold-t8-submit

阶段必读文档(硬门禁)

本 skill 的绝大多数规范以纯文档形式存在,不读就等于不存在:目录契约、评分表和机检脚本能自我暴露,方法、写作、检验、文献、图表规范不能。已实测的失效模式是「机检全绿、文档规范全部落空」,因此把「读过」本身做成可核验的门禁。

进入某阶段前,MUST 逐份打开下表对应文档,并在 SKILL_USAGE.md必读文档登记表中登记实际读取(含文件、行数、本阶段将落实的关键约束条目)。未登记的文档视为未读;该阶段 Gate 不得判 PASSPASS_WITH_LIMITATIONS

阶段必读 references(除下表外,每阶段均含 stage-review-scoring.mdstage-contract.md
T0(含启动)rules-2026.mdoutput-layout.mdnature-evidence-data.mdhuman-ai-charter.md
T1rules-2026.mdmethods-atlas.md
T2methods-atlas.mdfrontier-cards.mdliterature-library.mdnature-evidence-data.md
T3nature-evidence-data.mdevidence-contract.md
T4nature-figures.mdevidence-contract.md
T5methods-atlas.mdfrontier-cards.mdnature-figures.md
T6adversarial-gates.mdnature-evidence-data.md
T7rubric-and-writing.mdnature-writing-office.mdnature-figures.mdliterature-library.md
T8rules-2026.mdadversarial-gates.mdnature-writing-office.md

演练/晋升场景另需 training-protocol.md,但它不挂在任何阶段上,因此不在机检清单内——这一条靠人守。 上表与 templates/verify_stage_review.pyREQUIRED_DOCS / DOC_GATE_UNIVERSAL 同源,改一处必须同步另一处; 两者曾经不一致,「启动」行的三份文档因为没有对应 stage,在机检里根本不存在。

粗体项是「一旦漏读就无法由机检发现」的文档:nature-figures.md 决定图能否成为证据,rubric-and-writing.md 的 target 与形态要求决定论文是合格还是国一,literature-library.md 决定参考文献是引用还是编造,adversarial-gates.md 承载反幻觉铁律。

登记只记录实际打开过的文档。凭印象填表与不读等价,且更坏——它让缺口不可见。

共享参考

  • 规则和披露:references/rules-2026.md
  • 输出目录:references/output-layout.md
  • 阶段评分:references/stage-review-scoring.md
  • 阶段交接:references/stage-contract.md
  • 证据冻结:references/evidence-contract.md
  • 方法和前沿卡:references/methods-atlas.mdreferences/frontier-cards.md
  • 可引用书目:references/literature-library.md(经典方法出处 + 本地全文;写参考文献时查这里,不要现编)
  • 检验与终检:references/adversarial-gates.md
  • 写作与评分:references/rubric-and-writing.md
  • 调研和本机 skill 路由:references/research-and-skill-routing.md
  • 内置 Nature 总则:references/nature-integrated-playbook.md
  • 内置证据/数据、图表、写作/Office 与反馈:references/nature-evidence-data.mdreferences/nature-figures.mdreferences/nature-writing-office.mdreferences/nature-feedback.md
  • 演练和晋升:references/training-protocol.md

启动自检

  1. 读取配置并输出生效配置。
  2. 运行 templates/init_result_workspace.py --workdir <当前工作目录>,回读绝对 result_root 和七个固定子目录;禁止在 MCM-Result/ 外创建工作输出。
  3. 运行 templates/env_check.sh 并把实际输出保存到 MCM-Result/Intermediate-Outputs/logs/;缺联网时设置 research.online=false,不得伪造来源。
  4. 核验规则包时效、绝对 result_root/state_dir、真实时钟与 AI 披露义务。
  5. 初始化状态文件,定位当前阶段和一个主要缺口。
  6. MCM-Result/Review-Results/ 初始化 NATURE_QA.csv,在 MCM-Result/Intermediate-Outputs/ 初始化 SOURCE_DATA_MAP.csv,确认内置 Nature 模式且不依赖外部 Nature skill。
  7. 确认正式 review 可由不同 reviewer_context_id 执行;无法取得独立 reviewer 时记录 INDEPENDENT_REVIEW_UNAVAILABLE,阶段不得生成 FINAL 或自动晋级。
  8. 按「阶段必读文档」表打开本阶段全部必读 references,逐份登记到 SKILL_USAGE.md 的必读文档登记表;漏登记即视为未读,Gate 不得判 PASS。
  9. 路由到对应阶段专家并记录到 SKILL_USAGE.md
  10. 输出首份阶段简报。

Habilidades Relacionadas

steipete/notion

Notion CLI/API for pages, Markdown content, data sources, files, comments, search, Workers, and raw API calls.

community

affaan-m/seo

Audit, plan, and implement SEO improvements across technical SEO, on-page optimization, structured data, Core Web Vitals, and content strategy. Use when the user wants better search visibility, SEO remediation, schema markup, sitemap/robots work, or keyword mapping.

community

affaan-m/brand-voice

Build a source-derived writing style profile from real posts, essays, launch notes, docs, or site copy, then reuse that profile across content, outreach, and social workflows. Use when the user wants voice consistency without generic AI writing tropes.

community

affaan-m/crosspost

Multi-platform content distribution across X, LinkedIn, Threads, and Bluesky. Adapts content per platform using content-engine patterns. Never posts identical content cross-platform. Use when the user wants to distribute content across social platforms.

community

affaan-m/x-api

X/Twitter API integration for posting tweets, threads, reading timelines, search, and analytics. Covers OAuth auth patterns, rate limits, and platform-native content posting. Use when the user wants to interact with X programmatically.

community

affaan-m/content-engine

Create platform-native content systems for X, LinkedIn, TikTok, YouTube, newsletters, and repurposed multi-platform campaigns. Use when the user wants social posts, threads, scripts, content calendars, or one source asset adapted cleanly across platforms.

community