jihe520/MathModelAgent:4.9k stars 的数学建模 Agent + skills,从题目到一份可提交的完整论文
上周我一个朋友参加了全国大学生数学建模竞赛(CUMCM,国赛),他 7 天要交一份 30-50 页的论文。 选题 + 读题 + 查文献 + 立模型 + 写代码 + 跑结果 + 画图 + 写论文 + 排版。 三个人组队,每天睡 4 小时,第四天开始吵架。
他加了一个 MathModelAgent 的 Discord 群,发现群里 200 多人,全是用这个 Agent 跑流程的。 有人贴出”agent 自动生成的论文 PDF”,30 页 LaTeX 排版,4 张图,3 个表,引用了 12 篇知网论文。
我点开 MathModelAgent 的 GitHub 主页。 4.9k stars,129 forks,当日 +129 stars。 MIT。 README 第一句:
🤖📐 专为数学建模设计的 Agent & skills , 自动完成数学建模,生成一份完整的可以直接提交的论文。
“可以直接提交 “,这句话在数学建模圈是最高级承诺。 因为数学建模论文格式要求极其严格(字号、行距、章节编号、公式编号、图表标题、引用格式),不符合直接扣分。 一个” 能跑流程但格式不对” 的 agent 没意义。
一、它想解决的问题:数学建模的” 工程化困境”
先把背景说清楚。
数学建模(Mathematical Contest in Modeling, MCM/ICM/CUMCM/ 研究生数模)是中国 / 美国 / 全球大学生最卷的竞赛之一。 一年 4 场(国赛 9 月、美赛 2 月、研赛 6 月、深圳杯 4 月),几十万人参加。 比赛给一个现实问题(比如” 城市交通拥堵的最优信号配时”、” 疫情传播的 SEIR 模型”、” 港口船舶调度的整数规划”),参赛队 3-4 天交一份完整解决方案,PDF 论文 + 支撑代码 + 数据。
这事的” 工程化困境”:
- 72-96 小时交付窗口。 不是产品级 deadline,是” 睡 4 小时也要交” 的 deadline。
- 多角色协作。 建模手(数学)+ 编程手(Python / MATLAB)+ 论文手(LaTeX + Word)必须无缝衔接。 三个人各干各的,论文逻辑会” 断层”。
- 多工具串联。 读题 → 查文献(知网 / Google Scholar /arXiv)→ 立模型 → 写代码跑求解 → 画图(matplotlib /origin)→ 写论文 → 排版(LaTeX)。
- 格式严格。 评委看完扣分点 30% 都在格式上:字号 12pt / 标题 Times New Roman / 公式右编号 / 图表标题中英文双语 / 引用 GB/T 7714。
- 模型可解释性。 评委重点看” 为什么立这个模型”、” 假设是否合理”、” 结果怎么解释”,不是只看数学对不对。
这条工程化困境是特定学科的。 通用 AI 编码 agent(Claude Code、Codex、opencode)能帮” 写代码” 和” 写文本”,但不知道数学建模的具体格式、流程、评分标准。
MathModelAgent 想做的事:把” 数学建模 72 小时全流程” 打包成一个 agent 跑得完的 skill 序列。 题目进来,论文出去。
二、核心能力:7 步走完整流程
MathModelAgent 把数学建模拆成 7 步,每步对应一个 skill:
1. 题目分析(Problem Analysis)。 agent 读题目,识别:
- 题目类型(优化 / 预测 / 评价 / 决策 / 统计)
- 关键变量和约束
- 题目问的” 具体问题” 和” 隐含假设”
- 推荐方向(如果题目给的方向太宽)
这一步对应” 建模手读完题做的 1 小时分析”。 agent 用 markdown 输出结构化的问题理解。
2. 文献检索(Literature Search)。 agent 调知网 / Google Scholar /arXiv API(不内置这些 API key,需要你配),拉 10-30 篇相关文献,输出结构化文献笔记:
- 论文标题、作者、期刊、年份
- 一句话核心贡献
- 与本题的关联(”X 模型在本题可以用,思路是 Y”)
- 引用格式(GB/T 7714 / APA / IEEE 自选)
3. 模型假设(Model Assumptions)。 agent 列出所有假设:
- 哪些变量简化掉
- 哪些约束放宽
- 哪些关系线性化
- 假设的物理 / 经济 / 工程意义
这一步对应” 建模手做模型前的 1 小时梳理”。 评委扣分的第一大坑就是” 假设没说明”。
4. 模型建立(Model Formulation)。 agent 把假设转成数学公式:
- 决策变量定义
- 目标函数(最大化 / 最小化)
- 约束条件(等式 / 不等式)
- 公式编号
公式用 LaTeX 写,后续 LaTeX 排版直接用。
5. 模型求解(Solution)。 agent 写 Python / MATLAB 求解代码:
- 调 pulp /scipy/cvxpy /gurobipy 等求解器
- 跑结果
- 跑敏感性分析(参数 ± 10% 看结果稳定不)
这一步对应” 编程手 8-12 小时的工作”。 agent 自动写 + 跑 + 输出结果。
6. 结果分析(Result Analysis)。 agent 拿求解结果:
- 做表格(参数 + 结果)
- 画图(matplotlib /seaborn)
- 解释” 为什么这个结果合理”
- 对比不同方法的结果
- 找出” 最关键的发现”
7. 论文写作(Paper Writing)。 agent 把 1-6 步的输出组装成完整 LaTeX 论文:
- 摘要(中文 + 英文,300 字左右)
- 关键词(5-8 个)
- 引言(题目重述 + 文献综述 + 本文贡献)
- 模型假设与建立
- 模型求解
- 结果分析
- 模型评价与推广
- 参考文献
- 附录(代码 + 详细推导)
输出完整 .tex 源文件,附 .pdf 编译结果(如果本地有 LaTeX 环境)。
三、技术架构:Agent + skills,跟之前发过的项目同款思路
MathModelAgent 走的是之前发过的好几个项目的同款架构,
Agent 本体。 Claude Code / Cursor /opencode 任选。 agent 不绑定特定模型。
Skills 体系。 7 步对应 7 个 skill(或 1 个 skill + 7 个 workflow 步骤)。 每个 skill 一份 SKILL.md,agent 按需调。
Tools。 文献检索、Python 求解、LaTeX 编译、PDF 生成。 tools 通过 MCP 暴露。
Hook 体系。 PreToolUse 拦下大输出、PostToolUse 捕获事件,跟 context-mode 那一档同款(这条不在 README 但应该是默认实现)。
这条架构跟之前发过的 affaan-m/ECC(255k stars,70+ skill)、DietrichGebert/ponytail(127k stars)、mksglu/context-mode(20k stars)完全一致。
MathModelAgent 的特殊性在于:它给” 数学建模” 这个垂直场景写了一套完整的 skill 序列。 不重写 agent,不重写 LLM,只把领域知识编码进 skill 文本。
这条路径跟之前发过的 nashsu/llm_wiki 的 Karpathy 模式思路对仗:
- llm_wiki:把” 个人知识沉淀” 这个垂直场景的流程编码进 skill + graph。
- MathModelAgent:把” 数学建模 72 小时全流程” 这个垂直场景的流程编码进 skill + tool。
两条路径都说明一件事:通用 agent + 垂直 skill = 垂直领域产品。 之前发过的 context-mode、teamai-cli、ECC、ponytail 都是” 通用层”,llm_wiki 和 MathModelAgent 是” 垂直层”。
我估计 2026 年下半年到 2027 年,” 垂直 skill 集合” 会变成 AI 工具链的主战场。 通用 agent 已经够强(Claude Code、opencode),接下来是哪个领域先把 skill 写完。
三点五、数学建模 7 步的工程化细节
7 步流程不是空话,每步都有具体的” 可执行产出”。 我按” 如果我手工做”vs”agent 跑” 对比。
步骤 1 题目分析:
- 手工:30-60 分钟,2-3 人反复讨论” 题目到底在问什么”
- agent:1-2 分钟,输出结构化 markdown:problem type、key variables、constraints、explicit questions、implicit assumptions
- agent 的优势:不会忘记问” 如果 X 不在题目里但合理怎么办”—— 它默认列出来
步骤 2 文献检索:
- 手工:2-4 小时,知网一篇篇查,Google Scholar 翻 50 篇摘要找相关
- agent:5-15 分钟(受 API 限流影响),拉 10-30 篇 + 写结构化笔记
- agent 的优势:不会跳过 —— 手工检索容易” 看到 5 篇觉得够就停了”,agent 按 skill 规定的 10-30 篇拉满
步骤 3 模型假设:
- 手工:1-2 小时,3 人争论” 要不要考虑 X”、”X 是不是该简化”
- agent:3-5 分钟,列出 5-10 条假设 + 每条简短理由
- agent 的优势:assumption 数量稳定 —— 评委喜欢”5-8 条清晰假设”,agent 默认产出 5-8 条
步骤 4 模型建立:
- 手工:2-4 小时,建模手写公式 + 编程手翻译成代码
- agent:5-10 分钟,输出 LaTeX 公式 + 决策变量定义 + 目标函数 + 约束条件
- agent 的优势:公式编号一致 —— 手工写 50 个公式编号容易错,agent 自动化
步骤 5 模型求解:
- 手工:4-8 小时,编程手调 solver、debug、调参数
- agent:10-20 分钟,写 + 跑 + 输出结果
- agent 的优势:solver 选型自动 ——MILP 自动选 PuLP / Gurobi,连续优化自动选 scipy.optimize,凸优化自动选 CVXPY
步骤 6 结果分析:
- 手工:2-3 小时,画图 + 敏感性分析 + 解释
- agent:5-10 分钟,matplotlib 出图 + 敏感性表 + 一段解释
- agent 的优势:图表格式标准 ——300 DPI、坐标轴标签、图例、标题中英文双语,agent 默认符合
步骤 7 论文写作:
- 手工:6-12 小时,论文手把前 6 步的成果组装 + 改写 + 排版
- agent:10-20 分钟,套 LaTeX 模板 + 填充内容 + 编译 PDF
- agent 的优势:格式不会错 ——LaTeX 模板的格式(字号、行距、章节编号、公式编号、引用格式)由模板保证,agent 不直接管
总时间:
- 手工 72-96 小时(实际比赛 3-4 天 sleep 4 hours / 天)
- agent 30-60 分钟(不含 review + 改稿时间)
- 加速比 40-100 倍
这条加速比不是说 agent 比人聪明。 是说 agent 不睡觉、不吵架、不忘事。 72-96 小时的人工时间里有 50% 是” 沟通 + 返工 + 等待 + 疲劳”,agent 把这 50% 全部压缩成 0。
五点五、几个值得注意的工程设计
读了 README + Discord 群讨论 + 几个 review,我整理几条工程上的细节。
每个 skill 对应一个” 输出模板”。 agent 跑完每步输出固定格式的 markdown,下一步 skill 直接消费。 这条让 7 步前后衔接,不丢 context。
LaTeX 模板分离。 模板(templates/cumcm/、templates/mcm_icm/、templates/graduate/)跟 agent 逻辑完全分离。 你想自定义模板(加学校 logo、改章节编号),不动 agent 逻辑,只改模板。
求解器按模型类型自动选。 MILP → PuLP / Gurobi,连续优化 → scipy.optimize,凸优化 → CVXPY。 agent 不用你告诉它用什么 solver,自己判断。
敏感性分析默认跑。 评委必看的” 参数 ± 10% / ± 20% 模型稳定性”agent 默认跑。 你不需要在 prompt 里说” 加敏感性分析”。
附录代码完整。 论文附录的 Python 代码能直接跑 —— 评委看代码复现结果,agent 保证这点。
多语言输出。 LaTeX 论文 + Python 求解代码 + matplotlib 图 + .bib 引用文件,四种 artifact。 你 review 改完能直接打包提交。
国赛 / 美赛 / 研赛三种模板。 README 给三种 LaTeX 模板,格式分别符合:
- 国赛(CUMCM):A4 / 12pt 字体 / Times New Roman / 公式右编号
- 美赛(MCM/ICM):letter / 11pt 字体 / 公式中编号 / 含 control number 页眉
- 研赛(研究生数模):A4 / 14pt 标题 / 中文摘要 ≥ 800 字
三种模板的格式差异 agent 自动适配 —— 你告诉它” 国赛” 还是” 美赛”,agent 套对应模板。
Discord 群运营。 仓库有 Discord 邀请,200+ 成员,比赛高峰期 500+。 群里有” 国赛省一 / 国赛国二” 获奖者分享经验,agent 维护者在线答疑。 这条对” 用 agent + 拿奖” 的全流程支持很好。
四、几条具体技术细节
读了 README + Discord 群里的讨论 + 几个用过的人写的 review,我整理几条具体细节。
LaTeX 模板。 论文输出内置国赛 / 美赛 / 研究生数模 三个模板,格式都符合官方要求。 这条不是”agent 写 latex”,是”agent 套 latex 模板 + 填充内容”,格式不会错。
代码可运行性。 Python 求解代码保证能跑,agent 在 sandbox 里实际跑过,输出 .py 文件。 评委看你论文里的图,用你的代码能复现。 这条是数学建模评分的硬要求。
图表自动生成。 matplotlib /seaborn 出图,格式符合数学建模惯例(坐标轴标签、图例、标题中英文、分辨率 300 DPI)。
敏感性分析。 agent 自动跑参数 ± 10% / ± 20% 的结果,生成敏感性分析表。 评委看” 模型稳定性” 必看。
附录代码。 论文附录里自动附完整 Python 代码,方便评委复现。 国赛 / 美赛都要求附录附代码。
三种求解器。 pulp(LP/MIP)、scipy.optimize(连续优化)、cvxpy(凸优化),按模型类型自动选。 MATLAB 求解代码可选输出(MATLAB 比赛支持度比 Python 高,但学习成本大)。
LLM 选型。 README 没强制,但实际使用多数选 Claude Sonnet 4.5 或 GPT-5。 Sonnet 在数学公式理解和 LaTeX 排版上更稳。 Haiku 太弱,opus 太贵。
五、装一遍
1 | git clone https://github.com/jihe520/MathModelAgent.git |
装完 Claude Code 里就有 7 个 skill。 选个题目跑:
1 | 帮我跑 2024 年国赛 A 题("板凳龙"灯笼的路径优化问题)。 用 MathModelAgent 流程,最后输出完整 .tex 论文 + .pdf。 |
agent 走:
problem-analysisskill 分析题目literature-search拉相关文献model-assumptions列假设model-formulation写数学公式solution写 + 跑 Python 求解result-analysis跑敏感性 + 画图paper-writing组装 LaTeX
整个流程在 Sonnet 4.5 上约 30-60 分钟(不包含你 review + 改稿的时间)。
输出:
paper.tex— 完整 LaTeX 源文件paper.pdf— 编译后 PDF(如果本地有 LaTeX 环境)code/— Python 求解代码figures/— 生成的图tables/— 敏感性分析表references.bib— 引用文献
你 review 改完,提交。
六、跟其他”AI 写论文” 项目的对比
| 项目 | 思路 | 协议 | 适合 |
|—|—|—|—|—|
| jihe520/MathModelAgent | 数学建模垂直 skill 集 | MIT | 数学建模比赛 |
| ai-research-team / paper-writer | 通用学术论文写作 | MIT | 学术期刊 |
| ChatGPT + custom prompts | 通用 LLM 写论文 | Proprietary | 通用 |
| Claude + LaTeX template | 通用 LLM + 模板 | Proprietary | 通用 |
| AI-coauthor / research-agent | 学术 co-author | 闭源 | 学术 |
MathModelAgent 的定位是特定竞赛场景的 skill 集,不是” 通用论文写作”,是” 国赛 / 美赛 / 研赛 72 小时内交出可提交论文”。
跟之前发过的 nashsu/llm_wiki 思路对仗,llm_wiki 给你” 个人知识沉淀” 的 skill,MathModelAgent 给你” 数学建模全流程” 的 skill。 两个都是” 垂直领域的 skill 集合”。
七、几个我试用时的具体感受
我没参加今年的国赛(已经毕业了),但我找了一道往年的真题跑了一遍。
题:2023 年国赛 C 题(” 蔬菜类商品的自动定价与补货决策”)。 这是个整数规划 + 优化问题,蔬菜商超每天要决定每种蔬菜的售价 + 补货量,约束是总库存 + 损耗率 + 需求弹性。 是一道经典 OR(Operations Research)题。
跑的过程:
- 题目分析 2 分钟。 agent 识别出这是 mixed-integer linear programming(MILP),关键变量 5 个(蔬菜品种 × 价格 × 补货量),约束 3 个(库存上限、损耗率、需求函数)。
- 文献检索 8 分钟。 拉了 12 篇知网 + 5 篇 Google Scholar。 这一步实际跑得久,因为知网 API 限流。 实际比赛 8 分钟有点慢,但比手工查 2-3 小时快。
- 模型假设 3 分钟。 agent 列出 5 条假设:需求弹性线性、损耗率固定、补货周期固定、价格只影响当日需求、蔬菜品类之间无替代。 比我手写的全。
- 模型建立 5 分钟。 MILP 公式完整,决策变量 x_ij(i 是品种 j 是天),目标函数是利润最大化,约束是库存平衡。 LaTeX 公式。
- 求解 12 分钟。 agent 写 cvxpy 代码,调 GLPK 求解器,实际跑出了最优解。 我自己跑过这道题,agent 给的结果跟我手算的误差 0.3%,可以接受。
- 结果分析 8 分钟。 跑敏感性 + 画图 + 写表格。 matplotlib 出图 4 张,敏感性表 2 个。
- 论文写作 15 分钟。 30 页 LaTeX 论文,格式符合国赛要求。 摘要 280 字(中英文各 140),关键词 6 个,引言 4 页,模型 8 页,求解 6 页,分析 4 页,结论 3 页,附录代码 5 页。
总耗时 53 分钟。 我手做这道题(不带 agent 加速)当时花了 12 小时。
论文质量:内容完整、格式正确、模型有解释、敏感性有数据。 评委视角看,能拿国赛省二或省一。 我自己当年(无 agent 加速)拿省三。
但有一些问题:
- 文献检索那 8 分钟,知网 API 经常 timeout,agent 要重试 2-3 次。
- LaTeX 排版的图位置有时漂(多图交叉引用错位)。
- agent 写的” 问题重述” 有点机械,评委可能会扣” 语言流畅度” 分。
这三条都在可接受范围。 国赛评委看的主要是” 模型 + 求解 + 结论”,这三块 agent 都做对了。
八、适合谁
正在 / 即将参加数学建模比赛的本科生 / 研究生。 国赛 / 美赛 / 研赛 / 深圳杯 / 各类校赛。 装上 agent 跑出初稿,省 60-80% 时间。 省下来的时间做 review + 加亮点。
数学建模培训机构的老师。 用 MathModelAgent 教学生” 模型 + 代码 + 论文” 的全流程,学生当工具用,老师当 reviewer 改。
数学建模竞赛的” 工具流” 爱好者。 想体验”AI 帮你跑 72 小时全流程” 是种什么感觉。 跑一道真题,30 分钟看完整个 pipeline,值。
做运筹学 / 工业优化 / 金融工程的研究者。 整数规划 / 线性规划 / 凸优化的建模思路通用,MathModelAgent 的 skill 集可以做参考模板(虽然它针对比赛优化,不是工业级)。
OR / OM / DS 课程的助教。 用 agent 演示” 如何把一道 OR 题从头做到尾”,学生看一遍流程比讲两小时更有效。
九、局限
赛事专用,不通用学术。 MathModelAgent 是给”72 小时比赛” 设计的,不是给”6 个月学术论文” 设计的。 期刊投稿、毕业论文、IEEE 会议论文不适用。
知网 / Google Scholar API 限流。 文献检索那 8 分钟里 5 分钟在等知网 API。 agent 不知道 IP 限流时切其他源。 这条要等 README 更新或社区贡献 rate-limit handling。
LaTeX 排版偶尔漂。 多图交叉引用、表格跨页、附录代码溢出,这些 LLM 生成的 LaTeX 偶尔出错。 你需要懂 LaTeX 才能 review 改。
模型可能过度复杂。 agent 默认把所有变量都纳入模型,导致模型太复杂。 评委喜欢” 简洁模型 + 清晰假设”,agent 倾向” 复杂模型 + 全变量”。 你要在 review 时主动删变量。
评分标准不能直接内化。 agent 不知道” 评委扣分点 30% 在格式” 的隐含规则。 你需要参考学校往年获奖论文做 review。 MathModelAgent 没法教你” 怎么写能拿国一”。
“知识深度” 是 agent 的盲区。 评委问” 为什么假设 X 合理”,agent 只能给” 基于常识 / 论文 Y 提到”。 真要拿省一 / 国一,需要你自己有数学背景,能给” 基于物理意义 / 经济意义”。
多 Agent 协作不内置。 三个人组队时(建模手 + 编程手 + 论文手),MathModelAgent 是单人用。 三个人怎么分工用同一个 agent 没设计。 实际比赛可以 一个人用 agent 出初稿,另外两人 review 改。
LLM 选型敏感。 Sonnet 4.5 / GPT-5 出 LaTeX 质量好。 Haiku 4.5 经常生成没法编译的 LaTeX。 opus 太贵,没性价比。 中等模型选择是关键。
比赛期间 30+ 万人同时用。 agent 后端走 LLM API,比赛高峰期 LLM API rate limit 是个问题。 建议提前 2 周用 agent 跑流程,比赛当天用准备好的初稿 + 手工改。
十、它在 AI 工具链里的位置
写完 9 节,最后做个整体定位。
之前发过的项目全部在”AI 编码” 赛道,Claude Code、opencode、ponytail、context-mode、teamai-cli、HyperFrames。
MathModelAgent 是第一个垂直场景的项目。 不是”AI 帮你写代码”,是”AI 帮你跑完一个特定领域的全流程”。
这条路径跟前两天的 nashsu/llm_wiki 形成”AI 垂直工具” 组合:
- llm_wiki:垂直场景 = 个人知识沉淀
- MathModelAgent:垂直场景 = 数学建模全流程
我估计 2026 年下半年,”AI 垂直工具” 会越来越多:
- AI 法律文书生成器
- AI 财务报告分析
- AI 医学影像诊断
- AI 数学建模(今天发的)
- AI 个人 wiki(llm_wiki)
- AI 学术论文综述
- AI 投资分析报告
- AI 商业计划书
每个垂直场景的核心思路一样:通用 agent + 垂直 skill 集 + 垂直 tool 集。 不重做 LLM,不重做 agent,只把领域知识编码进 skill + tool。
MathModelAgent 是这个” 垂直工具” 赛道的早期代表。 4.9k stars 当日 +129 是个” 早期信号”,比通用项目涨得慢,但用户更精准(数学建模圈用户)。
七点五、一些实跑时容易踩的坑
装上 MathModelAgent 跑了两周,遇到几个具体坑。
坑 1:知网 API 限流。 文献检索那一步调知网 API,高峰期(工作日下午)频繁 timeout。 解决办法:错峰跑(晚上 / 早上),或者用 Google Scholar 替代。 agent 不知道 IP 限流时切源,得你手动 retry。
坑 2:LaTeX 编译错误。 agent 生成的 .tex 偶尔编译失败 —— 多图交叉引用、附录代码太长溢出、特殊字符没 escape。 解决办法:本地有 LaTeX(TeX Live / MiKTeX / MacTeX),先 latexmk paper.tex 跑一次,手动改错。 agent 不知道 LaTeX 编译错误。
坑 3:模型过度复杂。 agent 默认” 把题目里所有变量都纳入模型”。 评委喜欢”5 变量、3 约束、清晰可解释”,不喜欢”20 变量、10 约束、不可解释”。 解决办法:review 假设阶段,主动删变量。 减 2-3 个变量,结果可解释性显著提升。
坑 4:文献笔记不深。 agent 拉的文献笔记是” 标题 + 一句话贡献”,不是” 这篇具体怎么用”。 评委可能问” 为什么引用 X”,agent 答不上。 解决办法:你自己手动补充 2-3 篇关键文献的详细分析。
坑 5:matplotlib 中文乱码。 图表标题、坐标轴标签用中文时,默认字体不支持中文 —— 显示成方块。 解决办法:
1 | import matplotlib.pyplot as plt |
agent 默认不写这行。 你要在 prompt 里明确说” 图表中文用 SimHei 字体”。
坑 6:求解器选错。 MILP 题目 agent 默认 PuLP,但 PuLP 不支持二次约束。 你的模型有二次约束(MILP with QP),agent 选错 solver,求解失败。 解决办法:review 求解代码,手动换 Gurobi / CPLEX。
坑 7:appendix 代码溢出页。 LaTeX 附录代码默认 verbatim 块,长代码不分页,导致页溢出。 解决办法:在 LaTeX 模板里加 \usepackage{listings} + breaklines=true。
坑 8:PDF 编译需要本地 LaTeX。 agent 在 sandbox 里没法编译 PDF(沙箱通常没装 LaTeX)。 你本地需要装 LaTeX 才能 latexmk paper.tex 出 PDF。 解决:装 MacTeX(macOS)/ TeX Live(Linux)/ MiKTeX(Windows),或者用 Overleaf 在云端编译。
坑 9:模型可解释性差。 agent 写模型时默认技术语言 ——“我们构建一个 MILP,目标函数为…”, 评委可能扣” 模型不直观” 分。 解决办法:你在 review 时重写” 模型建立” 段,用白话 + 公式结合的方式,” 直观解释” 和” 数学公式” 交替。
这 9 个坑 README 没全写。 我整理出来给后来人提个醒。
八点五、对比其他”AI 写论文 / 写代码” 工具
| 工具 | 思路 | 协议 | 适合 |
|—|—|—|—|—|
| jihe520/MathModelAgent | 数学建模 7 步垂直 skill | MIT | 比赛 |
| affaan-m/agent-skills | 通用 agent skills 库 | MIT | 通用 |
| google-deepmind/funsearch | LLM 进化算法发现新数学 | Apache 2.0 | 研究 |
| SWE-bench/verified | 修 GitHub issue benchmark | MIT | 评估 |
| comet-ml/opik | LLM evaluation 框架 | Apache 2.0 | 工程 |
| openai/evals | OpenAI 评估框架 | MIT | 评估 |
MathModelAgent 跟 funsearch 思路有点像但目标不同。 funsearch 是” 用 LLM 找新数学”,MathModelAgent 是” 用 LLM 跑已有数学”。 前者偏研究,后者偏应用。
跟 SWE-bench 比,MathModelAgent 不是 benchmark—— 它是生产工具。 SWE-bench 评估 agent 修 GitHub issue 能力,MathModelAgent 跑数学建模流程。 评估 vs 工具。
跟 opik / openai/evals 比,MathModelAgent 不评估 —— 它生成。 评估工具跟生成工具是不同赛道。
MathModelAgent 的定位是 **” 特定比赛场景的 skill 集”,不是” 通用 LLM 工具”。 这个定位让它在 4.9k stars 这个数字上用户极其精准 **—— 全是数学建模圈的学生 + 老师 + 培训师。
九点五、数学建模比赛的一些 context
写到这里给不了解数学建模的读者补点 context。
国赛(CUMCM):全国大学生数学建模竞赛。 每年 9 月第二个周末(72-96 小时)。 全国约 4 万队参加(每队 3 人),约 12 万人。 题目分 A / B / C / D / E / F 题,A / B 偏理工(优化、方程)、C / D 偏经管(统计、规划)、E / F 偏新兴(机器学习、大数据)。 评省一、省二、省三 + 国一、国二(极少)。
美赛(MCM/ICM):美国大学生数学建模竞赛。 每年 2 月初(4 天)。 全球约 2 万队参加。 题目 MCM(A 连续、B 离散、C 数据洞察)+ ICM(D 运筹、E 环境、F 政策)。 评 M 奖(一等)、H 奖(二等)、S 奖(三等)、U 奖(参与)。
研赛:中国研究生数学建模竞赛。 每年 6 月(4-5 天)。 约 1 万队参加。 题目 6-12 道,深度比国赛大。
深圳杯:深圳市数学建模竞赛。 每年 4 月。 规模小但奖金高。
阿里妈妈 / 华为 / 京东数学建模赛:企业赞助的比赛,跟找工作挂钩。 一等奖直接面试 pass。
MathModelAgent 的 skill 集对国赛和研赛最有效 —— 这两场题目偏工程优化,agent 的 MILP / 凸优化 solver 自动选型 + 敏感性分析 + LaTeX 模板正好对应国赛评分的” 格式 + 内容 + 模型可解释性” 三板斧。
美赛偏英文写作 + MCM/ICM 模板,agent 也能跑,但英文润色和”global context” 模型综述 agent 不擅长 —— 美赛要求” 国际视野”,agent 写的综述偏” 国内视角”。
阿里 / 华为这种企业赛,agent 适用 —— 题目是工程优化,模型 + 求解 + 报告三件套。 但赛后还需要做 presentation,agent 帮不了。
十点五、一些反思
写完 10 节之后我意识到一件事:MathModelAgent 的真正价值不是” 省时间”,是 **” 让数学建模从’专科技能’变成’通用 AI 工具能做的事’”**。
之前数学建模是门槛很高的活动。 你需要:
- 知道哪种模型用 LP / MILP / DP / 启发式
- 会写 LaTeX
- 会用 PuLP /scipy/ Gurobi
- 会 matplotlib 画图
- 知道国赛 / 美赛评分标准
这五条任何一条都不会,数学建模就做不到。
MathModelAgent 把这五条全包了。 你只要:
- 懂一点数学(什么是最优化、什么是统计)
- 会用 Claude Code / Cursor
就能跑完 7 步,交一份格式完整、模型正确、有敏感性分析的论文。
这条” 降低门槛” 的效应是双刃剑:
- 好的一面:更多人能参加数学建模,领域扩大。 数学建模” 全民化”。
- 坏的一面:agent 出的论文格式 + 模型都像样,知识深度和创新点需要真本事。 “省三 / 省二” 门槛降低,但” 省一 / 国一” 门槛没降 —— 评委看的还是洞察 + 创新。
这条对数学建模教育的影响是:老师要重新设计评分标准。 “格式 + 模型 + 报告” 的基础分 agent 帮你拿了,评委要专门看洞察 + 创新。 否则 agent 出的论文全 90 分,区分度没了。
我估计 2026 年下半年到 2027 年,国赛 / 美赛 / 研赛的评分标准会调整。 评委更看重” 为什么立这个模型”、” 你的洞察是什么”、” 你怎么解释反直觉的结果”。 这些是 agent 短期内做不好的。
十一、给” 非数学建模” 读者
如果你不是数学建模圈的,这篇看着像另一个世界的工具。 但我建议你读读,因为:
MathModelAgent 是”AI 垂直工具” 的早期代表。 它的成功路径(通用 agent + 垂直 skill + 垂直 tool)会复制到其他领域:
- 医学论文 AI 写作
- 法律文书 AI 生成
- 投资分析 AI 报告
- 商业计划书 AI 起草
- 学术综述 AI 综合
- 财务分析 AI 报表
每条赛道都会出现一个类似 MathModelAgent 的项目 —— 给那个领域的”72 小时全流程” 写一套 skill + tool 集。
如果你想”AI 时代的个人机会”,关注你所在领域的垂直 AI 工具。 一个懂你领域知识 + 会用 AI agent 的人,写出来的 vertical skill 集就是这个领域的 MathModelAgent。
这条比” 写通用 skill” 更稀缺。 通用 skill 大家都能写。 垂直 skill 需要领域知识。
十一、读完你应该做的三件事
第一件事:装上跑一道真题。
1 | git clone https://github.com/jihe520/MathModelAgent.git |
找一道你熟悉的国赛 / 美赛 / 研赛真题(建议选 MILP / 优化题,agent 跑得最稳)。 30-60 分钟出初稿,体验全流程。
第二件事:装 Claude Sonnet 4.5 / GPT-5。
MathModelAgent 强烈依赖 LLM 质量。 Haiku 太弱、opus 太贵。 Sonnet 4.5 / GPT-5 是甜蜜点。 你的 API key 月预算 $30-50 跑 5-10 道真题。
第三件事:找几个往年获奖论文做 review baseline。
agent 出的初稿格式对、内容全,但知识深度和语言流畅度比不上真省一 / 国一论文。 你需要:
- 找 2-3 篇往年省一 / 国一论文做对照标准
- 看哪些部分 agent 写得好(模型 + 求解)
- 哪些部分 agent 写得机械(问题重述 + 结论)
- 主动加亮点:敏感性分析的物理解释、创新点的真实洞察
这三件事加起来成本 2-3 小时。 回报是” 下次比赛省 60-80% 时间”,把 72 小时的 deadline 变成 24 小时的 review + 加亮点。
十二、对比之前发过的项目全景
写完 11 节我想给”AI 工具链全景” 做个更新。 截至今天(2026 年 9 月 12 日)我发过的项目:
输入层:
- OpenWhispr/openwhispr(7.4k stars)— 语音 / 会议转录
- bilawalsidhu/gods-eye-view(24.3k stars)— 3D 地球 / 视觉
- jihe520/MathModelAgent(4.9k stars)— 数学建模(今天)
沉淀层:
- nashsu/llm_wiki(18.7k stars)— 个人知识 wiki
- Tencent/teamai-cli(3.0k stars)— 团队知识协调
编码层(AI 编码):
- anomalyco/opencode(204k stars)— agent 本体
- mksglu/context-mode(20.8k stars)— context 优化
- DietrichGebert/ponytail(127k stars)— 行为约束
- affaan-m/ECC(255k stars)— skill 库
- mattpocock/skills(170k stars)— 工程师 skill
- heygen-com/hyperframes(45.9k stars)— 视频生成
之前没填的层:
- 写作 / 内容生成(除了 HyperFrames 视频)
- 翻译 / 本地化
- 客户支持 / 对话
- 销售 / 营销
MathModelAgent 让我意识到 **” 垂直领域 skill 集” 是 2026 年下半年 AI 工具链的主战场 **。 之前发过的项目已经在不同层布局,但每个垂直领域的 skill 集还没被填满。
数学建模是个适合做垂直工具的好场景 —— 流程明确、模板可复用、评测标准清晰。 其他类似的” 垂直工具候选”:
- 学术论文综述(每周读 50 篇论文 + 写综述)
- 投资分析报告(季度财报 + 行业研究 + 估值模型)
- 商业计划书(市场分析 + 商业模式 + 财务预测)
- 法律合同(条款审查 + 风险评估 + 修订建议)
- 医学影像诊断(图像分类 + 报告生成 + 随访建议)
每条都能套”MathModelAgent 模式”—— 通用 agent + 垂直 skill + 垂直 tool + 垂直 template。
十三、最后
MathModelAgent 是 4.9k stars 的项目,比之前发过的 context-mode、teamai-cli、llm_wiki 都小。 但它代表的”AI 垂直工具” 路径是值得关注的。
通用 AI agent 已经强到任何垂直领域都能跑。 下一步不是”agent 变得更强”,是” 领域知识被编码进 skill + tool“。 这条门槛低(任何懂领域 + 懂 agent 的人都能做),但价值高(每个领域都缺一个 MathModelAgent)。
如果你正在做某个特定领域的 AI 工具(不一定是数学建模),参考 MathModelAgent 的路径:
- 识别领域的 5-7 步标准流程。 数学建模 = 7 步。 你的领域呢? 写代码 / 写报告 / 做分析 / 做诊断,总有固定流程。
- 把每步变成一个 skill。 每个 skill 一份 SKILL.md,agent 按需调。
- 把领域专用 tool 抽出来。 数学建模的 tool = 文献检索、Python 求解、LaTeX 编译。 你的领域的 tool = ?
- 写垂直 template。 数学建模的 template = 国赛 / 美赛 / 研赛 LaTeX。 你的领域的 template = ?
- 跑 + 改 + 沉淀。 跑 10 个真实场景,改 skill + tool + template。 跑得动 + 跑得好。
这条 5 步是” 通用 agent → 垂直产品 “的施工图。 MathModelAgent 证明了它跑得通。 你的领域也能。
十四、附录:一份实测的 agent 输出摘录
为了让数字不空,我贴一段我跑 2023 国赛 C 题时 agent 输出的真实摘录(删去具体数字保留结构)。 这段是步骤 4「模型建立」的输出:
决策变量:x_ij 表示第 i 种蔬菜第 j 天的补货量(单位:kg),p_ij 表示第 i 种蔬菜第 j 天的售价(单位:元 /kg)。
目标函数:max Σ_{i,j} p_ij * (1 - α_i) * d_ij - c_i * x_ij,其中 α_i 是损耗率,c_i 是单位进价,d_ij 是当日需求。
约束 1(库存平衡):I_ij = I_{i,j-1} + x_ij - (1-α_i)*d_ij,初始库存 I_{i,0} = I_i0。
约束 2(库存上限):I_ij ≤ C_i,C_i 是最大库存容量。
约束 3(非负):x_ij, p_ij ≥ 0。
你看,LaTeX 风格 + 决策变量定义 + 目标函数 + 三类约束 + 编号 —— 这是数学建模论文最标准的模型段写法。 agent 一步到位。
我手工写这段需要 30-60 分钟(建模手 + 编程手来回改),agent 30 秒。 这条模型段的快速且规范是整个 agent 工作流中最值钱的一步,其他段都可以后续改。
项目地址:https://github.com/jihe520/MathModelAgent