对数学建模竞赛论文进行两层AI痕迹审计——第一层9维检测(语言层面60%:连接词/排比/拔高词/被动句/段落规律/文本复杂度;事实层面40%:引文验证/数值一致性/术语一致性),第二层模型合理性深度审查。严格判分+一票否决+问题标红。输出分层HTML报告。
Scanned 9/5/2026
Install to Claude Code
npx -y skills add BZDmathclub/bzd-math-modeling-skills --skill bzd-paper-aigc-auditor --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Bzd Paper Aigc Auditor?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/bzdmathclub-bzd-paper-aigc-auditor)More formats (shields.io, HTML) on the badges page.
---
name: bzd-paper-aigc-auditor
description: 对数学建模竞赛论文进行两层AI痕迹审计——第一层9维检测(语言层面60%:连接词/排比/拔高词/被动句/段落规律/文本复杂度;事实层面40%:引文验证/数值一致性/术语一致性),第二层模型合理性深度审查。严格判分+一票否决+问题标红。输出分层HTML报告。
---
# BZD 数学建模论文AI痕迹审计工具 v2.2
## 融合nature-AIGC检测方法 · 严格判分版
## 核心原理
**两层递进式检查 + 9维融合检测**:
1. **第一层:增强的9维框架**(100分制)
- **语言层面**(权重60%):融合nature-detector的统计特征分析
* 维度1: 高频连接词(Humanizer-zh)
* 维度2: 排比/同构句式识别
* 维度3: 拔高词与修饰词(5级分类)
* 维度4: 被动句占比与语态分析
* 维度5: 段落结构规律性
* 维度6: 文本复杂度(熵值、n-gram、TTR)
- **事实层面**(权重40%):融合nature-detector的事实验证
* 维度7: 引文验证(L1-L3三层检查)
* 维度8: 数值一致性追踪(参数溯源)
* 维度9: 术语一致性检测
2. **第二层:数学建模逻辑审查**(100分制)
- 2.1 模型常用性判断:对标数模竞赛常用模型库
- 2.2 复杂度vs收益评估:识别过度工程化
- 2.3 华而不实识别:五大AI特征检查
- 2.4 模型选择"三问法":逻辑论证验证
- 2.5 建模路径风格:区分人主导的渐进建模与AI式复杂化倾向
**最终评分** = (第一层 + 第二层) / 2 → 风险等级 → HTML分层报告
**新增能力**:
- ✨ 引文真实性验证(相比v2.0的"只是检查格式")
- ✨ 数值参数追踪与一致性检查(发现虚构或计算错误)
- ✨ 文本复杂度的科学度量(TTR、熵值、n-gram频率)
- ✨ 段落结构规律性检测(识别模板堆砌)
- ✨ 术语使用一致性追踪(发现概念混乱)
---
## 使用场景
✓ **参赛队员自检**:快速诊断版,定位问题,按优先级改进
✓ **指导老师评审**:简洁版+完整版,全面了解论文问题
✓ **社团评委存档**:完整版,逐部分详细分析,存档决策
✓ **论文盲审**:用两层评分表判断是否涉及AI拼装
---
## 输入要求
**最低输入**:完整数学建模论文(PDF或Word格式)
**增强输入**(提高置信度):
- 赛题及附件说明
- 代码和中间结果文件
- 参考文献清单
- 问间对接说明
---
## 执行流程(9步)
### 第一阶段:五维基础框架评分
1. **识别论文结构**
标记摘要、问题重述、问题分析、假设、符号、模型建立(Q1-Q5)、求解、结果、检验、灵敏度、评价、参考文献、附录
2. **阅读五维评分标准**
参考 [references/audit-framework.md](references/audit-framework.md),理解五个维度的0-100分评分规则
### 第二阶段:第一层 - 增强的9维检测框架(权重60%语言 + 40%事实)
> **v2.2 严格化说明**:以下阈值较 v2.1 全面收严约 5–10 个百分点,
> 且引入"扣分项累加"机制。评审倾向:**宁可标红后经人工复核撤销,
> 不可漏标**。任何一项落入 🟠 及以上,报告中必须标红呈现并给出证据位置。
**3. 语言层面检测(6维,权重60%)**
**3.1 高频连接词检测**(维度1,权重20%)— 融合Humanizer-zh
- 扫描全文,统计高频连接词密度(综上所述、此外、进一步、显然、具有特性等)
- 计算: 密度 = (高频词总数) / (全文总句数)
- 检查相同词的重复间隔(是否<5句)
- 新增:检查"具有XX特性""相对而言""显然"等AI特化高频词
- **判分(收严)**:
* `<8%` → 100分 🟢
* `8-12%` → 85分 🟢
* `12-16%` → 60分 🟡(原15-20%才扣,现提前)
* `16-20%` → 35分 🟠 **标红**
* `20-25%` → 15分 🔴 **标红**
* `>25%` → 0分 ⛔ **标红**
- **附加扣分**:同一高频词在3页内出现>2次,每处额外 −5 分(下限0)
**3.2 排比与同构句式识别**(维度2,权重12%)
- 标记三项以上的排比句,检查排比后是否有量化数据
- 检查排比项的来源说明(赛题给出/推导/约束)
- 标记"动词+宾语"结构相同的连续句子,检查是否标注了章节/对象
- **判分(收严)**:
* 全部为L3安全排比(有数据+有来源) → 100分 🟢
* L3为主,个别L2 → 80分 🟢
* L2为主(有数据但无来源说明) → 55分 🟡
* 存在1处L1(抽象形容词堆砌) → 30分 🟠 **标红**
* 存在2处及以上L1 → 0分 🔴 **标红**
- **附加扣分(v2.2新增)**:同一组织词(如"其一/其二/其三"、
"首先/其次/最后")在 **≥4个不同章节** 机械复用,额外 −20 分;
≥6个章节复用,额外 −30 分。此项即使各项内部有数据也照扣,
因为它是可观察的模板化痕迹。
**3.3 拔高词与修饰词检测**(维度3,权重12%)— 5级分类
- 识别拔高词并分级:L1(绝对化+无数据) / L2(相对化+泛泛对比) / L3(定量无基准) / L4(定量有数字无对比) / L5(完整定量+充分对比)
- 检查拔高词后是否有量化证据(数字、对比、百分比)
- **判分(收严)**:
* L5为主且拔高词密度<8% → 100分 🟢
* L4-L5为主 → 80分 🟢
* L3为主 → 55分 🟡
* 存在 **1个** L1或2个L2 → 30分 🟠 **标红**(原需>3个才归零)
* 存在 **2个及以上** L1 → 0分 🔴 **标红**
- 参考资源:[references/layer1-enhanced-detection.md](references/layer1-enhanced-detection.md) §2.3
**3.4 被动句占比与语态分析**(维度4,权重9%)
- 抽取论文5个代表段落,统计被动句占比(正常范围10-20%)
- 检查是否出现连续>3句都是被动语态的"生硬段落"
- 被动句中是否都有明确的执行者
- **判分(收严)**:
* `<15%` → 100分 🟢
* `15-22%` → 85分 🟢
* `22-27%` → 55分 🟡(原25-30%才扣到60)
* `27-33%` → 30分 🟠 **标红**
* `>33%` → 0分 🔴 **标红**
- **附加扣分**:出现连续≥4句被动语态的段落,每处 −10 分
**3.5 段落结构规律性检测**(维度5,权重6%)
- 抽取20段,统计段落开头词的重复率和段长分布
- 检查开头方式是否多样化("根据""为了""利用前问的"等)
- 段落间是否有明确的逻辑承接("由上可知""基于此"等)
- **判分(收严)**:
* 开头词重复率 `<15%` → 100分 🟢
* `15-28%` → 80分 🟢
* `28-40%` → 50分 🟡
* `40-55%` → 25分 🟠 **标红**
* `>55%` → 0分 🔴 **标红**
- **豁免**:数模论文各建模章节遵循"建模思路→模型建立→求解→
结果→检验"五段式属文体常规,该章节级结构重复**不计入**本项;
本项只统计**段落级**的开头方式重复。
**3.6 文本复杂度分析**(维度6,权重1%)
- 计算词汇多样性TTR = 不同词数/总词数
- 分析3-gram重复率("本文采用""通过...方法"等)
- 观察熵值和n-gram频率是否过于规律
- **判分(收严)**:
* TTR>0.55 且 3-gram<4% → 100分 🟢
* TTR 0.45-0.55 或 3-gram 4-8% → 65分 🟡
* TTR 0.35-0.45 或 3-gram 8-13% → 30分 🟠 **标红**
* TTR<0.35 或 3-gram>13% → 0分 🔴 **标红**
**4. 事实层面检测(3维,权重40%)**
> ⚠️ 本层任一维度触发"一票否决项"时,**直接判定论文风险等级**,
> 不再按加权分核算。详见 references/layer1-enhanced-detection.md §4.3。
**4.1 引文验证**(维度7,权重15%)— 融合nature-detector的L1-L3检查
- **L1【快速检查】**(30秒):DOI格式、作者名、期刊名、发表年份规范性
- **L2【存在性验证】**(2-3分钟):Google Scholar/知网验证文献是否存在,信息是否匹配
- **L3【主张-支撑匹配】**(5分钟,抽查不少于5篇关键文献):
* 论文引用该文献的方法/结论是否与原文一致
* "数据集XXX"是否真的存在且规模一致
* "按照XXX的方法"是否在原文中有明确描述
- **判分(收严)**:
* 全部通过L1-L3,且无未引用的"凑数文献" → 100分 🟢
* 全部存在,但有1-2篇列入文献表却未在正文引用 → 80分 🟡
* 有1篇作者/年份/期刊信息不符 → 25分 🔴 **标红 + 触发否决**
* 有任1篇**确认不存在** → 0分 ⛔ **标红 + 强制高风险**
- **附加检查**:文献总数<6篇 或 >25篇,−10分;全为综述/教科书
而无具体算法论文,−15分
**4.2 数值一致性追踪**(维度8,权重15%)
- 构建"参数溯源表":列出所有关键参数,逐一追踪其在全文的使用位置
- 复算数值间的算术关系(占比、差值、合计是否自洽)
- 验证参数来源层级(L1赛题给出 / L2前问推导 / L3物理约束)
- **判分(收严)**:
* 全部一致 + 算术自洽 + 来源清晰 → 100分 🟢
* 一致但个别参数来源未说明 → 75分 🟡
* 存在偏差1-5%且**未加解释** → 35分 🟠 **标红**
* 存在偏差>5%且**未加解释** → 0分 🔴 **标红 + 触发否决**
- **加分项(v2.2新增,上限+5)**:论文**主动披露**数值差异并解释
其来源(求解器容差、独立实现差异等),视为人工复算的正面证据。
此类披露**不触发否决**。
- **幽灵参数**:任一关键参数无法追溯到L1/L2/L3任一层级,每个 −15分
**4.3 术语一致性检测**(维度9,权重10%)
- 构建"术语追踪表":列出5-7个核心概念
- 追踪各术语在全文的表述方式
- 检查是否存在"一个东西多个名字"
- **判分(收严)**:
* 完全一致 → 100分 🟢
* 仅存在领域公认同义词(如"粗差/过失误差") → 85分 🟢
* 1个核心术语有2种表述 → 55分 🟡
* 1个核心术语有3种及以上表述 → 25分 🟠 **标红**
* 多个核心术语混乱(尤其算法名称) → 0分 🔴 **标红**
**5. 综合评分汇总**
```
第一层质量分 =
维1×0.20 + 维2×0.12 + 维3×0.12 + 维4×0.09 + 维5×0.06 + 维6×0.01
+ 维7×0.15 + 维8×0.15 + 维9×0.10
第一层风险分 = 100 − 第一层质量分 ← 必须转换后再查等级表
```
### 第三阶段:第二层 - 数学建模逻辑审查(权重40%)
8. **五项深度检查**
对论文的每个模型,依次进行:
- **2.1 模型常用性判断**
对标[表9:数模常用模型库],判断该模型是否为竞赛常见模型,还是AI高频的"高大上"模型
- **2.2 复杂度vs收益评估**
该模型的时间/空间复杂度是否与问题规模匹配?能否用更简单的方法?复杂度提升的收益有多大?
- **2.3 华而不实识别**
检查五大特征:(1)模型名复杂但实现不透明,(2)无基线对比,(3)不必要的超参数调优,(4)通用化无边界,(5)模型数过多
- **2.4 模型选择"三问法"**
对每个模型:问1-本题问题性质?问2-本题数据特征?问3-为什么选这个而不选替代?
三问都能清晰回答 → 低风险;任何一问无法回答 → 中等风险
- **2.5 建模路径风格对照**
从建模路径、问题简化、模型选择、假设、数据适配、求解主线、结果解释、论文表达、稳健性和评审呈现十个方面,区分“人主导的渐进建模”与“AI式复杂化倾向”。详细规则见 [references/audit-framework.md](references/audit-framework.md)。该项只能作为组合证据:单独出现复杂模型、较多参数或较长篇幅,不得直接判定为AI生成。
9. **第二层输出**
综合2.1-2.5的检查结果,汇总成"建模逻辑评分表",给出建模逻辑风险等级
### 第四阶段:综合评分与报告生成
**最终AI风险分** = (第一层风险分 + 第二层风险分) / 2 → 0-100
> 两层都必须先由质量分转换为风险分(`风险分 = 100 − 质量分`)再取平均。
> 直接对质量分取平均会得到方向相反的结论。
**风险等级(v2.2 收严)**:
- 0-15:🟢 低风险 — 可直接接收
- 16-30:🟡 中低风险 — 可接收,需补充改进
- 31-50:🟠 中风险 — 需深度检查后再决定
- 51-70:🔴 中高风险 — 强烈建议强制改稿
- 71-100:⛔ 高风险 — 建议拒稿
**一票否决**:触发 references/layer1-enhanced-detection.md §4.3
任一条件时,直接采用该条规定的等级,不再按加权分核算。
---
## 报告标红规范(v2.2强制)
报告必须让问题**一眼可见**,不得把风险项混在通过项里平铺呈现。
**颜色语义**(HTML报告统一使用):
| 状态 | 色值 | 触发条件 | 呈现要求 |
|---|---|---|---|
| 🔴 严重 | `#c0392b` | 维度得分 `<30` 或触发一票否决 | 红底红框卡片 + 置于报告最前 + 列出证据页码 |
| 🟠 警示 | `#e67e22` | 维度得分 `30-54` | 橙色左边框 + 明确写出改进动作 |
| 🟡 注意 | `#f39c12` | 维度得分 `55-79` | 黄色标记 + 一句话说明 |
| 🟢 通过 | `#27ae60` | 维度得分 `≥80` | 常规呈现,不占视觉重心 |
**强制要求**:
1. 任一维度 `<55` 时,报告顶部必须有**红色警示区**,汇总全部标红项
2. 每个标红项必须包含三要素:**问题描述 + 证据位置(页/节)+ 具体改法**
3. 不得用"建议优化""可以更好"这类模糊措辞描述标红项
4. 评分表中标红行使用红色背景,不能只靠一个小图标区分
5. 若全部维度均 `≥80`,才可在结论区使用绿色通过卡片
**生成两个版本HTML报告**:
- 简洁自检版:问题定位 + 优先级排序 + 快速改进指引
- 完整审查版:按论文结构逐部分详细分析 + 具体修改建议 + 参数溯源表
所有报告均标注"**BZD数模社制作**",支持下载和打印
---
## 关键输出物
### 1. 第一层输出表(增强的9维融合框架)
```
【第一层评分汇总 v2.1】
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【语言层面】(权重60%) 得分/100 权重 贡献
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
维度1: 高频连接词密度 XX/100 12% XX%
维度2: 排比/同构句式 XX/100 7.2% XX%
维度3: 拔高词(5级分类) XX/100 7.2% XX%
维度4: 被动句占比 XX/100 5.4% XX%
维度5: 段落规律性 XX/100 3.6% XX%
维度6: 文本复杂度(TTR/熵值) XX/100 0.6% XX%
语言小计 60% XX分
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【事实层面】(权重40%) 得分/100 权重 贡献
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
维度7: 引文验证(L1-L3) XX/100 15% XX%
维度8: 数值一致性(参数追踪) XX/100 15% XX%
维度9: 术语一致性 XX/100 10% XX%
事实小计 40% XX分
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
第一层最终得分 XX/100
风险等级 [绿/黄/橙/红/黑]
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
关键诊断:
🔴 高风险指标(需立即处理):
- 拔高词"显著"XX次,后跟数据仅XX次
- TTR值XX < 0.4(词汇极度重复)
🟡 中等风险指标(需改进):
- 被动句占比XX% (目标15-20%)
- 3-gram重复率XX% (目标<5%)
✅ 通过指标(无需改进):
- 引文5篇全部验证通过
- 关键参数追踪完全一致
- 术语使用基本统一
```
**增强说明**(相比v2.0):
- ✨ 引文验证不再只是"格式检查",而是真实性和支撑匹配度检查
- ✨ 增加了数值参数追踪,能发现虚构数据或计算不一致
- ✨ 增加了文本复杂度的科学度量(TTR、n-gram频率)
- ✨ 增加了术语一致性检测,发现概念混乱
### 2. 第二层输出表(模型合理性审查)
```
【第二层评分汇总】
模型常用性判断: XX/100
Q1: 模型名 → 常用/自定义/AI高频
模型复杂度评估: XX/100
Q1: 复杂度 vs 问题规模 → 合理/过度
华而不实识别: XX/100
五大特征检查 → 无/少/多
模型选择"三问法": XX/100
Q1: 问题明确?Q2: 数据特征?Q3: 替代论证?
建模路径风格: XX/100
十项对照:渐进建模 / 混合 / AI式复杂化倾向
第二层总分 = XX/100
```
### 3. 最终AI风险评分
```
最终AI风险分 = (第一层 + 第二层) / 2 = XX/100
风险等级 = 🟢低 / 🟡中低 / 🟠中 / 🔴中高 / ⛔高
置信度 = 低/中/高(基于输入材料完整性)
关键发现:
✓ 建模逻辑清晰/✗ 模型选择有风险
✓ 参数溯源完整/✗ 参数来源模糊
✓ 问间对接明确/✗ 跨问联动不清
...
```
### 4. HTML分层报告
三个版本均自动生成,包含:
- 学生自检版:5分钟快速诊断清单 + 高频陷阱对照表 + Top3改进
- 老师评审版:两层评分表 + 问题清单 + 审查意见
- 完整审计版:详细的五维分析 + 两层审查 + 逐板块建议 + 综合评分
---
## 特殊说明
### 关于"置信度"
- **仅论文**:置信度 = 中(±8-12分)
- **论文+赛题**:置信度 = 中(±6-10分)
- **论文+赛题+代码/结果**:置信度 = 高(±5-8分)
- **再加版本历史或对话记录**:置信度 = 高(但仍非身份鉴定)
### 关于"模型选择"的AI痕迹
本工具重点关注模型选择中的两类典型AI痕迹:
1. **自证式论证**:选择模型因为"该模型精度高、效率高"(不说明本题为什么需要)
2. **高大上陷阱**:使用深度学习、强化学习、复杂优化等不必要的复杂模型
这两类是AI生成论文最容易被识别的特征。
### 关于"参数溯源"
每个参数应能追溯到:
- **L1:赛题直接给出**(标注\*来自赛题)
- **L2:前问推导出**(标注\*来自问i的结果)
- **L3:物理约束推导**(标注\*由XXX约束推导)
无法追溯的参数 = 幽灵参数 = 高风险
---
## 文件清单
```
bzd-paper-aigc-auditor/
├── SKILL.md (本文件——skill定义)
├── README.md (项目说明)
├── references/
│ ├── audit-framework.md (五维评分标准+检查表)
│ ├── humanizer-keywords.txt (Humanizer-zh高频连接词表)
│ ├── models-zh.md (数模常用模型库vs AI高频模型)
│ └── patterns-zh.md (AI常见自证式论证模式库)
└── templates/
├── BZD数模论文AI痕迹自查指南.html (学生自检用户指南)
└── BZD数模论文AI痕迹审计报告模板.html (审计报告——简洁版+完整版)
```
---
## 快速开始
**用户(学生/老师)流程**:
1. 准备论文PDF或Word
2. 打开"BZD数模论文AI痕迹自查指南.docx",按步骤操作
3. 调用本skill进行审计
4. 获得分层HTML报告
5. 按报告中的建议改进论文
**社团/评委流程**:
1. 收集参赛论文 + 赛题 + 代码(可选)
2. 批量调用本skill
3. 汇总HTML报告,形成评审档案
4. 用"老师评审版"或"完整审计版"进行决策
---
## 版本信息
- **当前版本**:v2.0(2024-XX)
- **改进内容**:
- 加入Humanizer-zh高频连接词检测
- 增加第二层"模型合理性"审查
- 从单一报告升级为分层HTML报告
- 权重调整:语言60%+其他40%
- 新增"三问法"和"华而不实"识别
- **适用场景**:CUMCM、美赛、国赛、校赛等数学建模竞赛
- **支持平台**:Claude Code、Codex均可使用
---
## 重要声明
⚠️ **本工具的限制**:
- 该评分**不是作者身份概率**,也不能替代正式AIGC检测或查重服务
- 仅凭成稿无法证明某句话由AI生成
- 数学建模中的规范句式、模型名称、专业术语天然可能重复
- 模型的创新性不等于AI拼装(本工具只判断模型选择的合理性)
✅ **本工具的优势**:
- 专针对数学建模竞赛的AI痕迹识别
- 融合Humanizer-zh的中文文本分析
- 两层递进式检查,避免误判
- 分层输出,适应不同用户
- 可持续更新的模型库和模式库
Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!