Back to skills
SKILL.md
Data Intellectual Property Docs
ASecurity协助用户完成数据知识产权申报全流程文档制作。当用户上传原始数据并申请数据知识产权登记时调用,自动完成数据预处理、数据分析及4类申报文档(数据集结构说明、申请书、稀缺性说明、数据产品说明)的生成。
- 9 stars
- 0 votes
- 0 copies
- 1 view
- Added September 25, 2026
Works with
Security analysis
100/100npx -y skills add CSlawyer1985/legal-skillhub --skill data-intellectual-property-docs --agent claude-codeAre you the author of Data Intellectual Property Docs?
Add the live security badge to your README. It updates with every re-scan.
[](https://www.skillsdirectory.com/skills/cslawyer1985-data-intellectual-property-docs)---
name: "data-intellectual-property-docs"
description: "协助用户完成数据知识产权申报全流程文档制作。当用户上传原始数据并申请数据知识产权登记时调用,自动完成数据预处理、数据分析及4类申报文档(数据集结构说明、申请书、稀缺性说明、数据产品说明)的生成。"
---
# 数据知识产权文档生成专家
## 1. 触发条件
当用户明确表达以下意图时,必须立即调用本SKILL:
- 上传数据文件并表示要进行"数据知识产权申报"、"数据知识产权登记"
- 要求制作"数据知识产权申报书"、"数据集结构说明"、"稀缺性说明文档"
- 要求对原始数据进行"数据处理"并生成"分析报告"
- 提及需要"数据产品说明文件"或"数据知识产权相关文档"
## 2. 信息收集阶段
用户上传原始数据及示例文档后,必须向用户询问并收集以下信息:
| 序号 | 询问项 | 说明 |
|------|--------|------|
| 1 | 数据集名称 | 数据的正式命名 |
| 2 | 数据来源设备 | 采集数据的设备名称/型号/系统 |
| 3 | 数据抽取形式及条目数 | 抽取方式(全量/抽样/分层抽样)及总条目数 |
| 4 | 抽取的起止时间 | 数据采集的时间范围(如:2023年1月—2025年12月) |
| 5 | 数据应用领域 | 数据的主要应用场景或行业领域 |
| 6 | 是否已推广应用 | 数据集是否已形成数据产品并对外提供(影响是否生成第4类文档) |
## 3. 数据预处理阶段
### 3.1 处理流程
对用户上传的原始数据,按以下顺序执行标准化处理:
1. **数据加载与解析**
- 识别数据格式(CSV/Excel/JSON等)
- 解析字段结构,识别数据类型(数值型、分类型、时间型、文本型)
- 初步统计:总行数、总列数、各字段非空率
2. **去重处理**
- 检测完全重复记录
- 检测业务主键重复(如:同一患者同一次检测的重复记录)
- 记录去重前数量、去重数量、去重后数量
3. **缺失值处理**
- 统计各字段缺失率
- 策略选择(按字段类型):
- 数值型:均值/中位数/众数填充,或标记为缺失类别
- 分类型:众数填充或单独设"未知"类别
- 关键字段缺失率>30%:考虑剔除该字段或对应记录
- 记录各字段采用的缺失值处理策略
4. **异常值处理**
- 数值型字段:使用箱线图法(IQR)或3σ原则检测异常值
- 时间型字段:检测时间矛盾、未来日期、超限日期
- 分类型字段:检测逻辑矛盾(如:性别字段出现非男/女/未知值)
- 处理策略:修正、截尾、剔除或保留(视业务场景定)
- 记录各字段异常值检测结果及处理策略
5. **标准化处理**
- 数值型字段:Z-score标准化或Min-Max归一化
- 时间型字段:统一时间格式(ISO 8601)
- 分类型字段:统一编码规则
- 文本型字段:去除首尾空格、统一大小写(如需要)
6. **数据变换**
- 根据业务需求生成衍生字段(如:年龄分组、BMI分级)
- 对数变换、平方根变换(针对偏态分布数据)
- 离散化/分箱处理
- 记录所有变换规则及公式
### 3.2 处理过程记录
建立《数据处理过程记录表》,包含:
- 处理步骤序号
- 处理类型(去重/缺失值/异常值/标准化/变换)
- 涉及字段
- 处理前状态
- 处理方法/策略
- 处理后状态
- 记录数量变化
### 3.3 输出处理后的数据
- 按原始数据格式(CSV/Excel)输出清洗后的数据文件
- 文件名格式:`{数据集名称}_处理后数据_{YYYYMMDD}.{格式}`
## 4. 数据分析阶段
### 4.1 探索性数据分析(EDA)
对处理后的数据执行以下分析并生成可视化:
1. **描述性统计**
- 数值型:均值、中位数、标准差、最小值、最大值、四分位数
- 分类型:频数分布、占比、众数
- 时间型:时间跨度、分布趋势
2. **数据分布分析**
- 各字段直方图/密度图
- 箱线图(检测偏态和离群点)
- 正态性检验(Shapiro-Wilk或Kolmogorov-Smirnov)
3. **相关性分析**
- 数值型字段间Pearson/Spearman相关系数矩阵
- 热力图可视化
4. **数据质量评估**
- 完整性、准确性、一致性、时效性评估
### 4.2 机器学习分析
根据数据特点选择合适的机器学习任务(分类/回归/聚类/时序预测):
#### 4.2.1 数据划分
按以下三种比例分别划分训练集和验证集:
- 训练集:验证集 = 8:2
- 训练集:验证集 = 7:3
- 训练集:验证集 = 9:1
要求:
- 使用随机种子保证可复现
- 分层抽样(针对分类问题,保持类别比例一致)
- 分别在三套划分上训练并评估模型
#### 4.2.2 模型选择与训练
根据数据特点选择至少3种算法进行对比:
**分类任务候选算法:**
- 逻辑回归(Logistic Regression)
- 随机森林(Random Forest)
- 支持向量机(SVM)
- XGBoost/LightGBM
- 神经网络(MLP)
**回归任务候选算法:**
- 线性回归 / 岭回归 / Lasso
- 随机森林回归
- XGBoost回归
- 支持向量回归(SVR)
**聚类任务候选算法:**
- K-Means
- DBSCAN
- 层次聚类
**评估指标:**
- 分类:准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1-Score、AUC-ROC
- 回归:MSE、RMSE、MAE、R²
- 聚类:轮廓系数(Silhouette Score)、CH指数
#### 4.2.3 模型筛选
- 对比三种划分比例下的模型表现
- 筛选综合表现最优的1-2种方法
- 分析模型稳定性(不同划分下的方差)
### 4.3 分析报告输出
生成《数据分析报告》,必须包含:
1. **数据概览**
- 样本总量、特征数量、数据类型分布
- 目标变量分布(监督学习任务)
2. **探索性分析结果**
- 关键发现、异常特征、强相关变量对
- 附可视化图表
3. **机器学习结果**
- 各算法在三套划分下的性能对比表
- 最优模型选择理由
- 特征重要性分析(如适用)
- 模型评估指标详细数值
4. **算法公式**
- 列出所使用算法的核心数学公式
- 例如:
- 逻辑回归:$P(y=1|x) = \frac{1}{1 + e^{-(w^Tx + b)}}$
- 随机森林:$\hat{f}(x) = \frac{1}{B}\sum_{b=1}^{B} f_b(x)$
- 标准化:$z = \frac{x - \mu}{\sigma}$
5. **结果说明**
- 模型在实际场景中的适用性分析
- 潜在局限性
- 改进方向
## 5. 文档生成阶段
基于数据处理过程记录和数据分析报告,生成以下4类文档:
### 5.1 数据集结构说明(Excel表)
生成Excel文件,包含以下字段:
| 列名 | 说明 |
|------|------|
| 序号 | 字段序号 |
| 字段名称 | 字段的英文/中文名称 |
| 字段类型 | 数值型/分类型/时间型/文本型 |
| 字段属性 | 连续/离散/有序/无序 |
| 值范围说明 | 取值范围、单位、合法值示例 |
| 主键关系 | 是否为主键、外键关联、业务主键说明 |
| 缺失率(%) | 该字段缺失值占比 |
| 处理方式 | 对该字段执行的数据处理操作 |
额外增加Sheet页《数据字典》,包含字段业务含义说明。
### 5.2 数据知识产权申请书
参照数据知识产权申报书标准样式撰写,必须包含以下章节:
**封面/标题**
- 数据知识产权登记申请书
**一、数据集基本信息**
- 数据集名称
- 数据类别(原始数据/加工后数据/衍生数据)
- 数据来源及采集设备
- 数据采集时间段
- 数据总量及条目数
- 数据格式
**二、数据处理过程说明**
- 原始数据状况
- 数据清洗规则(去重、缺失值、异常值处理详情)
- 数据标准化与变换方法
- 数据质量提升效果
**三、数据分析方法及结果**
- 分析目标
- 探索性分析主要发现
- 机器学习方法(按2:8/3:7/1:9划分的训练验证方案)
- 最优模型及评估结果
- 核心算法公式
- 分析结论
**四、数据创新性说明**
- 数据稀缺性或独特性
- 数据加工的创新点
- 数据价值提炼过程
**五、数据应用场景**
- 适用领域
- 典型应用场景
- 应用前景
**六、承诺声明**
- 数据来源合法性声明
- 数据使用合规性声明
### 5.3 数据稀缺性说明文档
**仅当数据总量(清洗后)少于1000条时生成。**
参照以下结构撰写DOCX文档:
**1 概述**
- 说明本文件目的:佐证数据质量、样本分布及稀缺情况
**2 全量数据及数据清洗情况**
- 2.1 原始全量数据:数据集名称、采集时间段、原始总量、涵盖核心字段
- 2.2 数据清洗规则:逐条列出清洗规则(剔除缺失、剔除异常、去重、筛选规则等)
- 2.3 清洗后有效全量数据:可用总量
**3 全量数据处理说明**
- 清洗后母体数据量
- 最终有效样本总量
- 整体占比
- 分层覆盖情况
**4 数据稀缺情况说明**
- 4.1 数据稀缺判定标准:
- 高度稀缺:亚组占比<1%
- 中度稀缺:1%≤亚组占比<3%
- 数据充足:亚组占比≥3%
- 4.2 各亚组数据占比及稀缺情况(表格)
- 表格列:序号、亚组名称、占比(%)、样本量(条)、稀缺等级、来源/参考文献
- 4.3 整体稀缺情况汇总
- 各稀缺等级亚组数量及占比
- 整体分布特征描述
- 4.4 数据稀缺成因情况(逐条列出)
- 4.5 数据稀缺对分析结果的影响
- 4.6 稀缺数据优化与处理措施
**5 总结**
- 数据集整体评价
- 结论有效性说明
### 5.4 数据产品说明文件
**仅当用户明确数据集已进行推广应用时生成。**
包含内容:
**1 数据产品概述**
- 产品名称
- 产品形态(API/数据包/报告/模型等)
- 目标用户群体
**2 数据来源与加工**
- 数据来源说明
- 核心加工过程
- 数据质量保障
**3 产品功能与价值**
- 核心功能模块
- 解决的业务痛点
- 数据价值体现
**4 应用案例与效果**
- 已服务的客户/机构
- 典型应用案例
- 量化效果指标
**5 应用前景分析**
- 市场需求分析
- 行业发展趋势
- 潜在应用场景扩展
- 可检索相关专利作为应用前景参考(如用户要求)
**6 合规性与安全性**
- 数据脱敏与隐私保护
- 使用授权范围
- 合规资质
## 6. 输出规范
1. 所有文档必须使用中文撰写
2. 数值保留适当小数位数(一般2-4位)
3. 表格使用标准三线表格式
4. 公式使用LaTeX格式排版
5. 文件命名规范:
- 处理后数据:`{数据集名称}_处理后数据_{YYYYMMDD}.{格式}`
- 数据集结构说明:`{数据集名称}_数据集结构说明_{YYYYMMDD}.xlsx`
- 申请书:`{数据集名称}_数据知识产权申请书_{YYYYMMDD}.docx`
- 稀缺性说明:`{数据集名称}_数据稀缺性说明_{YYYYMMDD}.docx`
- 数据产品说明:`{数据集名称}_数据产品说明_{YYYYMMDD}.docx`
- 分析报告:`{数据集名称}_数据分析报告_{YYYYMMDD}.docx`
## 7. 执行流程图
```
用户上传数据
↓
收集6项基本信息(名称、设备、形式/条目数、起止时间、领域、是否推广)
↓
数据预处理(去重→缺失值→异常值→标准化→变换)
↓
输出:处理后数据文件 + 处理过程记录
↓
探索性数据分析(EDA)
↓
机器学习分析(2:8 / 3:7 / 1:9 划分对比)
↓
输出:数据分析报告(含算法公式、结果说明)
↓
生成文档:
├─ 1. 数据集结构说明(Excel)【必须】
├─ 2. 数据知识产权申请书(DOCX)【必须】
├─ 3. 数据稀缺性说明(DOCX)【数据<1000条时】
└─ 4. 数据产品说明(DOCX)【已推广时】
```
## 8. 特别注意事项
1. **数据处理可复现性**:所有随机操作必须设置随机种子,确保结果可复现
2. **分层抽样**:如为分类问题,划分训练/验证集时必须使用分层抽样
3. **稀缺性判定**:亚组划分应基于业务逻辑(如疾病分级、年龄段、性别等),非随意划分
4. **算法公式准确性**:所有数学公式必须经过校验,确保符号和表达正确
5. **用户确认**:在生成最终文档前,应向用户确认关键信息(数据集名称、时间范围等)无误
6. **隐私保护**:处理过程中如发现敏感个人信息,应提示用户进行脱敏处理
Attribution
Comments
Loading comments…