通用的 6 阶段数据分析助手:数据质量→探索性分析→假设生成→可视化→代码生成→综合报告。提供完整的方法论和模板!
Scanned 5/27/2026
Install via CLI
openskills install liangdabiao/claude-data-analysis-ultra-main---
name: "data-analysis"
description: "通用的 6 阶段数据分析助手:数据质量→探索性分析→假设生成→可视化→代码生成→综合报告。提供完整的方法论和模板!"
---
# Data Analysis Skill - 通用 6 阶段数据分析指南
此 skill 提供专业的数据分析方法论,采用标准的 6 阶段工作流,适用于任何数据集。
---
## 🚀 核心:6 阶段工作流(通用)
```
┌─────────────────────────────────────────────────────────────┐
│ Stage 1: 数据质量检查 (Data Quality) │
│ - 完整性、唯一性、有效性检查 │
│ - 问题诊断和改进建议 │
└─────────────────────────┬───────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Stage 2: 探索性数据分析 (Exploratory Data Analysis) │
│ - 描述性统计(均值、中位数、标准差) │
│ - 相关性分析、模式发现 │
│ - 异常检测 │
└─────────────────────────┬───────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Stage 3: 研究假设生成 (Hypothesis Generation) │
│ - 基于数据发现生成可检验假设 │
│ - A/B 测试设计、实验方法论 │
└─────────────────────────┬───────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Stage 4: 数据可视化 (Visualization) │
│ - 统计图表、分布图、热力图 │
│ - 交互式仪表板 │
└─────────────────────────┬───────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Stage 5: 可复用代码生成 (Code Generation) │
│ - 数据处理管道、分析函数库 │
│ - 机器学习代码(如需要) │
└─────────────────────────┬───────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────┐
│ Stage 6: 综合报告生成 (Report Generation) │
│ - 综合分析报告 + 执行摘要 │
│ - 业务洞察和建议 │
└─────────────────────────────────────────────────────────────┘
```
---
## 📂 Skill 目录结构(所有内容都在这里)
```
.trae/skills/data-analysis/
├── SKILL.md # 本文档
├── templates/ # 📋 模板目录
│ ├── stage1_quality_template.md # Stage 1: 数据质量报告模板
│ ├── stage2_eda_template.md # Stage 2: 探索性分析报告模板
│ ├── stage3_hypothesis_template.md # Stage 3: 假设生成模板
│ ├── stage4_visualization_template.md # Stage 4: 可视化模板
│ ├── stage5_code_template.md # Stage 5: 代码生成模板
│ └── stage6_report_template.md # Stage 6: 综合报告模板
├── examples/ # 📊 示例目录
│ └── olist/ # Olist 数据集分析示例(仅供参考)
│ ├── README.md
│ └── sample_outputs/
└── guide/ # 📖 详细指南
├── stage1_quality_guide.md
├── stage2_eda_guide.md
├── stage3_hypothesis_guide.md
├── stage4_visualization_guide.md
├── stage5_code_guide.md
└── stage6_report_guide.md
```
---
## 🎯 使用指南
### Step 1: 开始分析
当用户需要分析数据时,按照以下 6 个阶段进行:
```
1. Stage 1: 数据质量检查
2. Stage 2: 探索性数据分析
3. Stage 3: 研究假设生成
4. Stage 4: 数据可视化
5. Stage 5: 代码生成(如需要)
6. Stage 6: 综合报告生成
```
### Step 2: 输出组织
创建以下输出目录结构(可自定义名称):
```
analysis_results/
├── stage1_quality_report/
├── stage2_eda_report/
├── stage3_hypothesis_report/
├── stage4_visualizations/
├── stage5_generated_code/
└── stage6_final_report/
```
---
## 📋 各阶段详细指导
### Stage 1: 数据质量检查
**目标**: 评估数据质量,识别问题并提出改进建议
**检查要点**:
- **完整性**: 缺失值统计
- **唯一性**: 重复记录检查
- **有效性**: 数据类型、范围、格式验证
- **一致性**: 数据逻辑一致性检查
**输出**:
- 质量评估报告
- 问题日志
- 改进建议
**参考模板**: `templates/stage1_quality_template.md`
---
### Stage 2: 探索性数据分析
**目标**: 理解数据结构,发现模式和洞察
**分析内容**:
- **描述性统计**: 均值、中位数、标准差、分位数
- **相关性分析**: Pearson/Spearman 相关系数
- **模式发现**: 时间趋势、分布模式、异常值
- **可视化**: 直方图、箱线图、散点图
**输出**:
- 统计摘要
- 模式发现报告
- 相关性分析
**参考模板**: `templates/stage2_eda_template.md`
---
### Stage 3: 研究假设生成
**目标**: 基于数据发现生成可检验的假设
**假设类型**:
- 相关性假设: A 是否与 B 相关?
- 比较性假设: A 组是否显著不同于 B 组?
- 因果性假设: A 是否导致 B?
**输出**:
- 研究假设列表(带优先级)
- 实验设计方案
- 验证计划
**参考模板**: `templates/stage3_hypothesis_template.md`
---
### Stage 4: 数据可视化
**目标**: 用图表讲述数据故事
**图表类型**:
- **趋势分析**: 折线图、面积图
- **分布分析**: 直方图、密度图、箱线图
- **相关性**: 散点图、热力图
- **比较**: 柱状图、分组图
- **构成**: 饼图、堆叠图
**输出**:
- 可交互式 HTML 仪表板(推荐)
- 静态图表(PNG/SVG)
- 可视化代码
**参考模板**: `templates/stage4_visualization_template.md`
---
### Stage 5: 代码生成
**目标**: 生成可复用的分析代码
**代码类型**:
- 数据预处理和清洗
- 质量检查函数
- 分析管道
- 可视化函数
- 机器学习代码(如需要)
**输出**:
- 完整的分析脚本
- 可复用的函数库
- 使用说明
**参考模板**: `templates/stage5_code_template.md`
---
### Stage 6: 综合报告生成
**目标**: 汇总所有分析,提供业务洞察
**报告结构**:
1. 执行摘要
2. 数据概述
3. 深度分析
4. 研究假设
5. 业务建议
6. 实验设计
7. 结论
**输出**:
- 综合分析报告(Markdown/PDF)
- 执行摘要(给管理层)
- 技术附录
**参考模板**: `templates/stage6_report_template.md`
---
## 🔧 快速参考
### 常用分析方法
| 分析类型 | 方法 |
|---------|------|
| 描述统计 | 均值、中位数、标准差、分位数 |
| 相关性 | Pearson/Spearman 相关系数 |
| 假设检验 | t 检验、ANOVA、卡方检验 |
| 异常检测 | IQR、Z-score、DBSCAN |
| 客户分群 | RFM 分析、K-means 聚类 |
| 预测模型 | 线性回归、随机森林、XGBoost |
---
## 🏷️ 语言要求
所有分析输出、报告和可视化使用**中文**,除非用户另有说明。
---
## � 详细指南
每个阶段的详细操作指南,请参考 `guide/` 目录下的文档。
---
## ✅ Skill 特点
✅ **通用化**: 适用于任何数据集,不绑定特定数据
✅ **指导性**: 提供方法论和模板,而非写死的脚本
✅ **完整**: 标准 6 阶段工作流
✅ **本地化**: 所有内容放在 skill 目录下
✅ **可扩展**: 可根据需要添加新模板和指南
No comments yet. Be the first to comment!