Data & Analytics
Data analysis, BI, visualization, datasets, statistics, and ML workflows
Browse data & analytics skills
Showing 1,801–1,824 of 13,031 skills
'结构化数据分层采样工具。读取 JSONL、JSON、CSV、TSV、XLSX、XLS 等结构化数据,按指定字段分层后无放回抽取样本,输出保留原字段结构的采样结果。
'统计与机器学习异常值检测工具。读取结构化表格数据,使用 IQR、Z-score、IsolationForest 或分组标准差一致性方法识别异常值,输出带异常标记、删除异常行或裁剪异常值后的结果文件。
'隐私标识移除工具。读取结构化文本数据,按用户选择的类别删除或替换邮箱、IPv4 地址、电话号码等文本中的隐私标识。
'无用数字字符清理工具。读取结构化文本数据,对指定或全部文本字段移除无语义的独立数字字符,输出清理后的结构化文件。
缺失值删除工具。读取结构化表格或 JSONL 数据,删除包含缺失值的行或删除缺失比例过高的列;不负责缺失值填充。 当用户提到删除缺失值、删除空值行、删除空值列等需求时使用此skill。 适用于科研表格和结构化数据的缺失清理,不负责插值、补值、均值填充或其他修复操作。
全角/半角字符规范化工具。读取结构化数据文件,将文本中的全角ASCII字符(字母、数字、标点)转换为半角形式, 并可按需执行指定 Unicode 正规化。适用于中日韩混排科研文本的统一预处理,不负责空白行删除、拼写纠错或重复标点合并。 当用户提到全角转半角、半角规范化、全半角统一、全角字母数字转换等需求时使用此skill。
'模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。
'精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。
'按字段拆分数据工具。根据指定字段的值将结构化表格拆分为多个文件,每个唯一值对应一个输出文件。
数据横向关联工具。读取多个结构化数据文件,按指定键进行横向关联(JOIN),输出关联后的合并文件。 当用户提到数据关联、表连接、横向合并、键合并、JOIN等需求时使用此skill。 即使用户没有明确说出"关联",只要任务涉及按某个字段将多个表的数据关联在一起,就应该使用此skill。 不负责数据纵向拼接(concat)、数据去重、或字段值聚合(GROUP BY)。
数据纵向拼接工具。读取多个具有相同列结构的结构化数据文件,执行按行纵向追加合并(concat),输出单一合并文件。 当用户提到数据拼接、纵向合并、行合并、数据追加、文件合并等需求时使用此skill。 即使用户没有明确说出"拼接",只要任务涉及将多个同构数据文件上下合并为一个,就应该使用此skill。 不负责横向关联(join/merge on key)、字段级合并或非结构化文档聚合。如需按键值关联请使用其他skill。
'数据脱敏工具。对结构化数据中的敏感字段进行字符遮蔽脱敏,保留字段位置并用遮蔽字符替换手机号、身份证、姓名、邮箱、银行卡等内容。
清理文本中的链接(HTTP/HTTPS/FTP)。当用户提到清理链接、删除URL、去除超链接、清理网页链接等需求时使用此skill。 即使用户没有明确说出"链接",只要任务涉及从文本中删除或替换URL链接,就应该使用此skill。
清除文本示例中的IPv4和IPv6地址。当用户提到清理IP、删除IP地址、去除IP、清理网络地址等需求时使用此skill。 即使用户没有明确说出"IP",只要任务涉及从文本中删除或替换IP地址,就应该使用此skill。
清理文本样本中的电子邮件。当用户提到清理邮件、删除邮箱、去除邮件地址、清理个人信息等需求时使用此skill。 即使用户没有明确说出"邮件",只要任务涉及从文本中删除或替换邮箱地址,就应该使用此skill。
清理版权注释开头的文本样本。当用户提到清理版权、删除版权注释、清理代码注释、去除版权信息等需求时使用此skill。 即使用户没有明确说出"版权",只要任务涉及清理文本开头的注释或版权信息,就应该使用此skill。
在繁体中文、简体中文和日语汉字之间转换中文。当用户提到中文繁简转换、中文转换、简体转繁体、繁体转简体、中日文转换等需求时使用此skill。 即使用户没有明确说出"转换",只要任务涉及中文繁简转换或中日文转换,就应该使用此skill。
本skill是用于单细胞样本性别判定的专用技能,首先需要用户上传需要处理的单细胞样本数据,再判定未标注性别的样本,或纠正标注错误的性别信息,生成最后的修正文件。
用于单细胞测序数据预处理的专用技能,对单细胞表达矩阵进行标准化处理,以消除技术偏差,为聚类、差异表达分析提供可靠的数据基础。
本skill是用于单细胞测序数据分析的专用技能,首先需要用户上传需要处理的单细胞测序数据,再对经过预处理的单细胞表达数据进行自动化细胞类型注释。它通过基因比对、数据标准化、降维等一系列流程,将细胞聚类结果与已知参考数据库进行匹配,从而为每个细胞分配生物学功能标签。
数值数据阈值检验工具。读取结构化数据文件(CSV、TSV、Excel等),检查数值字段是否在指定的门限范围内,不允许超出门限值之外,最后输出为同格式的文件。当用户需要对数据进行阈值检验、数值范围检查、数据质量控制等操作时使用此skill。
Guidance on web content analysis, data extraction, and online research techniques for legal and regulatory information gathering
Use this skill when a task points to external scientific sources or benchmark pages. 1. Prefer primary benchmark URLs and cited dataset/project pages. 2. Record accessed URLs and version assumptions in the output JSON. 3. Distinguish source facts from derived calculations. 4. Do not claim unavailable files were inspected; describe fallback reasoning instead.
Use this skill for tasks that mention datasets, previews, CSV files, models, or generated artifacts. 1. Inspect the payload, folder tree, preview rows, and requested output paths. 2. Propose a reproducible script layout before modeling. 3. Choose baselines and metrics appropriate to the domain. 4. Validate by checking file existence, schema, row counts, value ranges, and leakage risks. 5. Save generated artifacts under `/app` unless the task explicitly asks for another path.