
Claude Skills by cas-bigdatalab
github.com/cas-bigdatalab清理文本中的链接(HTTP/HTTPS/FTP)。当用户提到清理链接、删除URL、去除超链接、清理网页链接等需求时使用此skill。 即使用户没有明确说出"链接",只要任务涉及从文本中删除或替换URL链接,就应该使用此skill。
内容解析预处理工具。读取采集后的 JSONL、JSON 或 TXT 文本记录,执行轻量内容解析,输出带标题、段落结构和内容类型的统一解析记录文件。 当用户提到接入内容解析、采集后预处理、提取标题和段落、识别 plain/markdown/html 内容结构等需求时使用此 skill。 即使用户没有明确说出"内容解析",只要任务涉及把已采集文本内容解析成统一结构,就应该使用此 skill。 不负责文件采集、表格抽取、内容清洗、质量校验、过滤筛选或格式转换。
跨字段比较校验工具。读取结构化数据文件(CSV、TSV、Excel等),检查两个字段之间的逻辑约束关系 是否满足(如 start < end、min ≤ max、price >= cost),支持六种比较运算符,多约束可组合使用。 当用户提到跨字段校验、字段间比较、逻辑约束检查、大小关系验证等需求时使用此skill。 即使用户没有明确说出"跨字段",只要任务涉及验证两个字段值之间的逻辑关系,就应该使用此skill。
CSV格式化器。用于加载和格式化csv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到CSV格式化、CSV数据加载、读取CSV文件、CSV转JSONL等需求时使用此skill。
'数据脱敏工具。对结构化数据中的敏感字段进行字符遮蔽脱敏,保留字段位置并用遮蔽字符替换手机号、身份证、姓名、邮箱、银行卡等内容。
数据纵向拼接工具。读取多个具有相同列结构的结构化数据文件,执行按行纵向追加合并(concat),输出单一合并文件。 当用户提到数据拼接、纵向合并、行合并、数据追加、文件合并等需求时使用此skill。 即使用户没有明确说出"拼接",只要任务涉及将多个同构数据文件上下合并为一个,就应该使用此skill。 不负责横向关联(join/merge on key)、字段级合并或非结构化文档聚合。如需按键值关联请使用其他skill。
数据横向关联工具。读取多个结构化数据文件,按指定键进行横向关联(JOIN),输出关联后的合并文件。 当用户提到数据关联、表连接、横向合并、键合并、JOIN等需求时使用此skill。 即使用户没有明确说出"关联",只要任务涉及按某个字段将多个表的数据关联在一起,就应该使用此skill。 不负责数据纵向拼接(concat)、数据去重、或字段值聚合(GROUP BY)。
'数值标准化工具。读取JSONL数据,按指定字段执行Z-score或Min-Max标准化,并保留原始值与变更标记。
'按字段拆分数据工具。根据指定字段的值将结构化表格拆分为多个文件,每个唯一值对应一个输出文件。
'JSONL比例切分工具。读取JSONL数据集,按给定比例拆成多个子集,支持随机切分和按字段分层切分。
数据类型转换工具。转换数据字段的类型,支持数值、字符串、日期等类型互转。 当用户提到类型转换、数据格式转换、字段类型修改等需求时使用此skill。 即使用户没有明确说出"类型转换",只要任务涉及改变字段的数据类型,就应该使用此skill。
Dataspace 文件输出终止算子。用于接收上游算子的单个文件输出,按指定相对目录上传到 Dataspace 空间目录中,实际文件名自动沿用输入文件名。该算子必须作为 DAG 的终止节点使用。
Dataspace 文件输入源算子。用于根据 Dataspace 数据源实例 ID 和空间内文件路径下载单个文件,并将该文件作为工作流输入提供给下游算子。该算子没有上游输入,必须作为 DAG 的起始节点使用。
Guide users through a structured workflow for co-authoring documentation. Use when user wants to write documentation, proposals, technical specs, decision docs, or similar structured content. This workflow helps users efficiently transfer context, refine content through iteration, and verify the doc works for readers. Trigger when user mentions writing docs, creating proposals, drafting specs, or similar documentation tasks.
文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本。 当用户提到文档去重、删除重复文档、样本去重、文本去重、去除重复内容、 清洗重复数据、整理文档集合等需求时使用此skill。 即使用户没有明确说出"去重",只要任务涉及从多个文档中识别和删除重复内容, 就应该使用此skill。
将解压的XML目录重新打包为DOCX文件
从DOCX文件中提取文本内容
将DOCX文档转换为Markdown格式
将DOCX文件解压为XML目录
验证DOCX文件格式有效性
'精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。
'模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。
'文本内部重复片段模糊清理工具。读取 JSONL 文本数据,按文本字段删除近似重复的段落、句子或连续片段,保留首次出现内容并输出清理后的样本。
'结构化表格重复行检测工具。仅检查CSV/TSV/Excel等表格型数据中的完全重复记录或指定列子集重复,
空数据格式化器。用于创建空数据。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到创建空数据集、生成空数据、初始化数据集、测试用空数据等需求时使用此skill。
'英文文本基础清洗工具。读取英文科研文本,展开常见缩写、修正常见拼写错误并可选规范大小写,输出整理后的 JSONL 数据。
'多编码文本统一转换工具。读取文本文件或目录,自动识别源编码并转换为目标编码(默认 UTF-8),输出转换后的文件。
实体属性聚合工具。从多个文档中提取并总结给定实体的特定属性信息。 当用户提到从文档中提取实体信息、总结人物属性、聚合实体特征、提取文档中的实体信息、 根据文档总结实体属性(如总结某人物的主要经历、身份背景、成就等)等需求时使用此skill。 即使用户没有明确说出"聚合"或"实体",只要任务涉及从多个文档中提取和总结某个主题/人物/实体的 特定属性,就应该使用此skill。
敏感词过滤器。过滤文本中包含敏感词/标记词比例超过指定阈值的样本。 当用户提到敏感词过滤、脏词过滤、违禁词过滤、内容审核、敏感词检测等需求时使用此skill。 即使用户没有明确说出"敏感词",只要任务涉及过滤包含特定敏感词的文本内容, 就应该使用此skill。
接入资源格式识别工具。读取单个文件或目录中的接入资源,识别文本、表格、文档、图像、HTML、数据或未知类型,输出带推荐处理路由的格式识别结果文件。 当用户提到格式识别、资源类型预判、采集入口分流、为文本/表格/文档/图像/HTML 选择后续处理路径等需求时使用此 skill。 即使用户没有明确说出"格式识别",只要任务涉及在采集入口判断文件类型并分配推荐处理路由,就应该使用此 skill。 不负责读取正文内容、提取图像元信息、表格采集、文档解析、格式转换或实际执行后续处理。
Create distinctive, production-grade frontend interfaces with high design quality. Use this skill when the user asks to build vue-web components, pages, artifacts, posters, or applications (examples include websites, landing pages, dashboards, React components, HTML/CSS layouts, or when styling/beautifying any vue-web UI). Generates creative, polished code and UI design that avoids generic AI aesthetics.
全角/半角字符规范化工具。读取结构化数据文件,将文本中的全角ASCII字符(字母、数字、标点)转换为半角形式, 并可按需执行指定 Unicode 正规化。适用于中日韩混排科研文本的统一预处理,不负责空白行删除、拼写纠错或重复标点合并。 当用户提到全角转半角、半角规范化、全半角统一、全角字母数字转换等需求时使用此skill。
使用 Gaussian 的 formchk 工具将 chk 检查点文件转换为 fchk 波函数文本文件。
使用 Gaussian 软件执行量子化学计算,包括 DFT 结构优化、频率分析和单点能计算。生成 .log 和 .chk 文件,并将所有输出打包为 zip 压缩包。
几何识别与图像分割结果地理转换算子。用户提到图像分割分析、遥感分割定位、地理坐标映射时优先调用。
用于编辑或创建 Gaussian 输入文件(.gjf),支持添加 Link 0 指令(%chk、%oldchk、%nprocshared、%mem)、Route 行关键词、电荷和多重度。可对已有 gjf 文件进行参数填充,也可从零创建新的 gjf 文件。
沟道坡度特征计算算子。用户提到沟道坡度、DEM地形坡度预处理、沟道地形分析时优先调用。
山洪/水文敏感度计算算子。用户提到山洪敏感度、易发性评估、水文风险分析时优先调用。
图像美学过滤器。过滤美学评分不在指定范围内的图像样本。 当用户提到图像美学、图像质量过滤、图片评分筛选、图像质量评估、过滤低质量图像等需求时使用此skill。 即使用户没有明确说出"美学评分",只要任务涉及根据图像美学质量来筛选数据, 就应该使用此skill。
图像长宽比过滤器。过滤图像长宽比不在指定范围内的样本。 当用户提到图像长宽比、图片比例过滤、图像尺寸筛选、图像宽高比等需求时使用此skill。 即使用户没有明确说出"长宽比",只要任务涉及根据图像宽高比来筛选数据, 就应该使用此skill。
图像去重工具。使用图像哈希精确匹配在文档级别删除包含重复图像的样本。 当用户提到图像去重、删除重复图片、图片去重、清理重复图像等需求时使用此skill。 即使用户没有明确说出"图像去重",只要任务涉及从包含图像的数据中删除重复图片, 就应该使用此skill。
图像人脸数量过滤器。过滤以保持样本的面数在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、识别人脸、人脸数量检测、图片人脸筛选、按人脸数量过滤等需求时使用此skill。
图像人脸面积比例过滤器。过滤以保持面面积比在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、人脸占比、面部面积比例、图片人脸区域筛选、按人脸占比过滤等需求时使用此skill。
图像NSFW内容检测过滤器。过滤器保留图像具有低nsfw分数的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图片安全检测、NSFW过滤、不良内容过滤、图片审核、图像内容过滤等需求时使用此skill。
图像对相似度过滤器。过滤器将图像之间具有相似性的图像对保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像相似度检测、图像对过滤、双图相似度、图片相似度筛选、图像pair过滤等需求时使用此skill。
图像形状过滤器。过滤器保持样品的图像形状 (w,h) 在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像尺寸过滤、图片宽高筛选、图像分辨率过滤、按图片大小过滤、图像形状限制等需求时使用此skill。
图像文件大小过滤器。保留图像大小 (以字节/KB/MB/... 为单位) 在特定范围内的数据样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文件大小过滤、图片大小筛选、图像尺寸KB/MB过滤、按文件大小过滤等需求时使用此skill。
图像文本匹配过滤器。过滤器将图像和文本之间的匹配分数保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本匹配过滤、图片文字匹配度、文图匹配检测、图像文本相关性过滤等需求时使用此skill。
图像文本相似度过滤器。过滤器将图像和文本之间的相似性保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本相似度过滤、图片文字相似度、文图相似度检测、图文相关性过滤等需求时使用此skill。
图像水印过滤器。过滤器以保持其图像没有水印的样本具有高概率。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像水印检测、图片无水印过滤、水印去除、检测图片水印等需求时使用此skill。