All authors
cas-bigdatalab avatar

Claude Skills by cas-bigdatalab

github.com/cas-bigdatalab
204 skillsA× 203B× 10 installs32 views
Ingest Archive 7z ExtractorA

'7z 压缩包解压工具。递归扫描目录内 .7z 文件及分卷(.7z.001 等),解压并输出解压清单。依赖 py7zr 库。不负责 zip、rar

toolspythonbash
0
539
Ingest Archive 7z PreviewA

'7z 压缩包内容预览工具。递归扫描目录内 .7z 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。

toolspythonbash
0
539
Ingest Archive Rar ExtractorA

'RAR 压缩包解压工具。递归扫描目录内 .rar 文件及分卷(.part1.rar/.part2.rar 等),解压并输出解压清单。依赖

toolspythonbash
0
539
Ingest Archive Rar PreviewA

'RAR 压缩包内容预览工具。递归扫描目录内 .rar 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。

toolspythonbash
0
539
Ingest Archive Tar ExtractorA

'TAR 压缩包解压工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,解压并输出解压清单。不负责

toolspythonbash
0
539
Ingest Archive Tar PreviewA

'TAR 压缩包内容预览工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。

toolspythonbash
0
539
Ingest Archive Zip ExtractorA

'ZIP 压缩包解压工具。递归扫描目录内 .zip 文件及分卷(.z01/.z02 等),合并分卷后解压并输出解压清单。当用户需要批量解压

toolspythonbash
0
539
Ingest Archive Zip PreviewA

'ZIP 压缩包内容预览工具。递归扫描目录内 .zip 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。

toolspythonbash
0
539
Invisible Char CleanerA

不可见字符清洗工具。移除零宽空格、BOM、软连字符、双向文本控制符、C0控制字符等 63 个码点 的不可见/干扰字符。当用户提到不可见字符、零宽空格、BOM 清除、控制字符清洗等需求时使用此skill。

toolspythonbash
0
539
Key Value GrouperA

根据给定键中的值将样本分组为批处理样本。当用户提到样本分组、按键值分组、批处理样本、按键聚合、分组聚合等需求时使用此skill。 即使用户没有明确说出"分组",只要任务涉及将多个样本按某个字段/键的值进行归类合并,就应该使用此skill。

toolspythonbash
0
539
Keyword ExtractorA

'关键词提取标注工具。读取包含文本字段的表格或JSONL语料,为每条记录提取核心关键词并写入新增关键词字段。

toolspythonbash
0
539
Language FilterA

语种过滤工具。对指定或全部文本列进行语言检测,可选择保留或剔除目标语种, 输出过滤后的数据并附带 detected_lang 列。

toolspythonbash
0
539
Language Id Score FilterA

语言识别分数过滤器。过滤器以保留置信度得分大于特定最小值的特定语言的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到语言识别过滤、语言检测、文本语言筛选、按语言过滤等需求时使用此skill。

toolspythonbash
0
539
Local FormatterA

本地格式化器。类用于从本地文件或本地目录加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载本地数据集、读取本地文件、格式化本地数据、数据集加载等需求时使用此skill。

toolspythonbash
0
539
Lowinfo FilterA

低信息量过滤工具。读取结构化数据文件,对指定文本列同时校验字符总数与行数是否落在阈值区间内,输出过滤后的合规行。 当用户提到低信息量过滤、字符数筛选、短文本过滤、超长文本过滤、行数过滤、信息量阈值等需求时使用此skill。 即使用户没有明确说出"低信息量",只要任务涉及同时按字符数和行数两个维度过滤文本行,就应该使用此skill。 不负责按单词数过滤(用words_num_filter)、按token数过滤(用token_num_filter)、按最长单行长度过滤(用maximum_line_length_filter)或按平均行长度过滤(用average_line_length_filter)。与这些skill的关键区别在于:本skill同时校验字符总数与行数两个维度,且原生支持CSV/TSV/Excel多列输入、不依赖data_juicer。

toolspythonbash
0
539
Markdown StripperA

Markdown标记清除工具。读取Markdown文件,去除Markdown语法标记(标题#、加粗**、斜体*、链接[]()、代码块```、引用>、列表标记等),输出纯文本文件。 当用户提到Markdown清洗、去除MD标记、MD转纯文本等需求时使用此skill。 适用于Markdown文件的语法净化,不负责CSV/表格数据的结构清洗。

developmentpythonbash
0
539
Maximum Line Length FilterA

最大行长度过滤器。过滤器将最大行长度的样本保持在特定范围内。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到最大行长度过滤、文本行长筛选、最长行过滤、按行长度过滤等需求时使用此skill。

toolspythonbash
0
539
Meta Tags AggregatorA

元标签聚合工具。合并意思相近的元标签,将多个相似标签归类到统一的标签下。 当用户提到标签聚合、合并标签、归类标签、标签映射、标签合并、整理标签等需求时使用此skill。 即使用户没有明确说出"聚合"或"合并",只要任务涉及将多个相似标签归类统一, 就应该使用此skill。

ai-agentspythonbash
0
539
Mineru File ParseA

MinerU文件解析算子。通过远程调用MinerU接口,解析本地文件(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。

developmentpythonbash
0
539
Mineru Url ParseA

MinerU URL解析算子。通过远程调用MinerU接口,解析在线文档URL(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。

developmentpythonbash
0
539
Missing Value RemoverA

缺失值删除工具。读取结构化表格或 JSONL 数据,删除包含缺失值的行或删除缺失比例过高的列;不负责缺失值填充。 当用户提到删除缺失值、删除空值行、删除空值列等需求时使用此skill。 适用于科研表格和结构化数据的缺失清理,不负责插值、补值、均值填充或其他修复操作。

datapythonbash
0
539
Mixture FormatterA

混合格式化器。该类通过从每个数据集中随机选择样本并合并它们来混合多个数据集,然后将合并的数据集导出为新的混合数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到混合数据集、合并多个数据集、数据集混合、数据融合等需求时使用此skill。

toolspythonbash
0
539
Mojibake RepairerA

乱码修复工具。自动检测并修复因编码错误解释导致的乱码文本(Mojibake),支持 GBK/UTF-8、Latin-1/UTF-8、 Big5、Shift_JIS 等 11 种编码链自动尝试,通过字符合理度评分自动选择最佳修复结果。 当用户提到乱码修复、编码修复、mojibake、文字乱码、编码错误等需求时使用此skill。

developmentpythonbash
0
539
Most Relevant Entities AggregatorA

最相关实体聚合工具。从文档中提取与给定实体最相关的指定类型实体,并按重要性排序。 当用户提到提取相关人物、查找相关实体、排序实体、分析实体关系、提取主要角色等需求时使用此skill。 即使用户没有明确说出"最相关实体",只要任务涉及从文档中分析并提取与目标相关的实体, 就应该使用此skill。

ai-agentspythonbash
0
539
Multiwfn SkillA

使用 Multiwfn 波函数分析程序读取 Gaussian 生成的 .fchk 文件,提取 HOMO/LUMO、原子电荷、分子表面分析等信息。

toolspythonbash
0
539
Naive GrouperA

将所有样本分组为一批样品。当用户提到样本合并、合并所有样本、一批分组、全部聚合等需求时使用此skill。 即使用户没有明确说出"合并",只要任务涉及将多个样本合并为单个批次,就应该使用此skill。

toolspythonbash
0
539
Naive Reverse GrouperA

将批处理的样本拆分为独立样本。当用户提到样本拆分、拆分批次、批处理展开、反向分组等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将批处理数据(字段值为数组)展开为独立样本,就应该使用此skill。

toolspythonbash
0
539
Nested AggregatorA

嵌套聚合工具。将多个文档碎片整合成一个连贯的文档总结。 当用户提到文档摘要、整合文档、文档聚合、碎片整合、长文总结等需求时使用此skill。 即使用户没有明确说出"嵌套"或"聚合",只要任务涉及将多个短文档整合成一个总结, 就应该使用此skill。

ai-agentspythonbash
0
539
Number Noise CleanerA

'无用数字字符清理工具。读取结构化文本数据,对指定或全部文本字段移除无语义的独立数字字符,输出清理后的结构化文件。

datapythonbash
0
539
Numeric Distribution CheckA

字段分布校验工具。读取结构化数据文件(CSV、TSV、Excel等),按模式检查数值字段统计特征或分类字段频率分布是否合理。 数值模式用于检查均值、标准差、中位数、分位数等统计量;分类模式用于检查类别数上限和单类占比是否异常。 当用户提到分布校验、统计特征验证、类别频率检查、类别倾斜检测等需求时使用此skill。 即使用户没有明确说出"分布校验",只要任务涉及验证字段整体分布是否偏移或失衡,就应该使用此skill。

developmentpythongo
0
539
Numeric Format CleanerA

'数值格式清洗工具。读取 JSONL 结构化数据,按字段规则统一单位、数值格式、范围和空值表达,输出规整后的 JSONL 和统计文件。

content-marketingpythonbash
0
539
OpenBabel SkillA

分子格式转换工具。支持在 .smi、.mol、.xyz、.gjf、.sdf 等格式之间转换,并可从 SMILES 或 2D 结构生成带坐标的 3D 结构。 当用户提到分子格式转换、3D构象生成、openbabel等需求时使用此skill。

toolspythonbash
0
539
Overlap Dam Select OperatorA

淤地坝候选叠加筛选算子。用户提到淤地坝识别、坝体候选筛选、叠加过滤时优先调用。

tools
0
539
Parquet FormatterA

Parquet格式化器。用于加载和格式化parquet类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到Parquet格式化、Parquet数据加载、读取Parquet文件、Parquet转JSONL等需求时使用此skill。

toolspythonbash
0
539
Pdf CreateA

从零创建PDF文件工具。使用reportlab库生成专业PDF文档,支持自定义页面大小、标题、作者、 以及通过JSON配置内容结构(标题、段落、表格等)。当用户需要生成PDF报告、文档时使用此skill。

toolspythonbash
0
539
Pdf CropA

裁剪PDF页面边距。通过指定边界坐标(left,bottom,right,top)来裁剪页面区域。当用户需要裁剪PDF页面时使用此skill。

toolspythonbash
0
539
Pdf MergeA

将多个PDF文件合并为一个PDF文件。当用户需要合并PDF文档时使用此skill。

toolspythonbash
0
539
Pdf Metadata ExtractA

提取PDF文件的元数据(标题、作者、主题、页数等),输出为JSON格式。当用户需要查看PDF文档信息时使用此skill。

toolspythonbash
0
539
Pdf Metadata Extract RestoredA

提取 PDF 文件元数据并输出 JSON 结果。 当用户提到把这次流程沉淀成 skill、保存为 skill等需求时使用此 skill。

developmentpythongo
0
539
Pdf Ocr Artifact CleanerA

PDF/OCR伪影清洗工具。修复从学术论文PDF提取文本时的常见问题:断行连字符拼接(dehyphenation)、 页码去除、Unicode连字归一化(fi→fi)、页眉页脚去除。 当用户提到PDF文本清洗、OCR伪影处理、断行修复、连字符拼接等需求时使用此skill。

developmentpythonbash
0
539
Pdf RotateA

旋转PDF页面方向。支持顺时针90度、180度、270度旋转。当用户需要旋转PDF页面方向时使用此skill。

toolspythonbash
0
539
Pdf SplitA

将PDF按指定页码范围拆分为独立的PDF文件。当用户需要拆分PDF文档时使用此skill。

toolspythonbash
0
539
Pdf Table ExtractA

从PDF文件中提取表格数据,输出为JSON格式。当用户需要从PDF中提取表格时使用此skill。

toolspythonbash
0
539
Pdf Text ExtractA

从PDF文件中提取文本内容,保存为txt文件。当用户需要从PDF中提取文字时使用此skill。

toolspythonbash
0
539
Perplexity FilterA

困惑度过滤器。过滤以保留困惑度分数小于特定最大值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到困惑度过滤、文本困惑度检测、语言模型分数过滤、文本质量过滤等需求时使用此skill。

toolspythonbash
0
539
Piflow Skill GeneratorA

PiFlow 技能生成器。当用户完成了一次完整并成功的数据处理任务时调用,根据当前 skills/generated 的本地约定和 references/piflow_skill_template.md 通用模板创建、更新或校验 PiFlow-compatible skill,包括 UTF-8 编码的 SKILL.md、DAG 可读的 input_params/output_params、version/tag 元数据、skill.json、scripts/references/assets 资源目录,以及本地校验脚本。仅在用户明确要求生成或保存 skill,或某次数据处理任务已经完成并需要把已验证成功的操作流程沉淀为 skill 时使用;默认不要因为“可能需要 skill”或“当前能力不足”而优先触发此 skill。

toolspythonshell
0
539
Pipeline AddA

将用户输入的整数加10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。

tools
0
539
Pipeline MinusA

将用户输入的整数减去5并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。

tools
0
539
Pipeline MultiplyA

将用户输入的数字乘以10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。

tools
0
539
Piflow Skill Generator PlannerA

PiFlow 技能生成器。当用户完成了一次完整并成功的数据处理任务时调用,根据当前 skills/generated 的本地约定和 references/piflow_skill_template.md 通用模板创建、更新或校验 PiFlow-compatible skill,包括 UTF-8 编码的 SKILL.md、DAG 可读的 input_params/output_params、version/tag 元数据、skill.json、scripts/references/assets 资源目录,以及本地校验脚本。仅在用户明确要求生成或保存 skill,或某次数据处理任务已经完成并需要把已验证成功的操作流程沉淀为 skill 时使用;默认不要因为“可能需要 skill”或“当前能力不足”而优先触发此 skill。

toolspythonshell
0
539