All authors
cas-bigdatalab avatar

Claude Skills by cas-bigdatalab

github.com/cas-bigdatalab
204 skillsA× 203B× 10 installs32 views
Privacy Token RemoverA

'隐私标识移除工具。读取结构化文本数据,按用户选择的类别删除或替换邮箱、IPv4 地址、电话号码等文本中的隐私标识。

datapythonbash
0
539
Punctuation NormalizerA

文本标点规范化工具。只处理标点本身:合并重复标点、统一中英文标点与引号样式、规范省略号和标点周围空格。 当用户提到标点规范化、标点清理、合并重复标点、全半角转换等需求时使用此skill。 适用于科研文本中标点混乱、重复符号过多的场景,不负责 HTML、表情、数字或拼写清理。

toolspythonbash
0
539
Quality Flag Field CheckA

质量标识字段检测工具。检查数据表是否配置质量标识字段,验证标识字段的存在性、值规范性 (是否为预定义合法值)、非空完整性,标记不合格数据。 当用户提到质量标识检查、QC字段检测、标识字段合规等需求时使用此skill。

toolspythonbash
0
539
Random SamplerA

'JSONL 随机采样工具。读取 JSONL 数据集,按抽样数量或抽样比例无放回抽取样本,输出保留原字段结构的采样结果。

toolspythonbash
0
539
Random SelectorA

从CSV数据集中随机抽取样本。支持按比例(0-1)或固定数量抽取,当两者同时提供时取较小值。

toolspythonshell
0
539
Ray Document DeduplicatorA

Ray分布式文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本,基于Ray分布式框架。 当用户提到文档去重、删除重复文档、样本去重、分布式去重、大规模数据去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模文档去重处理, 就应该使用此skill。

developmentpythonbash
0
539
Ray Image DeduplicatorA

Ray分布式图像去重工具。使用图像哈希精确匹配在文档级别删除重复样本,基于Ray分布式框架。 当用户提到图像去重、删除重复图片、分布式去重、大规模图像去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模图像去重处理, 就应该使用此skill。

developmentpythonbash
0
539
Ray Video DeduplicatorA

Ray分布式视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频,基于Ray分布式框架。 当用户提到视频去重、删除重复视频、分布式去重、大规模视频去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模视频去重处理, 就应该使用此skill。

developmentpythonbash
0
539
Read File And AddA

add all numbers in a text file by 10 and save to a new file. Use when user mentions read a file add numbers by 10, process number file, batch calculation.

businesspython
0
539
Read File And MinusA

Minus all numbers in a text file by 5 and save to a new file. Use when user mentions read a file minus numbers by 15, process number file, batch calculation.

businesspython
0
539
Read File And MultiplyA

Multiply all numbers in a text file by 10 and save to a new file. Use when user mentions multiply numbers by 10, process number file, batch calculation.

businesspython
0
539
Referential Integrity CheckA

'引用完整性校验工具。读取子表及参考表,检查外键值是否存在于参考键集合中,标记孤立记录行并输出结果文件。

documentationpythonbash
0
539
Remote FormatterA

远程格式化器。用于从huggingface hub的存储库加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载HuggingFace数据集、远程数据集加载、HuggingFace Hub等需求时使用此skill。

toolspythonbash
0
539
Result Storage OperatorA

分析结果落盘算子。用户提到结果保存、导出CSV、结果存储时调用。

tools
0
539
Schema ValidatorA

'显式 schema 校验工具。读取结构化数据与用户提供的 schema,检查字段存在性、字段类型、枚举、范围、长度、正则格式、日期格式、表级行数与缺失率约束,并输出校验报告。

toolspythonbash
0
539
Scichem NormalizerA

科学公式/化学式规整 Skill:统一文本列中的数学符号、Unicode 上下标、化学反应箭头、全角 ASCII 和多余空格。 适用于实验记录、论文摘录、化学反应式和科学公式文本;不负责公式语义解析、单位换算或化学配平。

developmentpythonbash
0
539
Scsio IdentifyA

用于识别海洋生物的技能。当用户希望识别海洋生物、上传图片识别图中海洋生物等情况时触发。

toolspythonbash
0
539
Slack Gif CreatorA

Knowledge and utilities for creating animated GIFs optimized for Slack. Provides constraints, validation tools, and animation concepts. Use when users request animated GIFs for Slack like "make me a GIF of X doing Y for Slack."

toolspythongo
0
539
Smart Quote NormalizerA

智能引号/排版字符规范化工具。将弯引号、长破折号、省略号等排版字符转为标准 ASCII 形式, 适配 Word/PDF/网页文本的后处理清洗。当用户提到智能引号、弯引号转直引号、排版字符规范化、 长破折号等需求时使用此skill。

toolspythonbash
0
539
Special Characters FilterA

特殊字符过滤器。过滤器将具有特殊字符比率的样品保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到特殊字符过滤、特殊字符比例过滤、文本特殊字符检测、清理乱码文本等需求时使用此skill。

toolspythonbash
0
539
Specified Field FilterA

指定字段过滤器。根据指定的字段信息进行筛选。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到字段过滤、字段值筛选、元数据过滤、指定字段过滤、按字段值过滤等需求时使用此skill。

toolspythonbash
0
539
Specified Numeric Field FilterA

指定数值字段过滤器。根据指定的数值字段信息进行筛选。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到数值字段过滤、字段范围筛选、数值范围过滤、元数据数值过滤、按数值过滤等需求时使用此skill。

toolspythonbash
0
539
Spelling Variant NormalizerA

拼写变体标准化工具。统一英美拼写差异(colour→color、analyse→analyze 等),内置 153 词条 (含屈折形式 covered/covering 等),支持自定义词典扩展。当用户提到英美拼写统一、拼写变体、 British/American spelling 等需求时使用此skill。

toolspythonbash
0
539
Stacked Symbol CleanerA

'堆叠符号清洗工具。去除纯符号装饰行/分隔线(====、****、

toolspythonbash
0
539
Statistical Outlier DetectorA

'统计与机器学习异常值检测工具。读取结构化表格数据,使用 IQR、Z-score、IsolationForest 或分组标准差一致性方法识别异常值,输出带异常标记、删除异常行或裁剪异常值后的结果文件。

datapythonbash
0
539
Stopwords FilterA

停用词过滤器。过滤以保持停止词比率大于特定最小值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到停用词过滤、停用词比例过滤、文本质量过滤、停用词占比检测等需求时使用此skill。

toolspythonbash
0
539
Stratified SamplerA

'结构化数据分层采样工具。读取 JSONL、JSON、CSV、TSV、XLSX、XLS 等结构化数据,按指定字段分层后无放回抽取样本,输出保留原字段结构的采样结果。

datapythongo
0
539
Suffix FilterA

后缀过滤器。过滤器以保留具有指定后缀的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到后缀过滤、文件类型过滤、按文件后缀筛选等需求时使用此skill。

toolspythonbash
0
539
Systematic SamplerA

'系统采样算子。按照固定间隔从数据中进行系统采样,适用于时间序列数据或需要均匀分布样本的场景。

toolspythonbash
0
539
Tab Space NormalizerA

'Tab/空格规范化工具。读取结构化数据文件,执行制表符展开、行尾空格清理与可选公共缩进去除,输出空白已统一的结构化数据文件。

toolspythonbash
0
539
Table CollectorA

表格文件采集工具。读取单个表格文件或目录中的 csv、tsv、xlsx、xls 文件,执行行记录采集,输出统一结构化表格记录文件。 当用户提到表格采集、读取科研数据表、汇总 CSV/TSV/Excel 表格、把本地表格文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"表格采集",只要任务涉及把本地结构化表格文件内容收集成统一记录,就应该使用此 skill。 不负责表格清洗、空行删除、字段去空格、格式校验、字段过滤或格式转换。

developmentpythonbash
0
539
Table Schema Structure CheckA

格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。

developmentpythonbash
0
539
Text Action FilterA

文本动作词过滤器。过滤以保留文本中包含操作的文本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到动作词过滤、动词检测、文本动作过滤、文本操作词过滤等需求时使用此skill。

toolspythonbash
0
539
Text CollectorA

纯文本文件采集工具。读取单个文本文件或目录中的 txt、md、rst、log、text 文件,执行文件正文采集,输出结构化文本记录文件。 当用户提到文本文件采集、读取纯文本语料、汇总 Markdown/RST/日志文本、把本地文本文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"文本采集",只要任务涉及把本地纯文本文件内容收集成统一记录,就应该使用此 skill。 不负责文档解析、图片解析、表格读取、文本清洗或质量过滤。

developmentpythonbash
0
539
Text Entity Dependency FilterA

文本实体依赖过滤器。识别文本中与其他令牌独立的实体,并对其进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到实体依赖过滤、文本实体检测、依存关系过滤、实体独立性过滤等需求时使用此skill。

toolspythonbash
0
539
Text Fragment RemoverA

指定文本片段删除工具。读取结构化数据中的文本字段,删除用户显式给出的固定片段并保留其他字段不变。 当用户提到删除固定词、固定占位符、固定水印短语、固定噪声片段等需求时使用此skill。 即使用户没有明确说出 skill 名,只要任务是按明确片段从文本字段中移除内容,就应该使用此skill。 不负责按类别自动识别 HTML、URL、emoji、数字、标点、控制字符等内容,这些应交给专用清洗 skill。

datapythonbash
0
539
Text Pair Similarity FilterA

文本对相似度过滤器。过滤器将文本之间具有相似性的文本对保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到文本对相似度过滤、文本对过滤、双文本相似度、文本配对过滤等需求时使用此skill。

toolspythonbash
0
539
Text SplitterA

'长文本规则切分工具。将超长文本按照段落、句子、固定字符长度、非空行或科研论文章节标题进行自动切分,生成粒度均匀的短文本片段。

researchpythonbash
0
539
Time Anomaly MarkerA

时序/数值异常标记工具。对指定或全部数值列进行 Z-Score 异常和差分突变检测, 输出 anomaly_flag 与 anomaly_reasons,不删除数据,适用于时序稳态/突变异常识别。

toolspythonbash
0
539
Time Currency NormalizerA

'时间/货币归一工具。读取结构化文本数据,将常见日期格式统一为YYYY-MM-DD,将$、€、¥/¥前缀金额转换为USD/EUR/CNY数值表达。

datapythonbash
0
539
Time Gradual Change CheckA

时序平缓性检测工具。检测时序数据是否符合渐变规律,包括突变跳点检测(相邻点变化超阈值) 和方向振荡检测(窗口内反复升降),对应功能说明(八)模块中的平缓性检测维度。 当用户提到时序平缓性、渐变规律、突变跳点、方向振荡等需求时使用此skill。

toolspythonbash
0
539
Time Window SamplerA

'时间窗口采样算子。读取JSONL时间序列记录,按指定时间窗口分组后在每个窗口内均匀抽取样本。

toolspythonbash
0
539
Token Num FilterA

Token数量过滤器。筛选器将总令牌数的样本保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到token数量过滤、文本token数筛选、按token数过滤、文本分词过滤等需求时使用此skill。

toolspythonbash
0
539
Tsv FormatterA

TSV格式化器。用于加载和格式化tsv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到TSV格式化、TSV数据加载、读取TSV文件、TSV转JSONL等需求时使用此skill。

toolspythonbash
0
539
Unique Constraint CheckA

唯一性约束校验工具。检查指定字段的值是否在全表中唯一,标记重复出现的值所在行 (保留首次出现),支持空值跳过。当用户提到唯一性检查、重复值检测、主键约束等需求时使用此skill。

toolspythonbash
0
539
V1 FormatConsistencyA

格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。

developmentpythonbash
0
539
V9 MarkFieldCheckA

标识符字段检查工具。读取结构化数据文件,检查是否存在指定的质量标识符字段(默认为QC0000), 如果不存在则添加该字段,最后输出为相同格式的文件。当用户提到标识符字段检查、添加质量标识符、QC字段检查等需求时使用此skill。 即使用户没有明确说出"标识符字段",只要任务涉及检查或添加质量标识符字段,就应该使用此skill。

developmentpythonbash
0
539
Video DeduplicatorA

视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频样本。 当用户提到视频去重、删除重复视频、清理重复视频等需求时使用此skill。 即使用户没有明确说出"视频去重",只要任务涉及从包含视频的数据中删除重复视频, 就应该使用此skill。

toolspythonbash
0
539
Weighted SamplerA

加权采样算子。读取JSONL记录,按数值型权重字段执行随机采样,支持有放回和无放回两种模式。当用户提到加权抽样、按权重抽样、优先级采样、重要性重采样等需求时使用此skill。即使用户没有明确说出“加权采样”,只要任务涉及按记录权重选择样本,就应该使用此skill。不负责按类别分层均衡、普通随机采样或文本内容过滤。

toolspythonbash
0
539
Word Repetition FilterA

单词重复比例过滤器。过滤器将单词级n-gram重复比率的样本保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到单词重复过滤、文本重复比例过滤、n-gram重复过滤、清理重复内容等需求时使用此skill。

toolspythonbash
0
539