dask

21.8k
davila7davila7

Parallel/distributed computing. Scale pandas/NumPy beyond memory, parallel DataFrames/Arrays, multi-file processing, task graphs, for larger-than-RAM datasets and parallel workflows.

193 days ago

pandas-pro

4.1k
JeffallanJeffallan

Use when working with pandas DataFrames, data cleaning, aggregation, merging, or time series analysis. Invoke for data manipulation, missing value handling, groupby operations, or performance optimization.

193 days ago

pdf

571
benchflow-aibenchflow-ai

ALWAYS use this skill instead of the Read tool for PDF files. The Read tool cannot extract PDF tables properly. Use this skill when: (1) Reading ANY PDF file, (2) Extracting tables from PDFs, (3) Converting PDF tables to pandas DataFrames, (4) Processing multi-page PDFs

193 days ago

displaying-streamlit-data

93
streamlitstreamlit

Displaying charts, dataframes, and metrics in Streamlit. Use when visualizing data, configuring dataframe columns, or adding sparklines to metrics. Covers native charts, Altair, and column configuration.

193 days ago

JSON Parser

46
datadrivenconstructiondatadrivenconstruction

Parse and validate JSON data from construction APIs, IoT sensors, and BIM exports. Transform nested JSON to flat DataFrames.

193 days ago

df-merger

46
datadrivenconstructiondatadrivenconstruction

Merge pandas DataFrames from multiple construction sources. Handle different schemas, keys, and data quality issues.

193 days ago

xml-reader

46
datadrivenconstructiondatadrivenconstruction

Read and parse XML from construction systems - P6 schedules, BSDD exports, IFC-XML, COBie-XML. Convert to pandas DataFrames.

193 days ago

ebfe_validate_models

43
gpt-cmdrgpt-cmdr

Validate organized eBFE/BLE model using ras-commander dataframes. Uses init_ras_project() then checks plan_df, boundary_df, rasmap_df to verify: - All plan files exist - All DSS files exist with relative paths - All terrain files exist with relative paths - All HDF results accessible - No absolute paths (would cause GUI popups) Use after organizing eBFE model to verify it's actually runnable. Generates validation report and script for user re-verification.

193 days ago

apache-spark-data-processing

40
manutejmanutej

Complete guide for Apache Spark data processing including RDDs, DataFrames, Spark SQL, streaming, MLlib, and production deployment

sparkbig-datadistributed-computing+3
193 days ago

data-profiler

27
majesticlabs-devmajesticlabs-dev

Generate data profiles with column statistics, correlations, and missing-data patterns for DataFrames. Use for EDA and data discovery.

193 days ago

microdf

21
PolicyEnginePolicyEngine

Weighted pandas DataFrames for survey microdata analysis - inequality, poverty, and distributional calculations

192 days ago

everyrow-sdk

17
futuresearchfuturesearch

Helps write Python code using the everyrow SDK for AI-powered data processing - transforming, deduping, merging, ranking, and screening dataframes with natural language instructions

192 days ago

pytd

13
treasure-datatreasure-data

Expert assistance for using pytd (Python SDK) to query and import data with Treasure Data. Use this skill when users need help with Python-based data analysis, querying Presto/Hive, importing pandas DataFrames, bulk data uploads, or integrating TD with Python analytical workflows.

193 days ago

pandas-ai

9
TerminalSkillsTerminalSkills

PandasAI enables natural language queries on pandas DataFrames using LLMs. Learn to ask questions in plain English, generate charts, clean data, and integrate with OpenAI and local models for conversational data analysis.

193 days ago

acsets-hatchery

7
plurigridplurigrid

Attributed C-Sets as algebraic databases. Category-theoretic data structures generalizing graphs and dataframes with Gay.jl color integration.

193 days ago

eda-basic

7
nmlemusnmlemus

Basic exploratory data analysis for pandas DataFrames

edaanalysispandas
193 days ago

pandas-pro

4
ngxtmngxtm

Use when working with pandas DataFrames, data cleaning, aggregation, merging, or time series analysis. Invoke for data manipulation, missing value handling, groupby operations, or performance optimization.

192 days ago

python-data-engineering

1
dtsongdtsong

Use this skill when writing Python code for data pipelines or transformations. Covers Polars, Pandas, PySpark DataFrames, dbt Python models, API extraction scripts, and data validation with Pydantic or Pandera. Common phrases: "Polars vs Pandas", "PySpark DataFrame", "validate this data", "Python extraction script". Do NOT use for SQL-based dbt models (use dbt-transforms) or integration architecture (use data-integration).

192 days ago

pandas

assadsharifassadsharif

Expert pandas data manipulation and analysis guidance. Generate DataFrame operations, data cleaning pipelines, I/O code, groupby aggregations, merge/join patterns, reshaping, time series analysis, and performance optimization. This skill should be used when users ask to work with DataFrames, clean data, merge datasets, aggregate data, read/write CSV/ Excel/Parquet/SQL, or optimize pandas code. Triggers on: "pandas", "dataframe", "csv", "data cleaning", "groupby", "merge dataframes", "pivot table", "read csv", "data analysis".

193 days ago

xml-reader

jdmorag97-rgbjdmorag97-rgb

Read and parse XML from construction systems - P6 schedules, BSDD exports, IFC-XML, COBie-XML. Convert to pandas DataFrames.

193 days ago

json-parser

jdmorag97-rgbjdmorag97-rgb

Parse and validate JSON data from construction APIs, IoT sensors, and BIM exports. Transform nested JSON to flat DataFrames.

193 days ago

df-merger

jdmorag97-rgbjdmorag97-rgb

Merge pandas DataFrames from multiple construction sources. Handle different schemas, keys, and data quality issues.

193 days ago

pandas-pro

ARazaAnjumARazaAnjum

Use when working with pandas DataFrames, data cleaning, aggregation, merging, or time series analysis. Invoke for data manipulation, missing value handling, groupby operations, or performance optimization.

192 days ago