data-cleaning-pipeline-generator
Generates data cleaning pipelines for pandas/polars/PySpark, handling missing values, duplicates, outliers, type conversions, and validation.
Discover reusable agent skills, browse implementation details, and find the right skill for your workflow.
45 skills found
Generates data cleaning pipelines for pandas/polars/PySpark, handling missing values, duplicates, outliers, type conversions, and validation.
A framework to transform experimental ML prototypes into robust, production-ready Python packages using src layout, hybrid architecture, and strict configuration management.
High-performance document intelligence library for extracting text, tables, code, and metadata from 91+ file formats, with OCR and LLM-ready output.
Find, review, and remove duplicate or near-duplicate images in FiftyOne datasets using computer vision similarity embeddings.
Create interactive, custom data visualizations using d3.js — including charts, graphs, and network diagrams. Ideal for when you need fine-grained control over visual elements, transitions, and interactions.
Fetch and aggregate the latest Posit news, blog posts, podcast episodes, video content, and event announcements using automated sub-agents.
Convert diverse file formats like PDFs, Office docs, images, audio, and web content into clean Markdown, specifically optimized for LLM ingestion, RAG pipelines, and automated text analysis workflows.
Connect your AI agent to the Hugging Face Hub via MCP. Search models, datasets, and papers, manage repos, run cloud compute jobs, and invoke Gradio Spaces as functional AI tools.
Generate professional MATLAB plain text Live Scripts (.m files) with rich text documentation, mathematical equations, and visualization code following specific formatting standards.
Guidelines for curating high-quality datasets for LLM post-training (SFT/DPO/RLHF), covering data formats, quality filtering, and collection strategies.
Search and query TikHub social media APIs for TikTok, Douyin, Xiaohongshu, Instagram, YouTube, and more to fetch cross-platform data.
Systematic methodology for reproducing published academic papers using provided data, including sample selection, statistical verification, and automated reporting.