data-cleaning-pipeline-generator
为 pandas/polars/PySpark 生成数据清洗管道,处理缺失值、重复项、异常值、类型转换及数据验证。
探索可复用的代理技能,查看实现细节,快速找到适合你工作流程的技能。
共找到 45 个技能
为 pandas/polars/PySpark 生成数据清洗管道,处理缺失值、重复项、异常值、类型转换及数据验证。
一套将实验性机器学习原型转换为稳健、可发布 Python 软件包的框架,采用 src 布局、混合架构与严谨的配置管理。
高性能文档智能库,可从 91 种以上文件格式中提取文本、表格、代码及元数据,支持 OCR 及 LLM 友好输出。
使用计算机视觉相似度嵌入技术,在 FiftyOne 数据集中查找、查看并移除重复或高度相似的图像。
使用 d3.js 创建交互式自定义数据可视化,包括图表、图形和网络图。适用于需要对视觉元素、转场动画和交互行为进行精细控制的场景。
使用自动化子代理程序抓取并汇总最新的 Posit 新闻、博客文章、播客、视频内容与活动公告。
将 PDF、Office 文档、图像、音频及网页内容转换为适合 LLM 与 RAG 系统的干净 Markdown 格式,支持 20 多种文件类型与自动化处理。
通过 MCP 将您的 AI 代理连接至 Hugging Face Hub。搜索模型、数据集与论文,管理存储库,执行云端计算任务,并将 Gradio Spaces 作为 AI 工具调用使用。
生成符合特定格式规范的 MATLAB 纯文本 Live Scripts (.m 文件),包含丰富的文字说明、数学方程式与可视化代码。
用于 LLM 后训练(SFT/DPO/RLHF)的高质量数据集策劃指南,涵盖数据格式、质量过滤与收集策略。
搜索并查询 TikHub 社交媒体 API,支持 TikTok、抖音、小红书、Instagram、YouTube 等平台,助您轻松获取跨平台数据。
提供论文复现的系统性方法论,支持数据清洗、统计验证、样本筛选及自动化产出学术复现报告(Markdown 与 LaTeX)。