data-cleaning-pipeline-generator
为 pandas/polars/PySpark 生成数据清洗管道,处理缺失值、重复项、异常值、类型转换及数据验证。
探索可复用的代理技能,查看实现细节,快速找到适合你工作流程的技能。
共找到 25 个技能
为 pandas/polars/PySpark 生成数据清洗管道,处理缺失值、重复项、异常值、类型转换及数据验证。
一套将实验性机器学习原型转换为稳健、可发布 Python 软件包的框架,采用 src 布局、混合架构与严谨的配置管理。
fp-ts 的 pipe 与 flow 快速参考。用于串接函数、组合操作,或在函数式 TypeScript 代码中建立干净且易读的数据管道。
管理 SignalRoom 营销平台的 dlt 数据管道与 Temporal 工作流。支持同步 Everflow、Redtrack 与 S3 数据至 Postgres,并执行状态检查与调试。
世界级资深数据工程技能,用于构建可扩展的数据管道、ETL/ELT 系统及现代化数据基础设施,精通 Python、Spark、dbt 与 Kafka。
下载 YouTube 视频并自定义质量与格式。支持多种分辨率(360p-1080p)、常用容器格式(mp4, webm, mkv)及 MP3 音频提取。
探索并配置 Redpanda Connect 组件(如输入、输出、处理器),以构建高效的流式数据管道。
使用 Great Expectations、dbt 测试与数据契约实现生产级数据质量验证,确保数据管道的可靠性。
PyTorch Lightning 深度学习框架技能:自动化模型训练、多 GPU 编排、数据管道以及 DDP、FSDP 和 DeepSpeed 等分布式训练策略。
在 Obsidian 中创建、编辑与管理 JSON Canvas (.canvas) 文件,用于可视化笔记、思维导图与流程图。
在 OpenClaw 中使用 OpenAI Whisper API 将音频文件直接转换为文字。
通过此音频分析 CLI 工具,直接在终端中生成频谱图与高级音频特征可视化。