data-cleaning-pipeline-generator
為 pandas/polars/PySpark 生成數據清洗管道,處理缺失值、重複項、異常值、類型轉換及數據驗證。
探索可重用的代理技能,查看實作細節,快速找到適合你工作流程的技能。
共找到 45 個技能
為 pandas/polars/PySpark 生成數據清洗管道,處理缺失值、重複項、異常值、類型轉換及數據驗證。
一套將實驗性機器學習原型轉換為穩健、可發佈的 Python 套件之框架,採用 src 配置、混合架構與嚴謹的設定管理。
高效能文件智慧程式庫,可從 91 種以上檔案格式中提取文字、表格、程式碼與後設資料,並支援 OCR 與 LLM 格式輸出。
使用電腦視覺相似度嵌入技術,在 FiftyOne 資料集中尋找、檢視並移除重複或高度相似的圖像。
使用 d3.js 建立互動式自訂資料視覺化,包含圖表、圖形與網路拓樸。適用於需要精細控制視覺元素、轉場動畫與互動行為的場景。
使用自動化子代理程式抓取並彙整最新的 Posit 新聞、部落格文章、Podcast、影片內容與活動公告。
將 PDF、Office 文件、圖片、音訊及網頁內容轉換為適合 LLM 與 RAG 系統的乾淨 Markdown 格式,支援 20 多種檔案類型與自動化處理。
透過 MCP 將您的 AI 代理連接至 Hugging Face Hub。搜尋模型、資料集與論文,管理儲存庫,執行雲端運算任務,並將 Gradio Spaces 作為 AI 工具呼叫使用。
生成符合特定格式規範的 MATLAB 純文字 Live Scripts (.m 檔案),包含豐富的文字說明、數學方程式與視覺化程式碼。
用於 LLM 後訓練(SFT/DPO/RLHF)的高品質數據集策劃指南,涵蓋數據格式、品質過濾與收集策略。
搜尋並查詢 TikHub 社群媒體 API,支援 TikTok、抖音、小紅書、Instagram、YouTube 等平台,協助您獲取跨平台數據。
提供論文復現的系統性方法論,支援數據清理、統計驗證、樣本篩選及自動化產出學術復現報告(Markdown 與 LaTeX)。