工程開發資料分析自動化
advanced-evaluation
實作生產級別的 LLM-as-a-judge 模型評估管線,包含配對比較、直接評分、偏差緩解與評分標準生成。
瀏覽: 26★ 16,806
探索與 model evaluation 相關的 AI Agent 技能。在 Mentalok Skills Hub 瀏覽可安裝的 Claude Code 與自動化技能。
探索可重用的代理技能,查看實作細節,快速找到適合你工作流程的技能。
共找到 3 個技能
實作生產級別的 LLM-as-a-judge 模型評估管線,包含配對比較、直接評分、偏差緩解與評分標準生成。
透過 MCP 將您的 AI 代理連接至 Hugging Face Hub。搜尋模型、資料集與論文,管理儲存庫,執行雲端運算任務,並將 Gradio Spaces 作為 AI 工具呼叫使用。
使用 scikit-learn 進行經典機器學習。適用於分類、迴歸、分群、降維、資料預處理、模型評估,以及構建 Python 機器學習流程。