工程开发数据分析自动化
advanced-evaluation
实现生产级别的 LLM-as-a-judge 模型评估流水线,包含配对比较、直接评分、偏差缓解与评分标准生成。
浏览: 26★ 16,806
探索与 model evaluation 相关的 AI Agent 技能。在 Mentalok Skills Hub 浏览可安装的 Claude Code 与自动化技能。
探索可复用的代理技能,查看实现细节,快速找到适合你工作流程的技能。
共找到 3 个技能
实现生产级别的 LLM-as-a-judge 模型评估流水线,包含配对比较、直接评分、偏差缓解与评分标准生成。
通过 MCP 将您的 AI 代理连接至 Hugging Face Hub。搜索模型、数据集与论文,管理存储库,执行云端计算任务,并将 Gradio Spaces 作为 AI 工具调用使用。
使用 scikit-learn 进行经典机器学习。适用于分类、回归、聚类、降维、数据预处理、模型评估,以及构建 Python 机器学习流程。