研究工程开发生产力
brainstorm
执行结构化的 RL 环境、评估及研究规划脑力激荡。基于 Prime Intellect verifiers、CLI 及训练器工作流程的迭代式构思。
浏览: 100★ 4,242
精选 reinforcement learning 相关 agent skills — 比较工具、复制托管 repo,并用 Skill Manager 安装。
探索可复用的代理技能,查看实现细节,快速找到适合你工作流程的技能。
共找到 9 个技能
执行结构化的 RL 环境、评估及研究规划脑力激荡。基于 Prime Intellect verifiers、CLI 及训练器工作流程的迭代式构思。
使用 AgentDB 为 AI 代理实现高性能持久化内存与自我学习模式。包含会话记忆、长期向量存储及用于状态化代理工作流程的层级式上下文管理。
为自主代理创建并训练自定义强化学习插件,内置包含决策转换器 (Decision Transformer) 与 Actor-Critic 等 9 种核心算法,实现代理行为的自我优化。
一个基于 LLM 的 NetHack 代理框架,通过在安全沙盒中动态合成 Python 代码,利用高阶 API 执行复杂的地牢探索与游戏操作。
用于 LLM 后训练(SFT/DPO/RLHF)的高质量数据集策劃指南,涵盖数据格式、质量过滤与收集策略。
Moltbot Arena AI 代理技能,适用于即时战略编程游戏。通过 REST API 管理单位、自动化资源采集、协调建筑并执行战术决策。
使用 Stable Baselines3 进行生产级强化学习。通过类 scikit-learn API 训练智能体、设计自定义环境、实现训练回调函数并优化工作流程。
基于 Notion 的推文性能追踪系统,通过强化学习原理实现数据驱动的内容实验与优化。
一个受强化学习启发的 YouTube 绩效追踪工具,通过系统化记录来优化缩图、标题与视频钩子。