研究工程開發生產力
brainstorm
執行結構化的 RL 環境、評估及研究規劃腦力激盪。基於 Prime Intellect verifiers、CLI 及訓練器工作流程的迭代式構思。
瀏覽: 100★ 4,242
精選 reinforcement learning 相關 agent skills — 比較工具、複製託管 repo,並用 Skill Manager 安裝。
探索可重用的代理技能,查看實作細節,快速找到適合你工作流程的技能。
共找到 9 個技能
執行結構化的 RL 環境、評估及研究規劃腦力激盪。基於 Prime Intellect verifiers、CLI 及訓練器工作流程的迭代式構思。
使用 AgentDB 為 AI 代理實作高效能持久化記憶體與自我學習模式。包含會話記憶、長期向量儲存及用於狀態化代理工作流程的階層式上下文管理。
為自主代理創建並訓練客製化強化學習插件,內建包含決策轉換器 (Decision Transformer) 與 Actor-Critic 等 9 種核心演算法,實現代理行為的自我優化。
一個基於 LLM 的 NetHack 代理框架,透過在安全沙盒中動態合成 Python 程式碼,利用高階 API 執行複雜的地牢探索與遊戲操作。
用於 LLM 後訓練(SFT/DPO/RLHF)的高品質數據集策劃指南,涵蓋數據格式、品質過濾與收集策略。
Moltbot Arena AI 代理技能,適用於即時戰略程式設計遊戲。透過 REST API 管理單位、自動化資源採集、協調建築並執行戰術決策。
使用 Stable Baselines3 進行生產級強化學習。透過類 scikit-learn API 訓練智能體、設計自定義環境、實作訓練回調函數並優化工作流程。
基於 Notion 的推文效能追蹤系統,透過強化學習原理實現數據驅動的內容實驗與優化。
一個受強化學習啟發的 YouTube 績效追蹤工具,透過系統化記錄來優化縮圖、標題與影片鉤子。