工程開發
evaluating-code-models avatar

evaluating-code-models

使用 BigCode Evaluation Harness 評估代碼生成模型。包含 HumanEval、MBPP 和 MultiPL-E 等基準測試,並提供多語言編碼模型的 pass@k 指標評估。

每日活動

最近 30 天的瀏覽與下載趨勢。

日期瀏覽下載
7月31日00
7月30日00
7月29日10
7月28日00
7月27日00
7月26日00
7月25日00
7月24日00
7月23日10
7月22日00
7月21日10
7月20日00
7月19日00
7月18日10
7月17日00
7月16日10
7月15日00
7月14日00
7月13日20
7月12日20
7月11日22
7月10日00
7月9日20
7月8日00
7月7日01
7月6日01
7月5日00
7月4日00
7月3日20
7月2日00