工程开发
evaluating-code-models avatar

evaluating-code-models

使用 BigCode Evaluation Harness 评估代码生成模型。涵盖 HumanEval、MBPP 和 MultiPL-E 等基准测试,提供多语言编码模型的 pass@k 指标评估。

每日活动

最近 30 天的浏览与下载趋势。

日期浏览下载
7月31日00
7月30日00
7月29日10
7月28日00
7月27日00
7月26日00
7月25日00
7月24日00
7月23日10
7月22日00
7月21日10
7月20日00
7月19日00
7月18日10
7月17日00
7月16日10
7月15日00
7月14日00
7月13日20
7月12日20
7月11日22
7月10日00
7月9日20
7月8日00
7月7日01
7月6日01
7月5日00
7月4日00
7月3日20
7月2日00