Engineering
evaluating-code-models avatar

evaluating-code-models

Evaluate code generation models using BigCode Evaluation Harness. Benchmarks include HumanEval, MBPP, and MultiPL-E with pass@k metrics for multi-language coding models.

Daily Activity

Views and downloads trend for the last 30 days.

DateViewsDownloads
Jul 3100
Jul 3000
Jul 2910
Jul 2800
Jul 2700
Jul 2600
Jul 2500
Jul 2400
Jul 2310
Jul 2200
Jul 2110
Jul 2000
Jul 1900
Jul 1810
Jul 1700
Jul 1610
Jul 1500
Jul 1400
Jul 1320
Jul 1220
Jul 1122
Jul 1000
Jul 920
Jul 800
Jul 701
Jul 601
Jul 500
Jul 400
Jul 320
Jul 200