代码能力代码执行
HumanEval 评测基准
Python函数编写基准,164个编程题,评估代码生成正确性。
查看官方或原始资料评测方法与适用范围
HumanEval是由OpenAI在发布Codex模型时提出的代码生成基准,用于评估大模型根据函数签名和文档字符串生成正确Python代码的能力。
评测方式
给定函数签名、文档字符串和少量示例,要求模型生成完整函数实现。通过执行预定义的单元测试用例(pass@k指标)评估代码正确性,常用pass@1、pass@10、pass@100等指标。
数据规模与来源
共164个手写编程题,覆盖基础算法、数据结构、字符串处理、数学计算等常见编程任务。每题配有3-8个测试用例,平均约7.7个。
业界地位
HumanEval是代码生成领域最经典、最广泛使用的基准之一,几乎所有代码大模型(Codex、Code Llama、StarCoder、DeepSeek-Coder等)发布时都会报告HumanEval成绩。它是衡量模型代码生成能力的"标配"指标,但因题目相对简单且数量有限,催生了HumanEval+、MBPP+等增强版本。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。