代码能力代码执行
LiveCodeBench 评测基准
实时编程竞赛题基准,持续更新,避免数据污染。
查看官方或原始资料评测方法与适用范围
LiveCodeBench是由UC Berkeley等机构提出的实时编程竞赛基准,旨在解决传统代码基准(如HumanEval)因发布时间长导致的数据污染问题。
评测方式
给定编程竞赛题目描述,要求模型生成完整可执行代码。通过运行竞赛平台的测试用例评估正确性,常用pass@1指标。基准按时间分块发布,确保评测时模型未在训练数据中见过相关题目。
数据规模与来源
题目来源于LeetCode、AtCoder、Codeforces等主流编程竞赛平台,持续更新。截至发布时已包含数百道题,覆盖算法、数据结构、动态规划、图论等各类竞赛题型,难度从Easy到Hard不等。
业界地位
LiveCodeBench是评估大模型代码生成能力的新兴标杆,特别受到关注的是其"时间分块"设计,能有效避免数据污染,提供更真实的模型能力评估。被DeepSeek、Qwen等模型团队广泛采用,是当前代码评测领域的重要参考。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。