产品

SWE-Bench Pro

SWE-bench Pro

SWE-Bench Pro 是 AI 编程能力评测基准 SWE-Bench 的进阶版本。在真格基金戴雨森 2025 年底的一场对谈中,它被用来讨论当前 benchmark 的局限:Gemini 3 Pro 在该项评测中约 78 分,Opus 4.5 约 80 出头,分数差距仅 2-3 分,但实际用户体验的差异远大于此。

这一观察指向了行业正在追问的问题——当模型能力差距难以被现有 benchmark 捕捉时,如何建立更有效的评估体系来衡量 pre-training 与 post-training 的真实进展。elsewhere 暂未覆盖 SWE-Bench Pro 本身的详细技术规格或发布背景。

由 AI 生成,可能出现错误,请仔细核对内容。

SWE-Bench Pro产品
SWE-bench Pro
暂无关系图谱
在 4 篇文章中被提及

相关报道