
deep-swe
datacurve-ai
Measuring frontier coding agents on original, long-horizon engineering tasks
AI 简介
DeepSWE 是一个面向前沿编程智能体的软件工程能力基准测试框架,用于评估模型在真实、长周期开源工程任务上的表现。它包含 113 个跨 TypeScript/Go/Python/JavaScript/Rust 的任务,每个任务提供标准化元数据(task.toml)、自然语言指令、隔离 Docker 环境、程序化行为验证器(test.sh + test.patch)及参考解(仅供人工复核)。验证基于可观测行为而非代码结构,支持模型无关的沙箱化评测。适用于大模型编程能力研究、智能体开发与工程级代码生成系统的效果验证。
Python
1k
Stars
54
Forks
5
Watchers
42
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分18.22
默认分支main