ruc-datalab

CoDA-Bench

ruc-datalab

CoDA-Bench is a benchmark for code agents on data-intensive tasks. 🎈代码智能体能搞定数据密集型任务吗?

AI 简介

CoDA-Bench 是一个面向数据密集型任务的代码智能体(code agent)评测基准。它通过在真实 Linux 沙箱环境中提供包含近千个语义相近文件的 Kaggle 数据集,要求智能体自主发现相关数据、导航复杂目录结构、融合多源异构数据,并生成正确代码以回答自然语言问题。项目采用 Docker 容器化沙箱保障评估一致性,支持端到端自动化评测,强调数据发现、跨文件推理与实际分析能力。适用于评估 LLM 驱动的编程智能体在数据分析、数据工程及数据科学等真实场景下的综合能力。

Python
MIT License
42
Stars
0
Forks
51
Watchers
2
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分40
默认分支main