
ProgramBench
facebookresearch
Can Language Models Rebuild Programs From Scratch?
AI 简介
ProgramBench 是一个面向程序逆向与重建能力评估的基准测试框架,用于系统性评测大语言模型从编译后二进制文件及配套文档中重新构建功能等价源代码的能力。其核心包含标准化测试集、自动化评估流水线(支持行为一致性验证与结构合理性评分)以及可扩展的任务定义接口,技术上强调黑盒逆向推理、多文件工程级生成与跨语言行为对齐。适用于AI代码能力研究、编程智能体评估、软件工程AI评测及逆向工程教学等场景。
Python
MIT License831
Stars
54
Forks
3
Watchers
6
Issues
Star 增长
今日0
近 7 天0
近 30 天+36
综合评分52.82
默认分支main