rasbt

local-coding-agent-evals

rasbt

暂无描述

AI 简介

这是一个面向本地部署编程智能体的轻量级评估工具集,用于系统性测试大语言模型及其配套编码代理框架在实际开发任务中的表现。项目包含三类评测:模型推理速度与内存占用基准、复杂工具调用推理能力测试、以及端到端编码代理任务执行验证(支持Ollama托管模型)。所有评测均在本地运行,不依赖云端API,强调可复现性与硬件感知。适用于开发者和研究人员对开源代码模型(如Qwen Code、Gemma等)及本地代理框架进行快速横向对比与性能调优。

Python
54
Stars
13
Forks
52
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+2
综合评分37.64
默认分支main