llm-as-a-verifier

llm-as-a-verifier

llm-as-a-verifier

暂无描述

AI 简介

LLM-as-a-Verifier 是一个面向代码与终端任务的通用轨迹验证框架,通过细粒度评分、多轮重复验证和评价标准分解,提升对LLM生成行为(如程序执行轨迹)的可靠性评估能力。核心支持基于Gemini模型的logprob提取与结构化打分,可作为测试时扩展(test-time scaling)中的轨迹奖励模型,在Terminal-Bench 2和SWE-bench Verified基准上显著提升Pass@1指标。适用于需要高精度评估LLM自主执行效果的场景,如智能体(Agent)开发、代码生成验证及自动化评测流水线构建。

Python
414
Stars
40
Forks
367
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分38.84
默认分支main