SantanderAI

autoguardrails

SantanderAI

Alignment-research scaffold (autoresearch-style) for LLM guardrails: search over a single policy.md surface

AI 简介

autoguardrails 是一个面向大语言模型(LLM)安全对齐的研究型工具库,旨在通过自动化搜索优化文本策略文件(policy.md)来降低对抗攻击成功率(ASR),同时保障正常请求通过率。其核心采用 autoresearch 风格的轻量级可变表面设计,固定评估套件、裁判提示与运行时预算,以 ASR 为主指标、良性通过率为约束条件进行迭代优化。适用于 LLM 安全防护策略调优、红队测试反馈闭环、内容审核规则自动化演进等 AI 安全研究与工程场景。

Python
Apache License 2.0
128
Stars
35
Forks
5
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+5
综合评分45.17
默认分支main