2024
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
EMNLP 2024system demonstrations
WalledEval is a comprehensive AI safety testing toolkit designed to evaluate large language models (LLMs). It accommodates a diverse range of models, including both open-weight and API-based ones, and features over 35 safety benchmarks covering areas such as multilingual safety, exaggerated safety,…