llm-threat-model

(★ 12)

An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks [ICML 2025]

llm-threat-model Latest Version Download

Download Latest Version (.zip)
// repository documentation