ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions
突破传统二分类安全护栏,从输出分布中校准LLM风险概率,为AI安全提供量化新思路。
arXiv:2608.10621v1 Announce Type: new Abstract: Recent research on Large Language Model (LLM) safety has widely adopted guardrails to identify unsafe …