1
HarmProfile: Characterizing Harmful Distributions in Frontier LLMs
系统刻画前沿大模型的有害行为分布,为安全评估提供更细致的量化视角。
arXiv:2608.14577v1 Announce Type: cross Abstract: Frontier large language models (LLMs) safety evaluation has largely treated harmful generation as an…