1
UltraSketchLLM: Sub-1-Bit LLM Compression via Sketch and Hardware-Friendly Operators
突破性LLM压缩至低于1比特,结合草图算法与硬件友好算子,实现极致模型瘦身。
arXiv:2506.17255v2 Announce Type: replace-cross Abstract: Large language models (LLMs) require larger GPU memory size these days, necessitating effici…