1
NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
稀疏大模型推理新突破,用Delta预取打通存储瓶颈,并行计算场景提效显著
arXiv:2608.22643v1 Announce Type: cross Abstract: Deploying large language models on edge devices is increasingly limited by a widening gap between mo…