1
End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference
动态稀疏技术让LLM推理按资源自适应调整,端到端方案兼顾效率与质量,值得关注。
arXiv:2606.27743v1 Announce Type: cross Abstract: Large Language Models (LLMs) inference is typically deployed under a static resource assumption, whe…