Vectorizing the Trie: Efficient Constrained Decoding for LLM-based Generative Retrieval on Accelerators
向量化Trie结构加速LLM约束解码,专为生成式检索设计,在GPU等加速器上实现高效推理。
arXiv:2602.22647v2 Announce Type: replace-cross Abstract: Generative retrieval has emerged as a powerful paradigm for LLM-based recommendation. Howeve…