Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
大模型推理不只看长度,新指标“深度思考令牌”精准衡量思考质量,刷新评估范式
arXiv:2602.13517v2 Announce Type: replace Abstract: Large language models (LLMs) have demonstrated impressive reasoning capabilities by scaling test-t…