Cloudflare 为 1.1.1.1 瘦身:不换硬件省下 100TB 内存,DNS 查询延迟降低 19%
IT之家 8 月 29 日消息,Cloudflare 昨日发布博客,称其通过对旗下 Big Pineapple 平台的 DNS 缓存数据结构进行优化,成功释放了约 100 TB 的内存(RAM)资源。 Big Pineapple 是 Cloudflare 旗下支撑 1.1.1.1、Gateway D…
IT之家 8 月 29 日消息,Cloudflare 昨日发布博客,称其通过对旗下 Big Pineapple 平台的 DNS 缓存数据结构进行优化,成功释放了约 100 TB 的内存(RAM)资源。 Big Pineapple 是 Cloudflare 旗下支撑 1.1.1.1、Gateway D…
针对大模型CoT推理中“过度思考”的冗余步骤,用最优停止策略动态剪枝,降本增效不丢精度。
arXiv:2607.11089v1 Announce Type: new Abstract: Large Language Models (LLMs) have achieved remarkable success in complex reasoning tasks through Chain…
OpenAI实时AI模型延迟降低25%,价格更新,专注低延迟语音与多模态交互。
IT之家 7 月 8 日消息,OpenAI 昨日(7 月 7 日)发布公告,宣布在其 API 调用中,新增 gpt-realtime-2.1 和 gpt-realtime-2.1-mini 两款模型,官 方表示 p95 延迟至少下降 25%。 IT之家注:p95 延迟(Percentile 95 D…
开源语义缓存神器,91-96%命中率,集群token消耗直降76%,延迟减少98.6%!
Article URL: https://github.com/insightitsGit/prismlib Comments URL: https://news.ycombinator.com/item?id=48693843 Points: 2 # Comments: 0
腾讯混元提出Stem稀疏注意力算法,从因果信息流革新块稀疏,首字延迟降低3.6倍,已被ICML-26收录。
IT之家 6 月 5 日消息,腾讯混元今日宣布提出 Stem 稀疏注意力算法,已被机器学习顶会 ICML-26 收录。 官方表示,Stem 稀疏注意力算法从“因果信息流”重新审视块级稀疏,用 Token 位置衰减(TPD)和输出感知度量(OAM)两大创新, 仅用 25% 算力就逼近稠密注意力的精度 …
谷歌实时音乐AI模型MRT2本地运行,延迟骤降至1/15,支持即兴合奏,大小两种规模可选。
IT之家 6 月 5 日消息, 谷歌 Magenta 团队昨日(6 月 4 日)发布 Magenta RealTime 2(MRT2)模型 ,并同步免费放出乐器应用 Jam 以及 DAW 插件 MRT2。 MRT2 定位是可与用户“即兴合奏”的本地实时音乐模型,共有 2 种规模,其一是高质量模型 m…