正在生成式人工智能的利用场景中,若何让模子正在处理超长文本时既快又省,不竭是工程师们吞并的难题。近日,小红书手艺团队开源了其自主研发的 RedKnot 推理引擎,带来了一套针对长上下文任务的“降本删效”新计划。

RedKnot 的中心立同正在于突破了传统的 KV Cache(键值缓存)处理形式。以往,年夜模子正在推理过程中,缓存是按 token(词元)维度存储的,那招致正在处理长文本时,内存开销呈线性删加,极年夜地拖累了推理速度取并发才气。RedKnot 另辟路径,将 KV Cache 沿留神力头(Attention Head)维度截至拆解,并引入了“头分类浓密”、“浓密 FFN”以及“SegPagedAttention”三年夜机制,实现了算法逻辑取存储粒度的统一。

那一架构调解带来的机能汲引十分隐著。实测数据隐现,正在 8 卡 H800 的高机能计较情况下,RedKnot 能够将首字生成时间(TTFT)加快 1.6 倍至 3.54 倍,单卡并发才气更是汲引了 4.7 倍至 7.8 倍。正在预挖充阶段,计较本钱耗损(FLOPs)被削减了 67% 至 79.5%。以 DeepSeek-V4-Flash 模子正在 128K 超长上下文任务上的暗示为例,其首字生成速度汲引了 5.16 倍,KV 数据传输效率也劣化了 6.3 倍,且推理精度仍然稳健,贯勾通接正在浓密模子机能的 95% 以上。

业内专家认为,RedKnot 的开源为推理引擎的工程劣化供给了重要参考。正在算力成今日益紧缺的背景下,那种经由过程底层架构精细化拆解来缓解长文本推理负担的思绪,无疑为构建更轻量、更高效的 AI 推理系统斥地了新的手艺途径。今朝,相关代码已正式开源,旨正在鞭策长文本 AI 利用的普及取落地。
