首页 > AI > 7X24小时AI快讯> 正文

字节Seed团队揭开大模型长文本性能波动核心谜团

佚名 整合编辑:太平洋科技 发布于:2026-10-09 09:08
由华为云驱动

近日,字节跳动旗下Seed团队发布最新研究,揭开了大模型长文本处理随机“抽风”的谜团:核心诱因是分块KV缓存压缩带来的相位敏感性问题,部分主流开源大模型长文本检索准确率落差最高达40%。该结论推翻传统长文本模型评估逻辑,为行业优化指明了明确方向。

字节跳动旗下Seed团队发布最新研究论文,找到了大语言模型处理超长文本时性能随机波动的核心诱因。实验数据显示,部分主流开源大模型受该问题影响,长文本检索准确率的最大落差可达40个百分点。这背后的核心原因是分块KV缓存压缩技术引入的“相位敏感性”——也就是Token相对压缩窗口边界的位置坐标干扰了模型输出。

技术上该结论直接推翻了传统平均基准测试的评估逻辑,给后续长上下文推理稳定性优化提供了明确的理论锚点,相当于直接给所有长文本大模型的优化指明了破局方向。

佚名

甄选好物

手机 笔记本 影像 硬件 家居 商用 企业 出行 未来
二维码 回到顶部