字节 Seed 团队发现 DeepSeek-V4 时强时弱的原因:Token 站位效应

大模型之家讯 10月9日,字节Seed团队公开研究结果,揭示了DeepSeek-V4系列模型表现忽好忽差的根本原因——分块KV Cache压缩技术导致的”Token站位效应”。研究团队在128K长上下文检索测试中发现,同一条信息仅改变在输入中的位置,DeepSeek-V4系列模型的检索准确率最高就能拉开40.2个百分点。同一道题什么都没改,只在前面多塞几个无关紧要的字符,模型突然就不会了;而且不是偶尔抽风,模型表现会随信息输入位置每隔4个Token周期性变化。该问题与DeepSeek-V4采用的一项长上下文优化技术——分块KV Cache压缩有关,这项技术本是为了让模型处理长文本更省内存、更高效,结果压缩之后倒让模型时神时鬼了。

上一篇:

下一篇:

发表回复

登录后才能评论