従来のアテンションは読んだ全トークンの中間結果を保持する必要があり、文脈が長くなるほどKVキャッシュが比例して増え、GPUメモリを圧迫する。線形アテンションはその履歴を固定サイズの状態ひとつに圧縮し、長さに関係なく同じ容量で済むようにする。代わりに前方を正確に思い出す力が落ちるため、近年のモデルは全体を記憶する層と交互に積む構成を採る。