Hacker NewsHN投稿者: pptadversary
元記事公開:
llama.cppのプロンプト検索ドラフティングが高速化
原題: Faster prompt lookup drafting in llama.cpp
AI要約
llama.cppのn-gramキャッシュに対する4つの変更により、ドラフティング速度が最大41.6倍に向上し、メモリ使用量も削減された
重要ポイント
- •n-gramキャッシュへの4つの変更により、ドラフティング処理が最大41.6倍高速化された
- •静的キャッシュの読み込み速度が最大23.5倍向上した
- •ピークメモリ使用量が最大2.65倍低下した