Hacker NewsHN投稿者: pptadversary
元記事公開:

llama.cppのプロンプト検索ドラフティングが高速化

原題: Faster prompt lookup drafting in llama.cpp

AI要約

llama.cppのn-gramキャッシュに対する4つの変更により、ドラフティング速度が最大41.6倍に向上し、メモリ使用量も削減された

重要ポイント

  • •n-gramキャッシュへの4つの変更により、ドラフティング処理が最大41.6倍高速化された
  • •静的キャッシュの読み込み速度が最大23.5倍向上した
  • •ピークメモリ使用量が最大2.65倍低下した
もっと見る