本文へ移動
vast-cowのブログ
前のページへ戻る

LiteLLMでLLMの出力をキャッシュする方法

この記事を編集

LLMを使った開発では、同じプロンプトを何度も実行すると、そのたびに推論時間やAPIコストが発生します。

LiteLLMにはキャッシュ機能が用意されており、同一リクエストに対するLLMの出力を保存して再利用できます。ここでは、ディスクキャッシュを使う最小構成を紹介します。

まず、キャッシュとProxyに必要な依存関係をインストールします。

pip install 'litellm[caching,proxy]'

次に、LiteLLM Proxyの設定ファイルを作成します。

model_list:
  - model_name: model
    litellm_params:
      model: openai/Qwen/Qwen3.6-35B-A3B # example
      api_key: ...
      api_base: ...

litellm_settings:
  cache: true
  cache_params:
    type: disk
    disk_cache_dir: ./Qwen_Qwen3.6-35B-A3B

openai/Qwen/Qwen3.6-35B-A3B というように openai/ がありますが、これはOpenAI互換APIを使うことを示すために必要です。

ポイントは litellm_settings の設定です。

cache: true でキャッシュを有効化し、cache_params.type に disk を指定すると、LLMのレスポンスをローカルディスクに保存できます。

cache_params:
  type: disk
  disk_cache_dir: ./Qwen_Qwen3.6-35B-A3B

この例では、キャッシュデータは ./Qwen_Qwen3.6-35B-A3B ディレクトリに保存されます。

同じモデル・同じリクエストを再度送信した場合、キャッシュが利用できればLLMへの問い合わせを省略できるため、レスポンス時間の短縮やAPIコストの削減につながります。

特に、評価スクリプトやベンチマーク、開発中の繰り返しテストなど、同じ入力を何度も実行する用途では便利です。

LiteLLMを使っている場合は、まずディスクキャッシュから試してみると簡単です。


この記事を編集
この記事を共有:

コメント


前の記事
ChatGPTの「新しいチャット」を新規タブで開けるTampermonkeyスクリプト