キャッシュ・バッチ・モデル選択の 3 つで、同じ処理の請求が一桁変わります。プロンプトキャッシュの読み出しは入力料金の約 0.1 倍、急がない処理はバッチ API で 50% 引き。2026年8月16日時点の公式ドキュメントの料金で、どこから削るかを整理しました。
LLM APIのコストを抑える実践テクニック
キャッシュ・バッチ・モデル選択の 3 つで、同じ処理の請求が一桁変わります。プロンプトキャッシュの読み出しは入力料金の約 0.1 倍、急がない処理はバッチ API で 50% 引き。2026年8月16日時点の公式ドキュメントの料金で、どこから削るかを整理しました。
VPS に置けるが、Debian 12 では pip の段階で止まる。MCP サーバーは常駐プロセスなので VPS と相性がよく、メモリ 958MB の小さな箱でも動きます。ただし Debian 12 では最初の pip install で止まります。
普通の VPS では動かない。GPU は「借りっぱなし」ではなく秒課金で使う。Stable Diffusion のような画像生成は GPU(VRAM)がほぼ必須で、月額数百円の一般的な VPS では動きません。
日次サマリはバッチ API で半額になる。cron の落とし穴は 3 つ。1 日 1 回のサマリ生成は即答が要らない処理なので、通常の API ではなくバッチ API に回すだけで料金が 50% 引きになります。コードの変更もほとんど要りません。
既存の OpenAI クライアントはほぼ動く。ただし落ちる機能がはっきり決まっている。Ollama は http://localhost:11434/v1/ に OpenAI 互換のエンドポイントを持っているので、ベース URL を差し替えるだけで既存のクライアントライブラリがそのまま動きます。
メモリ 1GB の VPS で載るのは tiny と base だけ。文字起こしは画像生成と違って CPU だけでも動きます。GPU が無い一般的な VPS でも成立する数少ない用途です。ただしモデルサイズがメモリで決まります。
本当のコストは pgvector ではなく「2 つ目の DB を建てること」。pgvector 自体は PostgreSQL の拡張なので、導入そのものは難しくありません。効いてくるのは、Web サイト用の VPS にはたいてい PostgreSQL が入っていないという点です。
AI に投げる前に集計する。7 日分 157 件のエラーは、実際に見るべき 9 件まで減った。サーバーのログを AI に読ませるとき、生ログをそのまま貼るのがいちばん効率が悪いです。手元の VPS で直近 7 日間のエラーを数えたら 157 件ありました。
OpenAI APIをPHPから使う場面は思った以上に多い。簡単な要約ツール、チャットボット、コード補完ヘルパーなど、PHPバックエンドにサクッと組み込みたい時のために、最小限のサンプルコードをまとめた。 APIキーの取…
クラウド型のLLMサービスを使わずに、自前のVPSでLLMを動かしたい——そういうニーズが最近急に増えてきた。プライバシー面の懸念を避けたい、APIコストを削りたい、レスポンスを制御したい、理由はさまざまだが、Ollam…