測ってから選ぶ、ローカルLLM運用
社内検証基盤をもとに、評価前段(推論エンジン地図: vLLM/TRT-LLM/SGLang/Atlas・量子化・投機・性能/品質)から運用比較まで、シナリオ順に公開します。
記事を見る
Blog
推論エンジンや量子化などの評価前段から、性能・品質の測り方、ComfyUI学習まで。週3本(月・水・金に各1本)でシナリオ順に公開しています。
Series
社内検証基盤をもとに、評価前段(推論エンジン地図: vLLM/TRT-LLM/SGLang/Atlas・量子化・投機・性能/品質)から運用比較まで、シナリオ順に公開します。
記事を見るLatest
開発機のモック計測と実機GPU計測を混同しないための読み方と、公開時のガードレールを解説します。
常駐マルチユーザ前提で、同時実行とスループットをどう測り、どう読むかを整理します。
throughputだけでは決めない。定量性能とタスク品質を同じrunに残す評価設計を解説します。
vLLMの起動プロファイル(YAML)の読み方を、Gemma4系のcoding-agent例で具体化します。モデル前提・ポート・メモリ枠・パーサの見方を整理します。
ローカルLLM運用では、実起動の前に生成される構成を確認する dry-run が安全弁になります。設計上の builder / executor 分離も合わせて解説します。
ローカルLLM検証でいちばん大切なのは結果の数字より、条件と結果を後から比較できる記録の型です。
モデル名の流行ではなく、再現可能な評価の型を公開する意図と、読者が最初に押さえるべき視点を整理します。
AI Series
社内検証基盤をもとに、評価前段(推論エンジン地図: vLLM/TRT-LLM/SGLang/Atlas・量子化・投機・性能/品質)から運用比較まで、シナリオ順に公開します。
公開日
ローカルLLM運用では、実起動の前に生成される構成を確認する dry-run が安全弁になります。設計上の builder / executor 分離も合わせて解説します。
公開日
vLLMの起動プロファイル(YAML)の読み方を、Gemma4系のcoding-agent例で具体化します。モデル前提・ポート・メモリ枠・パーサの見方を整理します。