測ってから選ぶ、ローカルLLM運用
社内検証基盤をもとに、評価前段(推論エンジン地図: vLLM/TRT-LLM/SGLang/Atlas・量子化・投機・性能/品質)から運用比較まで、シナリオ順に公開します。
記事を見る
Blog
推論エンジンや量子化などの評価前段から、性能・品質の測り方、ComfyUI学習まで。週3本(月・水・金に各1本)でシナリオ順に公開しています。
Latest
共有テンプレートと個別設定がぶつかったとき、どちらが効くかを見失わない設計を解説します。
ローカルLLM運用を、単発チューニングではなく改善ループとして回す方法を紹介します。
モデルを名前一覧ではなく、候補・試験中・安定の状態遷移で管理する方法を解説します。
オフラインで回せる自動採点の役割分担と、AI判定を後段に回す理由を解説します。
重いベンチの前に、業務で壊れやすい3点だけを素早く見る門番テストの設計です。
壊れていないかを先に見る短い確認から、用途ごとの問題セットへ進む品質評価の設計を解説します。
届くか確認してから単発、その後に同時実行へ進む手順と、平均だけでは足りない理由を解説します。
複数工程の分岐・並列・合流・人間承認を、観光FAQの流れで初心者向けに図解します。
目標・行動・観察・外部検証・停止条件を、失敗した単体テスト修正の例で図解します。
増え続けるAI設計用語を判断・実行・運用の3層に整理し、業務に合う最小構成を選ぶ地図を図解します。
下書きを先に作って速く見せる手法の考え方と、コーディング用途でどう測るかを整理します。
モデル圧縮を一語で済ませず、どこを粗くしたかを分けて記録・比較する地図を解説します。
モデルを届ける実行基盤の役割と、比較候補の特徴・向きを整理します。勝ち負けの数字はここでは出しません。
開発機での確認値と実機GPUの計測を混同しない読み方と、公開前のチェックを解説します。
同時に何人が使っても耐えるかを測るため、待ち時間・同時実行・処理量の見方を整理します。
速さだけでは採用できない理由と、性能と品質を同じ実験記録に残す評価の型を解説します。
YAMLに書かれたモデル名・メモリ枠・文脈長・パーサの見方を、具体例で解説します。
本番起動の前に生成コマンドを確認する習慣と、設計担当と実行担当を分ける考え方を解説します。
速さの数字より先に、条件と結果を後から辿れる記録の付け方を解説します。
「最強モデル」の宣言ではなく、会議で同じ物差しで比べるための型を公開する意図を整理します。
AI Series
社内検証基盤をもとに、評価前段(推論エンジン地図: vLLM/TRT-LLM/SGLang/Atlas・量子化・投機・性能/品質)から運用比較まで、シナリオ順に公開します。
AI Series
増え続けるAI設計用語を改めて整理し、初心者にもわかる図と具体Use Caseで理解を深めるシリーズ。ローカルLLM検証の本線とは別枠です。