推論サーバーを選ぶ
同じモデル・同じGPUでも、推論エンジンの実装でスループットは数倍変わる。Continuous BatchingとPagedAttentionが何を解いているのかを計算で確かめ、Ollama・vLLM・SGLangから要件で選ぶ。
連載・単発記事をまとめて、公開日の新しい順に並べた一覧です。どのカテゴリの記事がいつ増えたのかをここで確認できます。
同じモデル・同じGPUでも、推論エンジンの実装でスループットは数倍変わる。Continuous BatchingとPagedAttentionが何を解いているのかを計算で確かめ、Ollama・vLLM・SGLangから要件で選ぶ。
「27BだからこのGPU」では破綻する。要件から必要スループットを出し、メモリ収支と帯域の両面から、モデル・精度・GPUの候補を絞り込む手順を扱う。
容量・帯域・演算性能は別の指標である。LLM推論でどれが効くのかを、プリフィルとデコードの違いから整理する。
同時実行数とコンテキスト長に比例して膨らむ、サイジングの主役。計算式・GQA・PagedAttention・KV量子化を整理する。
パラメータ数、Dense と MoE、コンテキスト長、トークナイザ。AI基盤の設計に効くLLMの構造を、必要な深さだけ整理する。
メモリと帯域を減らす代わりに品質を差し出す技術。何が減り、何が減らないのか、どう検証するのかを整理する。
社内に散らばった10万件の文書に対して、そもそも何を解決したいのか。技術を選ぶ前に、機能要件・非機能要件・評価指標を先に固める。
外部API・Managed・Self-hostの3方式を、機密性・レイテンシ・コスト・運用能力で比較する。Self-hostが優れているから選ぶのではなく、要件から導く。
実際の導入事例を読み解きながらAWS公式ドキュメントでIAM権限モデルを深掘りし、AIエージェントを安全に本番運用するために押さえるべき認証・認可要件とAI特有の攻撃面を整理する。
同じCRM・SFAというアプリケーションを題材に、コンピューティングサービスの選定基準と、Levelが進むごとに結論が変わる理由を整理する。
架空のB2B企業が抱える、老朽化したオンプレミスCRM・SFAの現状と課題を整理する。
老朽化したオンプレミスCRMを、アプリケーションを大きく作り変えずに安全にAWSへ移行する。
利用者増加とEC2単一障害点への不安から、Auto ScalingとRDS Multi-AZで高可用化する。
単一EC2で運用していたCRMが高負荷になった際、CloudWatchでの確認からAuto Scalingによる改善までを追う。