既定経路
Qwen3.8 27B をローカル、単一ユーザー、単一ストリームで使い、安定した MTP/投機的ドラフトを通常経路とします。SGLang と DFlash/DFlash2 は既定中央値に含めません。
ModelDock リサーチ
ワークロード
読み取りはプロンプト、ファイル、履歴の取り込み、書き込みは回答生成です。長文書やコーディングは読み取り寄りのため、既定値は 75% 読み取り / 25% 書き込みです。安定した MTP は別シナリオではなく通常経路として扱います。
モデル量子化
2× GPU 構築メモ デュアルカード構成では、幅広カード用のケース余裕とスロット間隔、余裕ある安定電源と冷却が必要です。導入とマルチ GPU スケジューリングも単一カードより複雑です。
| ハードウェア | 能力 | ワークロードの経済性 | 根拠 | 市場 | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
前提
75% reading / 25% writing · 24 active h/day
システム全体の電力 · Qwen3.8 27B · 通常のローカル利用
透明な計算
GPU システム総額 = GPU 価格 + $1,000 ホストローカル $/MM =(電力費 + ハードウェア配賦)/ 1 日の処理量損益分岐日数 = システム総額 /(API 相当額/日 − 電力費/日)単一ユーザーの逐次モデル:読み取り時間 + 書き込み時間。同時実行や重なりは想定しません。
根拠データ
公開済みハードウェアレコードの情報源分布を開きます。
方法
性能には、情報源を確認できる MTP 対応中央値を使用します。経済性はベンチマーク実行ではなく利用方法を表すため調整可能です。
Qwen3.8 27B をローカル、単一ユーザー、単一ストリームで使い、安定した MTP/投機的ドラフトを通常経路とします。SGLang と DFlash/DFlash2 は既定中央値に含めません。
読み取り(prefill)と書き込み(decode)は別々に中央値を取ります。Median をクリックすると、量子化、コンテキスト、ランタイム、トポロジー、ドラフト深度を確認できます。
Median は情報源分布にリンクします。~ 速度推定は測定・報告済みデータから帯域幅換算した値で、情報源中央値とは分離します。Pending は通常レーンの情報源指標が未収集であることを示します。
単体 GPU 構成のシステム総額には、記録された GPU 価格に $1,000 のホスト/プラットフォーム予算を加えます。損益分岐は、システム総額を 1 日の API 相当額から直接電力費を引いた値で割ったもので、投資収益を保証しません。