默认路径
Qwen3.8 27B 在本地、单用户、单流条件下运行,稳定 MTP/推测解码草稿视为常规路径。SGLang 与 DFlash/DFlash2 不计入默认中位数。
ModelDock 研究
你的工作负载
读取是模型摄入提示词、文件和聊天历史;写入是模型生成答案。长文档和编程会话通常偏重读取,因此默认从 75% 读取 / 25% 写入开始。稳定 MTP 视为常规路径,而不是单独场景。
模型量化
2× GPU 装机提示 双卡机器需要为宽卡预留机箱空间和插槽间距,具备稳定且余量充足的供电与散热;安装和多 GPU 调度也比单卡节点更复杂。
| 硬件 | 能力 | 当前负载经济性 | 证据 | 市场 | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
假设
75% reading / 25% writing · 24 active h/day
整机功耗 · Qwen3.8 27B · 常规本地使用
透明计算
GPU 整机总价 = GPU 价格 + $1,000 主机本地 $/MM =(能耗 + 硬件摊销)/ 每日产能回本天数 = 整机总价 /(每日 API 等值 − 每日能耗)单用户顺序模型:读取时间 + 写入时间;不假设并发或重叠。
证据数据
打开已发布硬件记录背后的来源分布。
方法
性能采用来源可见、MTP 就绪的中位数。下方经济性可调,因为它描述你的使用方式,而不是基准运行本身。
Qwen3.8 27B 在本地、单用户、单流条件下运行,稳定 MTP/推测解码草稿视为常规路径。SGLang 与 DFlash/DFlash2 不计入默认中位数。
读取(prefill)与写入(decode)分别取中位数。点击 Median 后仍可查看量化、上下文、运行时、拓扑和草稿深度等来源条件。
Median 链接到来源分布。~ 速率估算根据已测量和已报告的读取/写入数据按带宽缩放,始终与来源中位数分开。Pending 表示尚未收集常规路径来源指标。
独立显卡整机总价由记录的 GPU 价格加 $1,000 主机/平台预算构成。回本期以整机总价除以每日 API 等值减直接电费计算,不构成投资回报保证。