@电动面包 #10 发布于2026/10/9 00:45:02 看你预算,我就在帮别人做这个事。 今天H100八卡的深圳自提价是350-370万,然后可以部署一些满血大模型的量化版本,接近真正满血。 可以达到使用同模型官方API类似的水平。 📋 8卡 H100 部署实战小结 顶级 MoE 模型 8卡机器推荐量化 静态权重占用 KV Cache 剩余空间 综合性能保留度 DeepSeek-V3 (671B) 4-bit AWQ ~380GB 260GB (非常充裕) ~96% (推荐单机部署) Qwen3-Coder (480B) FP8 ~480GB 160GB (中等并发) ~99.5% (完美满血无损) GLM-5 系列 (744B) 3-bit / Mixed ~310GB 330GB (专为超长文本留空) ~90% (智商略微受损) 如果你的业务对 GLM-5 的长文本或 DeepSeek-V3 的满血性能有硬性要求,通常业界会选择升级到 2台 8卡 H100 互联(共 16 卡),或者使用单台 英伟达 H200 / B200 节点(拥有更大的单卡 141GB/192GB 显存)。 想看看功耗多少
本地模型哪里有网上的更新快呢
前几天看着在搞什么16G显存左右拿下千问某个模型的,但是实际上翻了不少评论,都在说蠢,感觉完全没必要
想看看功耗多少
本地大模型的优点是无审查,请注意
@C63 #13
网上公开信息随便都能查到
除非你搞得是企业自建的那种,极度看重数据安全和隐私性的

否则一般都建议直接订阅大模型
自建就是给自己找个运维的活儿干,啥啥都自建就是全栈运维
现阶段订阅远比自部署省钱还快,除非你对无审查刚需,不然还是等ai进化速度慢下来再说吧
@电动面包 #10 350-370万?
这成本 还买来个半弱智的东西 极度不划算啊 现在本地模型和订阅的能力差距太大了
基建成本太高了吧