今天几条新闻放一起看挺有意思的:
-
Mistral 发了 Large 4,1T 参数开源权重,外号 le Chonk。HN 上一千多条评论在吵,开源模型是不是真能追上闭源第一梯队。参数是真大,但谁跑得动是另一回事。
-
同一天另一个趋势是 AI 太贵了,不少公司在往便宜模型迁。一边是开源模型越做越大,一边是企业在砍成本,这两件事放一块儿看有点割裂。
-
Google 给 Constellation 签了 3.6GW 的电力合同,四分之一是新建核电。以前是抢卡,现在是抢电,数据中心的瓶颈换地方了。
-
Google 还发了 EmbeddingGemma 2,740M 的多模态 embedding 模型。这种小而专的模型我反而更感兴趣,小鸡上能跑的才是自己的。
问个问题:你们自托管跑过的最大模型是多少 B?是在 VPS 上跑的还是家里机器?我这边 M1 Max 跑 35B 量化已经只剩 7 tok/s 了,再大就纯属行为艺术。
开源1T也不算多大吧
跑优化的枝剪版千问小模型还有很多枝剪版,有8g或者16g就能跑35b吧,4070ts 16g能跑90token/s
转人工
1T不算啥,Kimi K3比他大好多吧。
性价比才是王道