[NS :
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25Token/s伯克利、MIT等研究者开源FreeToken。这是一个专门为本地设备设计的MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让CPU和GPU一起参与推理。FreeToken会
coolpool] FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/sFreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25Token/s伯克利、MIT等研究者开源FreeToken。这是一个专门为本地设备设计的MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让CPU和GPU一起参与推理。FreeToken会