Reddit热议!llama.cpp火速支持DeepSeek V4 Flash加速推理
2026-08-03 01:09:56
141次阅读
2个评论
llama.cpp刚合并了DeepSeek V4 Flash的MTP/DSpark支持,网友实测生成速度大幅提升。有用户用DSpark草稿模型将速度从20t/s拉到28-30t/s,还有人在8块RTX 3090上从35涨到50t/s,但需注意当前GGUF文件多数未包含草稿模块,需手动下载。
0
0
2026-08-03 01:10:29

回复 |
引用
2026-08-03 01:10:58

回复 |
引用
共2条
1
相关帖子
- Reddit热议!llama.cpp正式支持DFlash,AI推理速度再提升
- llama.cpp MTP支持进入beta 本地大模型推理大幅提速
- Reddit热议!DeepSeek V4 Flash本地运行表现惊艳
- Reddit热议!DeepSeek V4 Flash更新,性能碾压GLM 5.2
- Reddit热议!DeepSeek V4 Flash ARC-AGI高分遭质疑
- Reddit热议!DeepSeek V4 Flash跑分遭质疑:超时作弊?
- Reddit热议!llama.cpp距离CPU推理提速仅差50个PR
- DeepSeek V4 Pro/Flash上线HuggingFace,网友热议参数与运行门槛
- Reddit热议!DeepSeek V4 Flash开源模型性能炸裂,直逼顶级闭源?
- Reddit热议!DeepSeek v4 Flash权重发布,老外直呼OpenAI降价被逼?