仅需10万不到，DeepSeek R1 671B大模型本地部署实战指南

发布日期：2025-04-09 05:32:39 浏览次数： 2727

作者：口袋大数据

微信搜一搜，关注“口袋大数据”

最近帮一个朋友部署本地的671b版本的deepseek r1，需求是要完全本地部署，但是又不想花太高的成本，没有并发要求，我一想，用ktransformers框架来部署完全合适。

关于机器配置，在挑挑拣拣评比之后，设备选择如下，最终选择的是其中的服务器配置。

这套设备下来总成本不到10万，相比如动辄几百万的满血版deepseek R1或者花个五六十万买个deepseek 70b的一体机要值当的多，且不说70b并不是真正的deepseek r1，效果还不如32b的QWQ，就光说一体机的升级也是个麻烦事，买了机器基本就和模型绑定了，以后新模型出来后想升级就难了。

说起这个，我上个月去给政府某部门培训大模型时，还听到一个八卦，说有个公司，花了几百万让某个大厂私有化部署了一套定制的模型，但是deepseek r1出来后，直接弃用了，又去买了一套deepseek一体机。

而且这些公司买了一体机后，也还是不知道怎么用，就是搞个接口和页面，让员工来问下问题，就没了其他用途了。只能说，公司是真有钱。

基础配置

先说结论，使用Ktransformers框架，在上述图片的服务器配置上，速度能达到5token/s，考虑到Ktransformers目前还并不支持并发，本地私有化部署给少数人使用，这个速度还是勉强可以接受。

ktransformers官网文档的安装方式我之前已经写过一篇文章，ktransformers部署详细笔记。此处不再赘述。

这里我介绍一个这次我安装时发现的一个新的教程 r1-ktransformers-guide，提供了基于uv的预编译的环境，可以避免很多环境的依赖的报错。

同时要注意ubuntu版本要使用ubuntu22及以上，python版本为3.11。

NVIDIA驱动版本570.86.1x , CUDA版本12.8

然后Ktransfomers要使用0.2.2版本，目前最新版本0.3还存在很多的bug

git clone https://github.com/kvcache-ai/ktransformers.gitcd ktransformers git submodule init git submodule update git checkout 7a19f3b git rev-parse --short HEAD #应显示 7a19f3b

注意的是，git submodule update 主要是为了更新third_party中的项目

如果网络不好，可以直接github中下载这些项目并放到到third_party文件夹中

[submodule "third_party/llama.cpp"]        path = third_party/llama.cpp        url = https://github.com/ggerganov/llama.cpp.git[submodule "third_party/pybind11"]        path = third_party/pybind11        url = https://github.com/pybind/pybind11.git

下载模型

然后下载量化后的deepseek r1模型，这里我下载的是int4量化版本，因为网络问题，使用阿里的魔塔下载模型

modelscope download unsloth/DeepSeek-R1-GGUF --include "DeepSeek-R1-Q4_K_M/*" --cache_dir /home/user/new/models

--cache_dir /home/user/new/models 是制定模型下载路径的位置

uv安装

uv是一个用Rust语言编写的现代Python包管理工具，被称为"Python的Cargo"，它是pip、pip-tools和virtualenv等传统工具的高速替代品。速度比pip更快，而且还支持可编辑安装、git依赖、本地依赖、源代码分发等pip的高级功能。

安装uv工具链

curl -LsSf https://astral.sh/uv/install.sh | sh

创建虚拟环境

uv venv ./venv --python 3.11 --python-preference=only-managedsource  venv/bin/activate

然后我们就可以按照教程中的使用uv工具进行安装。

uv安装预编译版本

flashinfer-python是一个专为大型语言模型(LLM)推理服务设计的高性能GPU加速库。它主要提供以下功能：

 $ uv pip install flashinfer-python

这是安装ktransformers库的预编译版本：

$ export TORCH_CUDA_ARCH_LIST="8.6"uv pip install https://github.com/ubergarm/ktransformers/releases/download/7a19f3b/ktransformers-0.2.2rc1+cu120torch26fancy.amd.ubergarm.7a19f3b.flashinfer-cp311-cp311-linux_x86_64.whl

这是安装flash_attn库的预编译版本：

uv pip install https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.0.5/flash_attn-2.6.3+cu124torch2.6-cp311-cp311-linux_x86_64.whl

这里的预编译版本其实是这个文档的作者直接编译好的，虽然这个教程说明中提到仅适合RTX 3090Ti 24GB显存 + 96GB DDR5-6400内存 + Ryzen 9950X处理器。

但是我使用4090 24显存 + 500 DDR5-4800内存，使用这个预编译版本也可以安装成功的。如果这个预编译版本可以安装成功的话，很多潜在的因为版本不对造成的报错都可以避免掉了。

源码运行ktransformers

如果上面的预编译版本运行不了的话，又不想接着安装ktransfomers，其实也可以直接用源码来跑的，命令如下：


 支持多GPU配置及通过 `--optimize_config_path` 进行更细粒度的显存卸载设置PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True python3 ktransformers/server/main.py      --gguf_path /mnt/ai/models/unsloth/DeepSeek-R1-GGUF/DeepSeek-R1-UD-Q2_K_XL/     --model_path deepseek-ai/DeepSeek-R1 --model_name unsloth/DeepSeek-R1-UD-Q2_K_XL --cpu_infer 16 --max_new_tokens 8192 --cache_lens 32768 --total_context 32768--cache_q4 true--temperature 0.6 --top_p 0.95 --optimize_config_path ktransformers/optimize/optimize_rules/DeepSeek-R1-Chat.yaml --force_think --use_cuda_graph --host 127.0.0.1 --port 8080

是的，其实即使不编译ktransfomers，也是可以跑起来的。直接把项目下好，运行上面的命令，准备好相应的文件，就能正常运行了。

如果要继续编译ktransfomers的话，则可以按照下面的流程进行操作：

# 安装额外编译依赖项，包括CUDA工具链等，例如：# sudo apt-get install build-essential cmake ...source venv/bin/activateuv pip install -r requirements-local_chat.txtuv pip install setuptools wheel packaging# 建议跳过可选网站应用，使用`open-webui`或`litellm`等替代方案cd ktransformers/website/npm install @vue/clinpm run buildcd ../..# 如果拥有充足的CPU核心和内存资源，可显著提升构建速度# $ export MAX_JOBS=8# $ export CMAKE_BUILD_PARALLEL_LEVEL=8# 安装flash_attnuv pip install flash_attn --no-build-isolation# 可选实验性使用flashinfer替代triton# 除非您是已经成功上手的进阶用户，否则暂不建议使用# 使用以下命令安装：# $ uv pip install flashinfer-python# 仅适用于以下情况：# 配备Intel双路CPU且内存>1TB可容纳两份完整模型内存副本(每路CPU一份副本)# AMD EPYC NPS0双路平台可能无需此配置？# $ export USE_NUMA=1# 安装ktransformersKTRANSFORMERS_FORCE_BUILD=TRUE uv pip install . --no-build-isolation

如果想自己编译好后供其他环境使用的，则可以使用下面的命令进行环境编译。

KTRANSFORMERS_FORCE_BUILD=TRUE uv build

然后把生成的文件移动到其他环境安装则输入下面命令即可

uv pip install ./dist/ktransformers-0.2.2rc1+cu120torch26fancy-cp311-cp311-linux_x86_64.whl

ktransformers运行

接口运行命令

ktransformers --model_path /home/user/new/ktran0.2.2/ktransformers/models/deepseek-ai/DeepSeek-R1  --gguf_path /home/user/new/models/unsloth/DeepSeek-R1-GGUF/DeepSeek-R1-Q4_K_M   --port 8080

如果想运行网页版本，则再最后增加 --web True参数即可。

其他问题

如果使用了不支持amx的cpu，可能会遇到下面的报错

/tmp/cc8uoJt1.s:23667: Error: no such instruction: `vpdpbusd %ymm3,%ymm15,%ymm1'的报错，File "<string>", line 327, in build_extension     File "/usr/local/python3/lib/python3.11/subprocess.py", line 571, in run       raise CalledProcessError(retcode, process.args,   subprocess.CalledProcessError: Command '['cmake', '--build', '.', '--verbose', '--parallel=128']' returned non-zero exit status 1.   [end of output]

这是因为CPU架构不支持这些指令：编译时使用了-march=native参数，这会让编译器生成针对当前CPU优化的代码，包括使用特定的指令集。但如果当前CPU不支持AVX-VNNI指令集，就会出现这个错误。

解决方案：在CMake配置中添加以下选项：

-DLLAMA_NATIVE=OFF -DLLAMA_AVX=ON -DLLAMA_AVX2=ON -DLLAMA_AVX512=OFF -DLLAMA_AVXVNNI=OFF

就可以让cpu不使用amx指令集，从而避免这个报错了。

另外，如果需要我环境的requirements.txt, 可以在后台回复330获取。

写在最后

2025年的今天，AI创新已经喷井，几乎每天都有新的技术出现。作为亲历三次AI浪潮的技术人，我坚信AI不是替代人类，而是让我们从重复工作中解放出来，专注于更有创造性的事情，关注我们公众号口袋大数据，一起探索大模型落地的无限可能！

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-06-19

从 BERT 标注到 Agent Skill：短文本标签体系的四次“工业革命”

2026-05-14

多轮 Agent 场景下，滴滴的 EAGLE-3 训推加速实践

2026-05-06

谁说 Mac 只能写代码？Google 官宣：M 芯片本地微调 Gemma 4 时代开启！

2026-04-20

用 Unsloth 微调 Embedding 模型，让你的 RAG 检索不再答非所问

2026-04-15

ComfyUI v0.19.0 更新：大量新节点、新模型、新修复与性能优化全面落地，工作流与训练能力再升级

2026-04-13

Agent 持续学习落地路径：先做 Traces，再做 Context，最后才微调模型 | Jinqiu Select

2026-03-23

养死四只龙虾的小白有感

2026-03-22

Mistral Forge 的真正意义：企业AI从“租用”走向“拥有”

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

ComfyUI v0.19.0 更新：大量新节点、新模型、新修复与性能优化全面落地，工作流与训练能力再升级

2026-04-15

Agent 持续学习落地路径：先做 Traces，再做 Context，最后才微调模型 | Jinqiu Select

2026-04-13

用 Unsloth 微调 Embedding 模型，让你的 RAG 检索不再答非所问

2026-04-20

谁说 Mac 只能写代码？Google 官宣：M 芯片本地微调 Gemma 4 时代开启！

2026-05-06

多轮 Agent 场景下，滴滴的 EAGLE-3 训推加速实践

2026-05-14

从 BERT 标注到 Agent Skill：短文本标签体系的四次“工业革命”

2026-06-19

大家都在问

DeepSeek 发布新论文，提出全新 MHC 架构，有何创新与应用前景？

2026-01-02

LoAR做Fine-Tuning微调原理到底是什么？

2025-11-19

如何将 AI 代码采纳率从30%提升到80%？

2025-09-25

大模型微调，为什么99%的企业都不应该碰这个坑？

2025-06-20

万不得已，不要对 LLM 进行微调？

2025-06-17

可以将任何符合OpenAPI规范的接口转 MCP Server吗？

2025-05-21

OpenAI发布GPT-4.1系列模型，对行业最大吸引力是什么？

2025-05-17

私有部署大模型需要多少显存？

2025-05-14

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

186 6662 7370

预约演示

185 8882 0121

微信扫码

添加专属顾问

回到顶部

扫码登录

登录即表示您同意《53AI网站服务协议》

服务协议

欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。

一、定义

本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。

会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、账号注册与登录

登录方式：本网站支持以下登录方式，您可根据实际情况选择：

微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。

手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。

账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。

实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。

未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。

三、服务内容与规范

知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。

服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。

禁止行为：您在使用服务时不得实施以下行为：

利用技术手段批量爬取、下载、转存知识库内容；

将知识库内容用于商业目的或未经授权地向第三方传播；

干扰本网站正常运行或侵犯其他用户合法权益；

发布违法违规信息或从事违反公序良俗的活动。

四、知识产权声明

权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。

有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。

五、个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、免责声明

内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。

不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。

第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。

七、违约责任

如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。

八、法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、其他

本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。

我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。

已查阅