我用这种方法,一句命令部署Kimi K3 到自己电脑!
你好, 我是郭震!
Kimi K3,很火!
就连我的导师,都主动和我聊这个模型,看来海外也是具有相当知名度。
尝试把Kimi K3的推理迁移到咱们自己的电脑,玩一下,感兴趣的可以看看这篇文章。
文章结构首先介绍K3,中间介绍微调过程,最后介绍本地使用方法,其实就一句命令,完全免费,只供个人使用。
1 Kimi K3
当我看到这个榜单,有点小惊讶的,智能体能力接近或竟然超越Fable 5 和 GPT-5.6 Sol:

比如在 AutomationBench、SpreadsheetBench 2 和 BrowseComp 三个真实 Agent 榜单上同时拿下第一。更狠的是,它还开源了:

作为开放模型,综合表现已经正面压过 GPT-5.6 Sol、Claude Fable 5 等顶级闭源模型。
有读者可能会问,K3这么强,为什么还要开放权重?
开放可以快速建立全球影响力,吸引开发者、云厂商和推理框架接入。
更关键的是,K3虽然开放了完整模型权重,但它有2.8万亿总参数、每个token激活1040亿参数,部署门槛极高,一般公司很难真正跑起来,所以开放权重并不会让官方API失去价值,反而能用生态和口碑进一步放大K3的商业价值。
2 微调教程
有朋友跟我反馈Kimi K3的算力,现在也不太容易使用上,比较紧缺。
我们自己电脑要想使用到它的能力,可以通过监督微调,迁移它的推理能力到更小的开源模型,比如Qwen3.5:4B这样的模型中。
本文我使用这种思路,监督微调出:Qwen3.5-4B-Kimi-K3
第一步,搜集数据,看下搜集的数据分布,一共覆盖5个领域:数学,代码,规划,数据分析,错误反思;难度分为3层,推理级别Low、High和Max:

训练数据长这样:

推理Token,长度分布从两位到四位数,最长有8200个Token:

两天4个小时搜集了100条数据,做SFT玩一下。有时间的可以搜集2K-4K数据,微调效果会更好。
如上所示数据分布,难度,推理级别布局还可以,这为后续监督微调(SFT)提供基础。
有了数据,第二步微调。使用的环境是 RTX 5090 的 Windows 电脑,PyTorch 2.11、CUDA 12.8:

训练栈使用 Unsloth、Transformers 5.5 和 TRL 0.24.0,通过 LoRA 微调 Qwen3.5-4B。
由于Win 缺少 causal-conv1d 等 CUDA 扩展,我切换到了 Transformers 官方 PyTorch 回退内核,虽然速度稍慢,但可以直接训练。
SFT 的学习方式是:每条样本把“问题”作为输入,把 推理过程 + 最终答案 作为监督目标
训练时对回答部分的每个 token 计算交叉熵,逐个预测下一个 token,预测错了就通过反向传播更新 LoRA 参数。
如下训练过程快照:1 step 实际耗时 5.45 秒,峰值显存 26G:

这个快照,峰值显存能到31G,基本占满32G显存:

训练2个epoch,模仿Kimi已接近80%,八成像了:

平滑趋势整体下降,0.7下降到0.5,感兴趣的可以根据验证集,继续挑选出最好的checkpoint
接下来就可以愉快的使用了,如下加载微调后的大模型:
Set-Location "C:\Users\guozh\Documents\work\gzh\qwen35-4b-sft"
.\run_chat.cmd

先来个问候,如下所示,红框所示为Kimi K3的思考过程:

接下来问一个Python问题,看到这个思考过程,截图只是其中一小部分,分析的

再问一个稍难点的问题,重点看它的思考Token:

如下是Qwen3.5:4B原生的思考Token,都是同一个问题:

可以看到咱们随便demo的100条数据,经过微调后, 和原生的思考Token已经彻底不同。
并且我去比较看了下Kimi的思考Token,它确实喜欢以用户开头:

看到上面K3的三次回答,两次出现用户开头,模仿它的思考过程,还是有感觉。
3 本地部署
cmd中使用不是那么友好,所以直接接入到ollama中,使用UI界面也更好一些,如下所示,选择这个模型:

思考Token有K3的风格了,是比较规整的几段思考过程:

回答部分截图:

本地安装方法,我也给你找到最精简的方法,最后经过一顿折腾,就是这一行命令:
ollama pull guozhennianhua/qwen3.5-4b-kimi-k3
本文部署教程,完全免费,只供个人使用。
最后总结一下
大家都很喜爱Kimi K3,但是原装参数太大了,根本无法本地部署,所以使用微调方法迁移能力到本地可操作的Qwen3.5:4B模型中。
实测下来,模型的思考方式确实发生了变化,并
常见问题
我用这种方法,一句命令部署Kimi K3 到自己电脑!测了什么?
看 AI消息 的实际效果、使用门槛和结果表现。
我用这种方法,一句命令部署Kimi K3 到自己电脑!适合谁看?
适合正在选工具、做本地部署或验证 AI 工作流的人。
我用这种方法,一句命令部署Kimi K3 到自己电脑!要注意什么?
重点看配置成本、失败点、数据边界和可替代方案。
相关内容