DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

liuqjox (via kvcache-ai/ktransforme… 使用 DeepSeek-V2.5 (Dec) 处理真实任务执行

liuqjox (via kvcache-ai/ktransformers) 公开的真实任务执行案例,来源为 公开代码库,复核于 2026-06-27T02:50:00Z。

原始记录:KTransformers 用户在消费级硬件上本地部署 DeepSeek-V2.5-1210 236B 实现高效推理

A

Chinese Brief

中文案例导读

liuqjox (via kvcache-ai/ktransformers) 公开的真实任务执行案例,来源为 公开代码库,复核于 2026-06-27T02:50:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商DeepSeek
模型DeepSeek-V2.5 (Dec)
任务类型真实任务执行
审核状态auto_approved

任务

真实任务背景

用户 liuqjox 使用 KTransformers 框架在 Windows/WSL 环境下本地部署量化版 DeepSeek-V2.5-1210 (Q2_K_L 量化, 236B 参数, 80.5GB)。硬件配置为 RTX 3090 + 96GB DDR4 3200 + i7-10700K, 环境为 Win10/WSL/Ubuntu/CUDA 12.4/PyTorch 2.6。目标是在不到一万元的消费级硬件上运行 236B 参数大模型进行本地推理。

真实任务执行公开代码库A 类可核验real_case
公开产物

成功实现本地推理,速度稳定在 4-6 tokens/s(初始较慢约 1 tps)。同时验证了更大量化的 DeepSeek-R1 671B (unsloth 2.51 bit, 212GB) 也可运行但速度极慢(0.05 tps)。用户指出 x99 主板 + 256G 内存方案成本不到一万元即可运行 671B 模型。

模型作用

DeepSeek-V2.5-1210 提供了 236B 参数的开放权重模型,其 MoE 架构配合 KTransformers 的 CPU/GPU 异构推理技术,使得在单卡 RTX 3090 + 96GB 内存的消费级硬件上即可实现可用的本地推理(4-6 tps),证明了该模型在资源受限场景下的实用价值。

风险边界

Issue 状态为 open 但用户已确认部署成功;量化版本 Q2_K_L 可能有精度损失;速度数据基于特定硬件配置,不同配置可能差异较大。